← 返回列表
未验证
按住麦克风说话,实时转成中文写进聊天输入框
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/15 · 已提供中文文档
DeepSeek Harness 的按键说话语音输入插件(Web Speech API)
综合分
27.5
GitHub 分
27.5
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add hajixiaolei-art/dsh-client-ui-voice该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
dsh-client-ui-voice
给 DeepSeek Harness Web 界面加一个按住说话的语音输入按钮:鼠标按住 🎤 对着麦克风说话,实时转成中文写进聊天输入框;松开鼠标即停止录入。
一个纯浏览器端的 Cordis 客户端插件(dsh.client),无需后端、无需 API key。
功能
- 在聊天输入框右下角(发送按钮旁)添加一个麦克风按钮
- 按住说话 → 实时识别 → 松开停止
- 识别文字追加到输入框已有内容的末尾
- 基于浏览器原生 Web Speech API(SpeechRecognition),zh-CN + 连续识别 + 实时中间结果
- 无需任何后端服务或 API key
安装
插件以 out-of-tree 包的形式安装到 web profile:
1. 放到 web profile 的 node_modules
mkdir -p "$HOME/.dsh/profiles/node_modules/@local"
cp -r . "$HOME/.dsh/profiles/node_modules/@local/dsh-client-ui-voice"
2. 在 $HOME/.dsh/profiles/web/cordis.patch.yml 顶层数组里加入:
- insert:
- id: ui-voice
name: '@local/dsh-client-ui-voice'
3. 重启 web 服务(客户端插件表在启动时快照,新插件需重启才会被扫描):
dsh web
重启后刷新浏览器页面,打开任意会话即可在输入框右下角看到 🎤 按钮。
使用
1. 打开一个会话
2. 按住 🎤 按钮 → 对着麦克风说话
3. 识别文字实时写入输入框
4. 松开 → 停止录入
工作原理
- package.json 里的 dsh.client 声明这是一个 web 平台的客户端插件,依赖 @deepseek-ai/dsh-client-runtime 和 @deepseek-ai/dsh-client-ui-conversation。
- lib/index.js 是 node 半边(空 apply,仅为了让 host 侧 row 激活)。
- lib/client.js 是浏览器半边(window.__ModuleLoader__.load 格式):
- 通过 slots.inject("conversation.input.right", …) 把按钮注册到输入框工具行右端(session 作用域);
- 组件拿到 session 标准 kit 的 inputActions.setDraft(),把识别结果直接写进输入框;
- 语音识别用 SpeechRecognition(webkitSpeechRecognition),按住 start()、松开 stop()。
目录结构
.
├── package.json # 声明 dsh.client(platform=web)
├── lib
│ ├── index.js # node 半边(空插件)
│ └── client.js # 浏览器半边(按钮 UI + 语音识别)
├── README.md
└── LICENSE
卸载
1. 删除 cordis.patch.yml 中的 ui-voice 段;
2. 删除 $HOME/.dsh/profiles/node_modules/@local/dsh-client-ui-voice/;
3. 重启 dsh web。
注意事项
- 浏览器支持:仅 Chromium 系(Chrome / Edge)支持 Web Speech API;Firefox / Safari 不支持。
- 网络:Chrome / Edge 的语音识别走 Google 服务,中国大陆网络下可能不稳定或不可用。若识别无反应,可换用带 API key 的第三方识别方案(阿里云 / 讯飞 / OpenAI Whisper 等)。
- 权限:首次按住说话时浏览器会弹出麦克风授权,请点击“允许”。
贡献者
- 哈基小磊 (hajixiaolei-art) —— 发起者 & 维护者
- DeepSeek(AI 助手)—— 插件设计 & 代码实现
License
MIT © 2026 哈基小磊 (hajixiaolei-art)扫码进群