DeepSeek Harness Hub
← 返回列表

PensiveFei/dsh-voice-scribe

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
✓ 可直接安装

DSH 专属语音输入插件:点按或按住 Alt 说话、松开/再点按转文字,结果追加到输入框草稿末尾不覆盖已输入内容。

自动检查通过:npm 包已发布且 engines 声明满足基线(声明 Node >=18);该结论来自程序自动检查,未经人工实机验证。 · 最近上游提交 2026/9/17 · 已提供中文文档

DSH 语音输入插件:点击 Alt 说话,文本自动填入输入框。默认使用 Web Speech(零配置),可选 OpenAI 兼容 ASR,通过 DSH LLM 进行润色。

综合分
47.9
GitHub 分
47.9
用户评分
★ Stars
32
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add dsh-voice-scribe
npm 包 dsh-voice-scribe 已校验归属本仓库,走 npm 安装最省事
🟢实装验证通过· 2026/9/19
由 dsh-plugin-verify(GitHub Actions)在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查✓ 自动检查通过

以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。

npm 包dsh-voice-scribe @ 0.4.9
Node 引擎要求 >=18 · 基线 Node 22.19 满足
dsh CLI 依赖未声明 dsh 版本约束
入口文件main/exports/bin 已声明

验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/17 21:22:13

依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-llm
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-voice-scribe

MIT license
release
CI
npm version
npm downloads
dsh.so risk
dsh.so install
Listed in awesome-dsh-plugin

DSH 专属语音输入插件:点按或按住 Alt 说话、松开/再点按转文字,结果追加到输入框草稿末尾(不覆盖已输入内容)。
Voice input for DeepSeek Harness: tap or hold Alt to talk, get text in the composer.

⚠️ 非官方插件,与 DeepSeek / 深度求索公司无关联。使用前请阅读 SECURITY.md。

安装 Install

dsh plugin --profile web add dsh-voice-scribe   # 重启 dsh web 后生效

使用 Usage

- 麦克风按钮:输入框右侧 🎤 图标,点击开始说话、再点停止并转写(按钮录音中变红)
- 热键:点输入框 → 按 Alt 开始说话 → 再按 Alt 结束并转写(备选 Alt+空格;设置 → 语音输入 → 热键可选「自定义」,录制任意组合键,如 Ctrl+Shift+V、F9、Alt+Space)
- 按住说话:设置 → 语音输入 → 触发方式 可选「按住说话」——按住热键录音、松开自动转写(麦克风按钮同样支持);自定义组合键在按住模式下同样生效(松开组合键中的任意一键即结束)
- 实时中间结果:说话时识别文本实时出现在草稿里(浏览器引擎逐字、本地引擎每 3 秒刷新),停止后替换为最终结果
- 录音电平指示:录音中状态条下方显示实时电平条
- 麦克风设备:设置 → 语音输入 → 麦克风设备 可指定用哪一路输入,录音中状态条会显示实际生效的设备名(见下文「麦克风设备」)
- 最长录音时长:本地引擎约 4 分钟、云端 10 分钟,到时长自动停止并转写
- 切窗取消:录音中切到其他窗口自动取消本次录音(Alt+Tab 误触不会留下录音)

识别引擎 Engine(默认「自动」,零配置)

| 引擎 | 说明 |
|---|---|
| 自动(默认) | 本地离线识别优先;不可用时自动回退浏览器识别 |
| 本地离线识别 | SenseVoice,零配置零 key、音频不出本机;首次使用自动下载模型(约 230MB,国内镜像,只需一次) |
| 浏览器 Web Speech | 零配置;依赖 Google/Microsoft 服务(国内 / Edge Stable 可能不可用) |
| 云端 ASR(可选) | 服务链:可配置多个 OpenAI 兼容端点按序尝试、失败自动切换;需在设置中配置 API key |

浏览器识别依赖外部语音服务(Chrome 在大陆被墙、Edge Stable 有已知回归),故默认以本地识别为主。

云端 ASR 服务链示例:Groq(免费层)→ 硅基流动 SenseVoice → 阿里云百炼,任一失败自动尝试下一个(设置 → 语音输入 → 云端 ASR)。

识别语言 Languages

支持 中文 / English / 粤语 / 日本語 / 한국어(设置 → 语音输入 可选)。本地离线识别自动检测语言;所选语言作用于浏览器与云端识别。

麦克风设备 Microphone

getUserMedia({ audio: true }) 的「默认设备」由浏览器决定,不等于 Windows 的默认设备:Chrome 优先用站点在 chrome://settings/content/microphone 里的选择,没有选择时按它自己 profile 里的设备排序——而排序第一名可能是纯静音的虚拟设备(典型:装过 Steam 之后的 Steam Streaming Microphone)。症状极具误导性:状态条显示「🎙 录音中…」、电平条不动、转写结果为空,看起来像插件坏了。

现在的行为:

- 设置 → 语音输入 → 麦克风设备:可选「系统默认(由浏览器决定)」或指定某一路输入(按浏览器持久化);指定后以 deviceId: { exact } 精确请求,不再交给浏览器解析;
- 录音中状态条会显示实际生效的设备名(取自 track.label),设置页也会显示「上次录音实际使用的是:…」——设备选错一眼可见;
- 转写为空时,若这一轮采集到的峰值 ≈0,提示会追加「输入电平≈0」,把「录到了静音」和「识别没听清」区分开;
- 选定的设备被拔掉/禁用后会自动回退到系统默认设备并在状态条说明,不会卡在 OverconstrainedError 上;
- 设置页只用 enumerateDevices(),不会为了列设备而打开麦克风(未授权时显示占位名,授权一次后显示真实名称),并跟随蓝牙设备上下线自动刷新列表。

该设置作用于插件自己的录音路径(本地离线识别 / 云端 ASR,以及麦克风按钮在这些引擎下的录音)。浏览器 Web Speech 由浏览器直接采集,插件无法指定其设备——那条路径请改用浏览器的站点麦克风设置,或切换到本地/云端引擎。

排查顺序:

1. 先看设置页里的「实际使用的设备」是不是你想用的那一路,不是就直接选;
2. Chrome 用户再看一眼 chrome://settings/content/microphone(站点级选择优先于系统默认);
3. Windows 还有按应用的设备策略:设置 → 隐私和安全性 → 麦克风 里给浏览器指定的设备优先于系统默认,且改系统默认无效,需要把该应用的选择清掉;
4. 电平条一动不动 + 提示「输入电平≈0」= 采集端本身就是静音(虚拟声卡、被静音的硬件、被独占占用),不是识别问题。

热词替换表 Hot Words(可选)

把识别错的人名、术语、项目名替换回来:编辑 $DSH_HOME/voice/hot.txt(每行一条,修改后下次转写生效):

字面替换(不区分大小写):正确词=错误词1|错误词2
DeepSeek=deep seek|迪普西克
王小明=王小铭

正则替换(标准 $1 语义;未写 flags 时默认全局替换,写 g/y 则按原样使用)
/老\s师/老师/
/\{([^}]+)\}/【$1】/
/deep\sseek/DeepSeek/gi

设置 → 语音输入 页面会显示热词表状态(规则条数 / 文件路径 / 解析错误)。云端与本地离线引擎的转写结果统一应用。

自定义润色提示词(可选)

设置 → 语音输入 → 开启润色后:

- 润色模型:下拉选择复用的 DSH 模型(选项来自 DSH 已配置的 provider,首次开启自动选中第一个)
- 润色提示词:可自定义(多行,保存在服务端);留空或「恢复默认」使用内置的最小必要修正提示词

润色时会先做一步本地规则预润色(去「嗯/呃」等口头禅、折叠多余空格),再把更短更干净的文本交给 LLM,省 token;LLM 失败时仍保留原始转写。

隐私 Privacy

本地引擎音频不出本机;Web Speech 由浏览器语音服务处理;云端 ASR 的 key 只存服务端。

与同类插件对比 Compare

同为 DSH 的语音 / 输入增强插件,主要差异(截至 2026-09):

| | dsh-voice-scribe(本插件) | dsh-better-input |
|---|---|---|
| 定位 | 专注语音输入 | 输入增强套件(语音 + 提示词优化 + 文件转 Markdown 等) |
| 本地离线识别 | ✅ SenseVoice,零 key,音频不出本机 | ❌ 仅浏览器原生识别 |
| 浏览器 Web Speech | ✅ 回退 | ✅ |
| 云端 ASR 服务链 | ✅ 多 provider 故障切换 | ❌ |
| 热词替换表 hot.txt | ✅ | ❌ |
| 本地规则预润色(省 token) | ✅ 0.4.2 起 | ❌ |
| AI 润色(复用 DSH 模型) | ✅ | ✅ |
| 按住说话 / 录音电平 | ✅ | 录音自动停止(无电平) |
| 提示词优化 / 文件转 Markdown | ❌ | ✅ |

只想要更省心、更私密的语音输入 → dsh-voice-scribe;需要一整套输入增强(提示词优化、文件转 Markdown) → dsh-better-input。两者可并存。

已知限制 Known limitations

- 输入框里含 @ 引用芯片(如 @文件)时,DSH 只提供「整段替换草稿」的接口,转写结果插入会把芯片展开成纯文本;先发送或清空草稿再听写可避免。
- 浏览器 Web Speech 依赖外部语音服务,国内网络下通常需要改用本地离线或云端引擎。

兼容性 Compatibility

- 需要 DSH 0.1.0-rc.6 及以上;peer 范围显式列出每条已发布的预发布线(0.1.1-rc / 0.1.2-alpha / 0.1.3-alpha / 0.1.5-alpha / 0.1.6-alpha),semver 的预发布规则要求逐条列出元组,否则该线宿主会一直收到 unmet-peer 告警。
- 输入框插槽 conversation.input.right 在 DSH 0.1.2 起由  改为 Lexical contenteditable:0.4.8 起两种形态都支持(读取实时草稿走 useInput,写入走 inputActions.setDraft)。
- 界面没有麦克风按钮(旧壳子没有该插槽)时,Alt 热键仍然可用。
- 实测核对:0.4.10 逐文件对照了 DSH 0.1.5-rc.1 与 0.1.2-rc.1 —— 宿主端 dsh-host-webserver 两份字节一致,webServer / webRuntime / llm 三个服务与 ctx.llm.prepareCall / 流式 text-delta / finish.reason 均无变化;客户端 dsh-client-modules / dsh-client-ui-renderer / dsh-client-locale / dsh-client-ui-settings 四份字节一致,插槽注册、setDraft、useInput(s => s.draft)、[data-composer-card] + contenteditable 的 DOM 形态全部不变。

开发 Dev

npm test          # 测试
npm run lint      # 语法检查
npm run security  # 密钥/路径泄露扫描

License

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

同作者(PensiveFei)的其他插件

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群