DeepSeek Harness Hub
← 返回列表

wkfedor/deepseek-harness-voice-input

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

DeepSeek Harness 的语音输入与语音转文字

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/22 · 已提供中文文档

DeepSeek Harness (dsh) 的本地语音输入和语音转文字插件,由多语言 Whisper 提供支持。

综合分
27.2
GitHub 分
27.2
用户评分
★ Stars
0
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add wkfedor/deepseek-harness-voice-input
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

DeepSeek Harness 的语音输入与语音转文字

为 DeepSeek Harness(dsh)Web UI 添加语音输入、麦克风听写和本地语音转文字功能。
这个 DeepSeek Harness 插件在浏览器中录制语音,并使用多语言 Whisper 在本地进行转写。它可在 Firefox、Chrome、Chromium、Edge 和 Safari 中运行,无需浏览器扩展或云端语音识别服务。

当你想在 DeepSeek Harness 对话编辑器中口述提示词而不是手动输入时,可以使用它。音频始终保留在运行 Harness 的计算机上。

功能特性

- 一个集成到 DeepSeek Harness 提示输入框中的麦克风按钮。
- 由 Whisper、Transformers.js 和 ONNX Runtime 驱动的本地、私密语音转文字。
- 多语言语音识别,包括英语和俄语语音输入。
- 通过 getUserMedia 和 Web Audio API 实现跨浏览器录音。
- 首次运行时可见的模型下载,带有百分比、字节数、速度、取消和重试控件。
- 持久化的设置状态:刷新页面不会启动重复的模型下载。
- 无需 Python、pip、ffmpeg、管理员权限、浏览器扩展或外部语音 API。

安装 DeepSeek Harness 语音输入插件

将该包安装到标准的 web 配置文件中:

dsh plugin --profile web add github:wkfedor/deepseek-harness-voice-input

此包是 Cordis 插件,而不是配置文件捆绑包。请将其添加到
$DSH_HOME/profiles/web/cordis.patch.yml(通常为 ~/.dsh/profiles/web/cordis.patch.yml)中的 YAML 列表:

- insert:
- id: voice-input
name: deepseek-harness-voice-input

如果该文件已包含其他条目,请将此 insert 条目合并到现有的顶层 YAML 数组中,而不是覆盖该文件。重启 DeepSeek Harness Web UI,然后打开其通常的本地地址:

dsh web

使用语音输入

1. 打开一个 DeepSeek Harness 对话。
2. 点击提示词编辑器中的麦克风按钮。
3. 首次使用时,点击 Install 并等待本地 Whisper 模型达到 100%。
4. 点击麦克风开始录音。
5. 再次点击以停止并转写。识别出的文本会插入到提示词中。

该插件只准备文本。它不会自动提交提示词,因此你可以在发送前查看或编辑转写内容。

本地语音识别的工作原理

- 浏览器录制单声道 PCM 音频并生成 16 kHz WAV 负载。
- 该负载仅发送到本地 DeepSeek Harness 服务器。
- 一个独立的工作进程通过 Transformers.js 和 ONNX Runtime 运行多语言 Whisper。
- 下载的模型存储在 Harness 数据目录中,位于插件包之外。
- 临时音频在转写后会被删除。

本插件不会将任何录音发送给 DeepSeek、Google、Microsoft、OpenAI 或其他云端转写服务提供商。

首次使用
首次点击麦克风时,插件会打开自己的安装卡片。用户可以开始或取消模型下载。卡片会显示:

- 当前安装阶段;
- 已下载字节数和总字节数;
- 百分比和传输速度;
- 如果安装失败,会显示清晰的错误信息和重试操作。

安装端点具有幂等性:重复请求会附加到同一个任务,并且无法启动并行下载。安装状态会被持久化,并且在页面重新加载后仍然保留。

运行时

- Node.js(DeepSeek Harness 已经需要它)
- @huggingface/transformers
- onnx-community/whisper-tiny,q4 多语言权重(约 100 MB)

模型缓存默认位于 $DSH_HOME/voice-input/models。如果未设置 DSH_HOME,则使用 ~/.cache/deepseek-harness-voice-input/models。

浏览器支持

录制路径使用 getUserMedia 和 Web Audio API,而不是行为不一致的浏览器 SpeechRecognition 服务。它面向支持麦克风采集和 Web Audio 的当前 Firefox、Chromium、Edge 和 Safari 版本。

页面必须拥有使用麦克风的权限。由 http://127.0.0.1 提供的本地 Harness 页面受当前桌面浏览器支持。

Голосовой ввод для DeepSeek Harness

Этот плагин добавляет голосовой ввод и локальное распознавание русской речи в веб-интерфейс
DeepSeek Harness (dsh). Нажмите кнопку микрофона, продиктуйте запрос и остановите запись —
распознанный текст появится в поле сообщения. Поддерживаются Firefox, Chrome, Chromium и Edge.

Для преобразования речи в текст используется локальная multilingual-модель Whisper. Аудио не
отправляется во внешние сервисы. Не требуются Python, ffmpeg, браузерное расширение или платный
API распознавания речи. При первом запуске интерфейс показывает загрузку модели, процент,
скорость и объём данных.

Плагин подходит для диктовки запросов в DSH, локального voice typing и преобразования
русской речи в текст без облачного API.

文件

- lib/client.js — 麦克风、WAV 录制、安装卡片和进度 UI
- lib/index.js — 状态/安装/取消/转写 HTTP 路由
- scripts/stt-worker.js — 隔离的模型加载器和转写工作进程

仓库

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群