← 返回列表
未验证
DeepSeek Harness 的语音输入与语音转文字
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/22 · 已提供中文文档
DeepSeek Harness (dsh) 的本地语音输入和语音转文字插件,由多语言 Whisper 提供支持。
综合分
27.2
GitHub 分
27.2
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add wkfedor/deepseek-harness-voice-input该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
DeepSeek Harness 的语音输入与语音转文字 为 DeepSeek Harness(dsh)Web UI 添加语音输入、麦克风听写和本地语音转文字功能。 这个 DeepSeek Harness 插件在浏览器中录制语音,并使用多语言 Whisper 在本地进行转写。它可在 Firefox、Chrome、Chromium、Edge 和 Safari 中运行,无需浏览器扩展或云端语音识别服务。 当你想在 DeepSeek Harness 对话编辑器中口述提示词而不是手动输入时,可以使用它。音频始终保留在运行 Harness 的计算机上。 功能特性 - 一个集成到 DeepSeek Harness 提示输入框中的麦克风按钮。 - 由 Whisper、Transformers.js 和 ONNX Runtime 驱动的本地、私密语音转文字。 - 多语言语音识别,包括英语和俄语语音输入。 - 通过 getUserMedia 和 Web Audio API 实现跨浏览器录音。 - 首次运行时可见的模型下载,带有百分比、字节数、速度、取消和重试控件。 - 持久化的设置状态:刷新页面不会启动重复的模型下载。 - 无需 Python、pip、ffmpeg、管理员权限、浏览器扩展或外部语音 API。 安装 DeepSeek Harness 语音输入插件 将该包安装到标准的 web 配置文件中: dsh plugin --profile web add github:wkfedor/deepseek-harness-voice-input 此包是 Cordis 插件,而不是配置文件捆绑包。请将其添加到 $DSH_HOME/profiles/web/cordis.patch.yml(通常为 ~/.dsh/profiles/web/cordis.patch.yml)中的 YAML 列表: - insert: - id: voice-input name: deepseek-harness-voice-input 如果该文件已包含其他条目,请将此 insert 条目合并到现有的顶层 YAML 数组中,而不是覆盖该文件。重启 DeepSeek Harness Web UI,然后打开其通常的本地地址: dsh web 使用语音输入 1. 打开一个 DeepSeek Harness 对话。 2. 点击提示词编辑器中的麦克风按钮。 3. 首次使用时,点击 Install 并等待本地 Whisper 模型达到 100%。 4. 点击麦克风开始录音。 5. 再次点击以停止并转写。识别出的文本会插入到提示词中。 该插件只准备文本。它不会自动提交提示词,因此你可以在发送前查看或编辑转写内容。 本地语音识别的工作原理 - 浏览器录制单声道 PCM 音频并生成 16 kHz WAV 负载。 - 该负载仅发送到本地 DeepSeek Harness 服务器。 - 一个独立的工作进程通过 Transformers.js 和 ONNX Runtime 运行多语言 Whisper。 - 下载的模型存储在 Harness 数据目录中,位于插件包之外。 - 临时音频在转写后会被删除。 本插件不会将任何录音发送给 DeepSeek、Google、Microsoft、OpenAI 或其他云端转写服务提供商。 首次使用 首次点击麦克风时,插件会打开自己的安装卡片。用户可以开始或取消模型下载。卡片会显示: - 当前安装阶段; - 已下载字节数和总字节数; - 百分比和传输速度; - 如果安装失败,会显示清晰的错误信息和重试操作。 安装端点具有幂等性:重复请求会附加到同一个任务,并且无法启动并行下载。安装状态会被持久化,并且在页面重新加载后仍然保留。 运行时 - Node.js(DeepSeek Harness 已经需要它) - @huggingface/transformers - onnx-community/whisper-tiny,q4 多语言权重(约 100 MB) 模型缓存默认位于 $DSH_HOME/voice-input/models。如果未设置 DSH_HOME,则使用 ~/.cache/deepseek-harness-voice-input/models。 浏览器支持 录制路径使用 getUserMedia 和 Web Audio API,而不是行为不一致的浏览器 SpeechRecognition 服务。它面向支持麦克风采集和 Web Audio 的当前 Firefox、Chromium、Edge 和 Safari 版本。 页面必须拥有使用麦克风的权限。由 http://127.0.0.1 提供的本地 Harness 页面受当前桌面浏览器支持。 Голосовой ввод для DeepSeek Harness Этот плагин добавляет голосовой ввод и локальное распознавание русской речи в веб-интерфейс DeepSeek Harness (dsh). Нажмите кнопку микрофона, продиктуйте запрос и остановите запись — распознанный текст появится в поле сообщения. Поддерживаются Firefox, Chrome, Chromium и Edge. Для преобразования речи в текст используется локальная multilingual-модель Whisper. Аудио не отправляется во внешние сервисы. Не требуются Python, ffmpeg, браузерное расширение или платный API распознавания речи. При первом запуске интерфейс показывает загрузку модели, процент, скорость и объём данных. Плагин подходит для диктовки запросов в DSH, локального voice typing и преобразования русской речи в текст без облачного API. 文件 - lib/client.js — 麦克风、WAV 录制、安装卡片和进度 UI - lib/index.js — 状态/安装/取消/转写 HTTP 路由 - scripts/stt-worker.js — 隔离的模型加载器和转写工作进程 仓库
扫码进群