← 返回列表
⚠ 装前注意
DeepSeek Harness DSH Web GUI 的语音输入插件。
基本兼容但装前注意:未发布到 npm registry,仅可从源码安装 · 最近上游提交 2026/8/31 · 已提供中文文档
Speech-to-text voice input plugin for DeepSeek Harness (DSH) web GUI: click the mic in the composer to turn speech into text in the input box. Browser Web Speech API + OpenAI-compatible Whisper (OpenAI/Groq) with selectable model. DSH 语音输入插件
综合分
36
GitHub 分
36
用户评分
—
★ Stars
3
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add baisama-cloud/dsh-stt-input未发布到 npm registry,仅可从源码安装,改用 GitHub 源安装
数据截至 2026/9/19(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查⚠ 装前注意
以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。
✗npm 包dsh-stt-input(未发布到 npm,仅可源码安装)
✓Node 引擎要求 >=18.18 · 基线 Node 22.19 满足
✓dsh CLI 依赖未声明 dsh 版本约束
✓入口文件main/exports/bin 已声明
未发布到 npm registry,仅可从源码安装
验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/19 19:15:54
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
中文 · English
dsh-stt-input
DeepSeek Harness (DSH) Web GUI 的语音输入插件。
点击输入框旁的 🎤 麦克风按钮开始说话,再点一次停止,识别文字自动填入输入框。
识别引擎与模型可在 设置 → 语音输入 中选择。
功能
- 两种识别引擎
- 浏览器本地识别 — 使用浏览器自带的 Web Speech API(SpeechRecognition,
Chrome/Edge)。零配置、无需 API Key,边说边把中间结果写进输入框。
- API 识别 — 用 MediaRecorder 录音,通过任意 OpenAI 兼容
/v1/audio/transcriptions 接口(OpenAI、Groq、自定义)转写。
- 模型可选 — whisper-1(OpenAI)、whisper-large-v3、
whisper-large-v3-turbo、distil-whisper-large-v3-en(Groq),或自定义模型名。
- 可配置 — 服务预设(OpenAI / Groq / 自定义)、API Base URL、API Key、
识别语言、写入方式(追加到输入框 / 替换输入框内容)。
- 实时状态条 — 输入框下方显示录音计时、识别中状态与错误信息。
- 隐私 — API Key 仅保存在页面内存中,不落盘、不打日志;非密钥配置通过
localStorage 在刷新后保留。
安装
打包 tarball 后安装到你的 DSH web profile(与其他 dsh- 插件一致):
pnpm pack
把 dsh-stt-input-.tgz 复制到 web profile 并添加依赖,
例如在 ~/.dsh/profiles/web 下:pnpm add ../path/to/dsh-stt-input-0.1.0.tgz
然后重启 dsh web。
插件注册了三个界面位:
- 输入框工具行的麦克风按钮(conversation.input.left)
- 输入框下方的状态条(conversation.composer.dock)
- 设置页(settings.section → 语音输入)
使用
1. 打开 设置 → 语音输入 选择引擎。
- 浏览器本地识别:无需其他配置(Chrome/Edge)。
- API 识别:选择预设(OpenAI 或 Groq)、模型,并粘贴 API Key。
Groq 的 whisper-large-v3 目前免费。
2. 点击输入框旁的 🎤 开始录音,说话,再点一次停止。识别文字进入输入框,回车发送。
浏览器本地引擎依赖 Chrome/Edge 的 Web Speech API;Firefox 请使用 API 引擎。
工作原理
┌──────────┐ 点击🎤 ┌───────────────┐
│ 客户端 │ ─────────────▶ │ MediaRecorder │ (api 引擎)
│ (浏览器) │ │ SpeechRecog. │ (browser 引擎)
└──────────┘ └──────┬────────┘
▲ ▼
│ setDraft(text) base64 音频 (JSON)
│ POST /stt-input/transcribe
│ │
┌─────┴──────┐ ┌───────▼────────┐
│ 输入框 │ ◀──────────│ Host (Node) │
└────────────┘ {ok,text} │ fetch → /v1/ │
│ audio/transcr.│
└────────────────┘
客户端(lib/client.js)录音后把 base64 JSON POST 到宿主路由
/stt-input/transcribe;宿主(lib/index.js)解码音频并以
multipart/form-data 上传到 ${baseUrl}/v1/audio/transcriptions
(使用 Node ≥ 18 的全局 fetch / FormData / Blob)。
License
MIT同作者(baisama-cloud)的其他插件
扫码进群