DeepSeek Harness Hub
← 返回列表

图像转写插件Junkrat9527/dsh-autovision

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

粘贴图片自动转成文字,让纯文本模型也能看图

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/18 · 已提供中文文档

dsh-autovision:将图片粘贴到纯文本模型的输入框中,配置好的多模态模型会自动将其转录为文本。双提供商自动路由 + 可供智能体调用的 read-image 工具。无内置密钥,无中转。

综合分
27.8
GitHub 分
27.8
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Junkrat9527/dsh-autovision
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-autovision

为 DeepSeek Harness 中的纯文本模型提供视觉能力——粘贴一张图片,已配置的多模态模型会自动将其转写为文本。无需切换模型,无需内置密钥,无需中转。

dsh-autovision 为 DeepSeek Harness 网页界面中的纯文本模型(DeepSeek、GLM……)提供真正的图像支持。它为每个纯文本模型注册一个透明的孪生提供方,将携带图像的请求路由到你自行配置的多模态模型,并将转写结果作为文本回传——因此文本模型无需你切换模型或改动请求,就能“看到”图像。

⭐ 如果这个插件为你节省了时间,请为仓库点个星——这能帮助其他 dsh 用户发现它。

为什么需要它

DeepSeek Harness 只有在模型声明了图像输入(inputModalities)时才允许该模型接收图像。纯文本模型(例如 deepseek-、glm-)会拒绝图像消息——把截图粘贴到会话中要么静默失败,要么直接报错。

现有的变通方案迫使你切换模型、使用第三方中转,或者硬编码密钥。dsh-autovision 保留你现有的配置:该插件从不内置密钥,从不通过中转代理,也从不改动你的模型配置。 它只是借用你已在 dsh 设置中配置好的多模态模型,将图像转写为文本。

特性

- 零摩擦、透明 —— 每个纯文本模型在运行时都会获得一个 -autovision 孪生体。agent/request 会自动将每个请求重定向到孪生体,因此你永远无需切换模型,也永远无需编辑 settings.yaml。
- 粘贴 → 文本,全自动 —— 在输入框中附加一张图片;它会由你配置的视觉模型转写,并注入到文本模型的上下文中。原始图像在界面中仍然可见(缩略图 + 消息),持久日志也保留原始内容。
- 干净整洁的模型选择器 —— 孪生体的 listModels 返回 [],因此模型选择器只显示你真实的模型。没有干扰项。
- 可供 Agent 调用的 autovision_read_image 工具 —— 模型可以在运行过程中主动读取图像文件,并带有自己的按任务提示词(例如“逐字转写”“描述界面状态”)。
- 无内置凭据 —— 识别引擎就是你作为插件设置中的默认视觉模型所配置的那个多模态模型(例如 opencode-go、minimax-m3)。没有 API 密钥,没有中转 URL,没有任何硬编码内容。
- 经得起 dsh upgrade —— 纯插件实现,对 dsh 核心零补丁,零配置改写。

安装

需要 dsh web ≥ 0.1.0-rc.6。

dsh plugin --profile web add @iroam2375/dsh-autovision

该 npm 包以 @iroam2375/dsh-autovision 发布(裸名称 dsh-autovision 在 npm 上不可用——与已有的 dsh-auto-vision 过于相似)。插件本身仍以其 bundle id dsh-autovision 来寻址。
重启 dsh web,打开 设置 → 插件(插件设置)→ Autovision,然后选择一个 默认视觉模型(你的 LLM 提供商中任何可用的多模态模型,例如 minimax-m3 / opencode-go)。该模型负责所有转录工作;无需配置其他内容。

如果你在本地开发,请使用标准 bundle 接线方式:在你的 profile 的 package.json 中,将 "dsh-autovision" 添加到 dsh.profile.bundles。不要再手动将其 insert 到 cordis.patch.yml 中——那会在启动时产生 duplicate loader entry id: autovision。

用法

1. 粘贴一张图片到任意会话中并发送——文本模型会收到忠实的文本转录,而不是原始图片。
2. 让模型读取文件——模型可以调用 autovision_read_image,传入文件路径(以及它自己的指令),并基于结果采取行动。

配置

| 设置 | 含义 |
|---|---|
| defaultVisionModel | 用于转录的多模态模型(来自你的 LLM 提供商)。没有视觉模型 → 转录会降级为固定的占位符,而不是崩溃。 |
| prompt | 可选的、给视觉模型的自定义指令。留空 → 开放式描述提示(文本、颜色、形状、UI 元素、布局、状态)。 |
| targetProviders | 可选的、要包装的提供商白名单(默认:全部)。 |

Autovision 设置卡片

工作原理

- 对于每个纯文本模型,插件会注册一个 孪生适配器(-autovision),它声明 inputModalities: ['text', 'image']。
- agent/request(前置)将每个请求重定向到孪生适配器;孪生适配器的 stream() 会遍历线上消息中的每个图片块(包括工具结果嵌套),通过配置的视觉模型转录每个图片块(LRU 缓存),并将文本转发到上游。
- read_image 工具调用可以通过,因为孪生适配器声明了图片输入。
- 对 ctx.llm.resolveModelInfo 的运行时包装让你可以在会话中途手动切换到任何已包装的文本模型而不会被拒绝——请求仍会通过孪生适配器路由。

已知限制

- 一个全新会话,如果其 第一条 消息就已包含图片,会被静默跳过;先发送一条文本消息,之后的一切都能正常工作。
- 图片最大 5 MB(附件本地默认值)。
- 转录延迟就是视觉模型的延迟(例如 minimax-m3 为 6–9 秒),通过 LRU 缓存缓解。
- 设置页面可能会显示一行裸提供商行(opencode-go-autovision),没有地址——仅影响外观,不影响功能。

路线图

- npm 发布(即将推出)。

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群