🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

yepyeel/dsh-vision

DeepSeek 客户端兼容 / 相关生态spec-screened扫描:中风险在 GitHub 查看 ↗
未验证

提供dsh中deepseek v4等无法识图的模型一双眼睛

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/17 · 已提供中文文档
综合分
28
GitHub 分
28
用户评分
—
★ Stars
2
周下载量
—
兼容 / 相关生态插件(非 dsh 原生,请按其对应运行时安装)
git clone https://github.com/yepyeel/dsh-vision.git
信任档位:已验证本站已于 0 天前真实安装成功
是什么
生态应用(桌面端 / Web 外壳,不以 dsh plugin add 安装)
装得上吗
本站已真实安装成功(非静态推断)
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 39 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

🟢实装验证通过· 2026/9/26
由本站实装验证器在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-vision

DeepSeek Harness 的 profile 组合包:为 不支持识图 的模型(DeepSeek V4 Flash、DeepSeek V4 Pro,以及任何 inputModalities 未声明 image 的路由)补上视觉能力。

当请求里带有图片附件、而当前目标模型不能看图时,插件会先描述每张图,再把图片块替换成这段文字发给该模型。会话日志和界面仍保留原始图片。

环境要求

- 已安装 DeepSeek Harness,且 dsh CLI 在 PATH 中可用。
- 走识图模型描述时:需要至少一个已添加、且 inputModalities 声明了 image 的模型。
- 走 OCR 兜底时:macOS(Vision 框架)与 Windows(Windows.Media.Ocr)无需额外配置;其他平台需要安装 Tesseract 并加入 PATH。

行为

1. Auto(默认)——按已添加模型的注册顺序,选用第一个声明支持图片输入的模型。若没有任何识图模型可用,降级为 系统 OCR。
2. 指定模型——只使用设置里选定的识图模型。失败时不做任何降级(不换模型,也不走 OCR)。
3. Auto 且无识图模型——系统 OCR:
- macOS:Vision 框架
- Windows:Windows.Media.Ocr
- 其他平台:已安装的 Tesseract

描述按「附件 + 模型(或 OCR)」缓存在当前进程里,后续轮次不会重复付费调用。

设置

打开 设置 → 视觉识别:

- Auto:第一个可用识图模型,否则系统 OCR。
- 指定识图模型:从已添加且支持识图的模型里选一个。无降级。

同一份配置写在 $DSH_HOME/settings.yaml 的 dsh-vision: 段。

安装

在本目录执行:

dsh plugin --profile web add .

然后重启 dsh web,让新的组合包层和设置页加载。

卸载:

dsh plugin --profile web remove dsh-vision

原理

修复分两层:

1. 声明能力:宿主行在启动时把当前文本模型的 inputModalities 补上 image(通过包装 ctx.llm.resolveModelInfo)。这样 session.prompt / session.selectModel 的图片准入检查不再用「当前模型不支持图片,请切换支持图片的模型」拒绝带图消息,read_image 工具也随之对文本模型可用。
2. 改写:Host 行监听 llm/stream 瀑布事件。需要转写时,插件构造一份新的请求(图片换成描述)再调用 ctx.llm.stream。这次嵌套调用打向识图模型,拦截器会直接放行。Agent loop 冻结的请求不会被改写。

判断「是否原生支持识图」用的是包装前的原始解析器,因此原生识图模型不会被二次改写;仅对 inputModalities 显式声明为文本(或未声明)的模型补 image 能力。

限制

- 只有 声明了 image 输入模态的模型会出现在候选里。网关实际能看图但未声明时,不会被选中。
- 指定模式失败即失败:模型不存在、不支持识图、或调用报错,都不会改用其他路径。
- 系统 OCR 只抽取文字,不是场景描述。
- 设置 RPC 与其他配置面一样,仅 loopback 可用。
- 声明 image 能力后,含图会话也可以切回文本模型;历史图片会在下一轮 llm/stream 时被转写。

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群