← 返回列表
未验证
提供dsh中deepseek v4等无法识图的模型一双眼睛
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/17 · 已提供中文文档
综合分
28
GitHub 分
28
用户评分
—
★ Stars
2
周下载量
—
兼容 / 相关生态插件(非 dsh 原生,请按其对应运行时安装)
git clone https://github.com/yepyeel/dsh-vision.git信任档位:已验证本站已于 0 天前真实安装成功
- 是什么
- 生态应用(桌面端 / Web 外壳,不以 dsh plugin add 安装)
- 装得上吗
- 本站已真实安装成功(非静态推断)
- 安全吗
- 本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
- 还在维护吗
- 更新放缓:最近一次提交在 39 天前
档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →
🟢实装验证通过· 2026/9/26
由本站实装验证器在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
由 DeepSeek 最新模型翻译生成dsh-vision DeepSeek Harness 的 profile 组合包:为 不支持识图 的模型(DeepSeek V4 Flash、DeepSeek V4 Pro,以及任何 inputModalities 未声明 image 的路由)补上视觉能力。 当请求里带有图片附件、而当前目标模型不能看图时,插件会先描述每张图,再把图片块替换成这段文字发给该模型。会话日志和界面仍保留原始图片。 环境要求 - 已安装 DeepSeek Harness,且 dsh CLI 在 PATH 中可用。 - 走识图模型描述时:需要至少一个已添加、且 inputModalities 声明了 image 的模型。 - 走 OCR 兜底时:macOS(Vision 框架)与 Windows(Windows.Media.Ocr)无需额外配置;其他平台需要安装 Tesseract 并加入 PATH。 行为 1. Auto(默认)——按已添加模型的注册顺序,选用第一个声明支持图片输入的模型。若没有任何识图模型可用,降级为 系统 OCR。 2. 指定模型——只使用设置里选定的识图模型。失败时不做任何降级(不换模型,也不走 OCR)。 3. Auto 且无识图模型——系统 OCR: - macOS:Vision 框架 - Windows:Windows.Media.Ocr - 其他平台:已安装的 Tesseract 描述按「附件 + 模型(或 OCR)」缓存在当前进程里,后续轮次不会重复付费调用。 设置 打开 设置 → 视觉识别: - Auto:第一个可用识图模型,否则系统 OCR。 - 指定识图模型:从已添加且支持识图的模型里选一个。无降级。 同一份配置写在 $DSH_HOME/settings.yaml 的 dsh-vision: 段。 安装 在本目录执行: dsh plugin --profile web add . 然后重启 dsh web,让新的组合包层和设置页加载。 卸载: dsh plugin --profile web remove dsh-vision 原理 修复分两层: 1. 声明能力:宿主行在启动时把当前文本模型的 inputModalities 补上 image(通过包装 ctx.llm.resolveModelInfo)。这样 session.prompt / session.selectModel 的图片准入检查不再用「当前模型不支持图片,请切换支持图片的模型」拒绝带图消息,read_image 工具也随之对文本模型可用。 2. 改写:Host 行监听 llm/stream 瀑布事件。需要转写时,插件构造一份新的请求(图片换成描述)再调用 ctx.llm.stream。这次嵌套调用打向识图模型,拦截器会直接放行。Agent loop 冻结的请求不会被改写。 判断「是否原生支持识图」用的是包装前的原始解析器,因此原生识图模型不会被二次改写;仅对 inputModalities 显式声明为文本(或未声明)的模型补 image 能力。 限制 - 只有 声明了 image 输入模态的模型会出现在候选里。网关实际能看图但未声明时,不会被选中。 - 指定模式失败即失败:模型不存在、不支持识图、或调用报错,都不会改用其他路径。 - 系统 OCR 只抽取文字,不是场景描述。 - 设置 RPC 与其他配置面一样,仅 loopback 可用。 - 声明 image 能力后,含图会话也可以切回文本模型;历史图片会在下一轮 llm/stream 时被转写。 许可证 MIT