← 返回列表
未验证
为第三方模型声明图像输入,解除看图拦截
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/20 · 已提供中文文档
针对DSH:添加第三方模型时,模型被默认没有视觉能力的问题(DeepSeek Harness小完善计划其三 · DSH视觉封禁解禁)· Agent Skill 维修手册
综合分
28
GitHub 分
28
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add xiaohui5206/DSH-Vision-Unblock该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
针对DSH:添加第三方模型时,模型被默认没有视觉能力的问题(DeepSeek Harness小完善计划其三)(DSH视觉封禁解禁) DSH:具备视觉能力的模型默认被阻止输入图像(DeepSeek Harness 完善计划第三部分——视觉解禁) DSH(DeepSeek Harness)模型视觉能力开启技能(Agent Skills 标准格式)。 A DSH (DeepSeek Harness) vision capability unblock skill (Agent Skills standard format). 中文文档 · English 中文文档 技能标识:03-vision-input | 系列:DeepSeek Harness 小完善计划(其一:上下文窗口 · 其二:思考强度调节) 这是什么 一个符合 Agent Skills 标准(SKILL.md + YAML frontmatter + references/ 渐进披露)的独立技能仓库。它告诉 AI:当模型本身支持图像输入、但 DSH 的 read_image 工具报 "does not declare image input" 时,如何通过配置声明(模型条目 input 含 image)开启视觉能力——以及开启前如何查证、模型没有视觉时如何兜底。 项目目的 DSH 0.1.0-rc.7 手工接入第三方模型时,能力闸门默认按声明拦截图像输入:即使模型本身支持视觉,read_image 也会报 "does not declare image input",图片在发送前就被拒绝。 本仓库是一个 Agent Skill——给 AI 看的"维修手册",不是可执行软件。AI 读完 SKILL.md 后,即可按规程自行查证模型能力并修复 settings.yaml(在模型条目声明 input 含 image,保存即生效)。 ⚠️ 前置铁律:先查证模型确实支持视觉,再声明。高估的代价大于低估——高估会让会话反复重发一个必败的请求(详见 SKILL.md 的"核心原理")。 症状速查 出现以下任一现象,本技能适用: - read_image 报错:model "" does not declare image input - 模型本身支持看图,但 DSH 在发送前拒绝发图(能力闸门拦截) - 消息含图片时适配器报 UNSUPPORTED_CONTENT 仓库结构 03-vision-input/ ├── SKILL.md # 技能入口(AI 读这个) ├── README.md # 仓库说明(人读这个) ├── AGENTS.md # 维护守则(给维护本仓库的 AI 看) └── references/ ├── deep-dive.md # 闸门源码、查证细节、无视觉兜底方案、排障表 └── examples.yaml # 完整配置示例 使用方法 1. 安装:把本目录整体放入 AI 的 skills 目录(各 AI 的 skills 目录位置不同,按其文档放置;也可以是项目级技能目录)。 2. 触发:对 AI 描述症状或直接贴报错,例如: read_image 读图时报错:model "" does not declare image input AI 识别到"模型未声明图像输入"类症状后会自动加载 SKILL.md。 3. AI 会做什么(按 SKILL.md 规程): - 查证模型视觉能力(本机 pi-ai 内置目录 / 官方文档); - 定位 settings.yaml(跨平台路径见 SKILL.md); - 在对应模型条目声明 input: [text, image](保存即生效,无需重启); - 提示验证:用 read_image 读任意 jpg/png,模型能"看图说话"即成功。 4. 用户要配合什么: - 审批提升权限:settings.yaml 在工作区外,写入需提升权限并经你审批; - 确认网关透传:中转站网关必须透传图片消息——闸门过了 ≠ 能看图; - 改完自行备份:通过 DSH 界面改供应商设置可能重写配置、抹掉手工加的字段; - 模型真没视觉时:参考 references/deep-dive.md 的兜底方案(OCR / PPT 整图提取 / 时间轴对齐)。 版本基线 内容基于 DSH 0.1.0-rc.7 + @earendil-works/pi-ai 0.82.1(2026-08 实战验证)。DSH 升级后字段名可能变化,请按 references/deep-dive.md 的源码定位入口重新核实并更新 frontmatter 的 metadata.baseline。 许可 本文档以 CC BY 4.0 协议发布(署名 4.0 国际)。引用、转载、二次创作请保留署名:xiaohui5206。 English Skill ID: 03-vision-input | Series: DeepSeek Harness Improvement Plan (Part 1: Context Window · Part 2: Reasoning Effort) What This Is 一个遵循 Agent Skills 标准的独立技能仓库(SKILL.md + YAML frontmatter + 通过 references/ 实现渐进式披露)。它告诉 AI:当模型原生支持图像输入,但 DSH 的 read_image 工具却报告“does not declare image input”时,如何通过配置声明(模型条目 input 中的 image)启用视觉能力——以及如何事先验证能力,以及当模型没有视觉能力时该回退到什么方案。 项目目的 在 DSH 0.1.0-rc.7 中手动集成第三方模型时,能力门控默认根据声明拦截图像输入:即使模型原生支持视觉,read_image 也会报告“does not declare image input”,图像在发送之前就被拒绝。 本仓库是一个 Agent Skill——为 AI 编写的“修复手册”,而非可执行软件。阅读 SKILL.md 后,AI 会按照流程验证模型能力并自行修复 settings.yaml(在模型条目的 input 中声明 image;保存即生效)。 ⚠️ 铁律:在声明之前,先验证模型确实支持视觉。过度声明的代价高于声明不足——过度声明会让会话反复重发注定失败的请求(参见 SKILL.md 中的“核心机制”)。 症状速查 当出现以下任一情况时,本技能适用: - read_image 报错:model "" does not declare image input - 模型原生支持图像输入,但 DSH 在请求发送前拒绝发送图像(能力门控拦截) - 当消息包含图像时,适配器报告 UNSUPPORTED_CONTENT 仓库结构 03-vision-input/ ├── SKILL.md # 技能入口(由 AI 阅读) ├── README.md # 仓库概览(由人类阅读) ├── AGENTS.md # 维护规则(供维护本仓库的 AI 使用) └── references/ ├── deep-dive.md # 门控源码、验证细节、无视觉回退变通方案、故障排查表 └── examples.yaml # 完整配置示例 使用方法 1. 安装:将整个目录复制到你的 AI 的技能目录中(位置因 AI 而异——请遵循其文档;项目级技能目录也可以)。 2. 触发:向 AI 描述症状或直接粘贴错误,例如: read_image 失败并报:model "" does not declare image input AI 一旦识别出“图像输入未声明”的症状,就会自动加载 SKILL.md。 3. AI 会做什么(按照 SKILL.md 流程): - 验证模型的视觉能力(本地 pi-ai 内置目录 / 官方文档); - 定位 settings.yaml(SKILL.md 中有跨平台路径); - 在模型条目上声明 input: [text, image](保存即生效,无需重启)。注意:只声明 input——在 0.1.0-rc.7 中,inputModalities 不是配置键;写入它会被静默忽略; - 提示词验证:用 read_image 读取任意 jpg/png;成功意味着模型开始描述图像。 4. 你需要做什么: - 批准提权权限:settings.yaml 位于工作区之外;写入需要提权并获得你的批准; - 确认网关透传:中继网关必须透传图像消息——通过关卡 ≠ 能够看到图像; - 编辑后备份:通过 DSH UI 更改提供商设置可能会重写配置,并静默移除手动添加的字段; - 如果模型确实没有视觉能力:请参阅 references/deep-dive.md 中的回退变通方案(OCR / PPT 整页图像提取 / 时间线对齐)。 版本基线 内容基于 DSH 0.1.0-rc.7 + @earendil-works/pi-ai 0.82.1(经实践验证,2026-08)。DSH 升级后字段名可能会变化;请对照 references/deep-dive.md 中的源代码入口点重新验证,并更新 frontmatter 中的 metadata.baseline。 许可证 本文档依据 CC BY 4.0(署名 4.0 国际)发布。引用、转载或创作衍生作品时请保留署名:xiaohui5206。
同作者(xiaohui5206)的其他插件
扫码进群