DeepSeek Harness Hub
← 返回列表

视觉能力解禁xiaohui5206/DSH-Vision-Unblock

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

为第三方模型声明图像输入,解除看图拦截

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/20 · 已提供中文文档

针对DSH:添加第三方模型时,模型被默认没有视觉能力的问题(DeepSeek Harness小完善计划其三 · DSH视觉封禁解禁)· Agent Skill 维修手册

综合分
28
GitHub 分
28
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add xiaohui5206/DSH-Vision-Unblock
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

针对DSH:添加第三方模型时,模型被默认没有视觉能力的问题(DeepSeek Harness小完善计划其三)(DSH视觉封禁解禁)

DSH:具备视觉能力的模型默认被阻止输入图像(DeepSeek Harness 完善计划第三部分——视觉解禁)

DSH(DeepSeek Harness)模型视觉能力开启技能(Agent Skills 标准格式)。

A DSH (DeepSeek Harness) vision capability unblock skill (Agent Skills standard format).

中文文档 · English

中文文档

技能标识:03-vision-input | 系列:DeepSeek Harness 小完善计划(其一:上下文窗口 · 其二:思考强度调节)

这是什么

一个符合 Agent Skills 标准(SKILL.md + YAML frontmatter + references/ 渐进披露)的独立技能仓库。它告诉 AI:当模型本身支持图像输入、但 DSH 的 read_image 工具报 "does not declare image input" 时,如何通过配置声明(模型条目 input 含 image)开启视觉能力——以及开启前如何查证、模型没有视觉时如何兜底。

项目目的

DSH 0.1.0-rc.7 手工接入第三方模型时,能力闸门默认按声明拦截图像输入:即使模型本身支持视觉,read_image 也会报 "does not declare image input",图片在发送前就被拒绝。

本仓库是一个 Agent Skill——给 AI 看的"维修手册",不是可执行软件。AI 读完 SKILL.md 后,即可按规程自行查证模型能力并修复 settings.yaml(在模型条目声明 input 含 image,保存即生效)。

⚠️ 前置铁律:先查证模型确实支持视觉,再声明。高估的代价大于低估——高估会让会话反复重发一个必败的请求(详见 SKILL.md 的"核心原理")。

症状速查

出现以下任一现象,本技能适用:

- read_image 报错:model "" does not declare image input
- 模型本身支持看图,但 DSH 在发送前拒绝发图(能力闸门拦截)
- 消息含图片时适配器报 UNSUPPORTED_CONTENT

仓库结构

03-vision-input/
├── SKILL.md                # 技能入口(AI 读这个)
├── README.md               # 仓库说明(人读这个)
├── AGENTS.md               # 维护守则(给维护本仓库的 AI 看)
└── references/
├── deep-dive.md        # 闸门源码、查证细节、无视觉兜底方案、排障表
└── examples.yaml       # 完整配置示例

使用方法

1. 安装:把本目录整体放入 AI 的 skills 目录(各 AI 的 skills 目录位置不同,按其文档放置;也可以是项目级技能目录)。
2. 触发:对 AI 描述症状或直接贴报错,例如:
read_image 读图时报错:model "" does not declare image input

AI 识别到"模型未声明图像输入"类症状后会自动加载 SKILL.md。
3. AI 会做什么(按 SKILL.md 规程):
- 查证模型视觉能力(本机 pi-ai 内置目录 / 官方文档);
- 定位 settings.yaml(跨平台路径见 SKILL.md);
- 在对应模型条目声明 input: [text, image](保存即生效,无需重启);
- 提示验证:用 read_image 读任意 jpg/png,模型能"看图说话"即成功。
4. 用户要配合什么:
- 审批提升权限:settings.yaml 在工作区外,写入需提升权限并经你审批;
- 确认网关透传:中转站网关必须透传图片消息——闸门过了 ≠ 能看图;
- 改完自行备份:通过 DSH 界面改供应商设置可能重写配置、抹掉手工加的字段;
- 模型真没视觉时:参考 references/deep-dive.md 的兜底方案(OCR / PPT 整图提取 / 时间轴对齐)。

版本基线

内容基于 DSH 0.1.0-rc.7 + @earendil-works/pi-ai 0.82.1(2026-08 实战验证)。DSH 升级后字段名可能变化,请按 references/deep-dive.md 的源码定位入口重新核实并更新 frontmatter 的 metadata.baseline。

许可

本文档以 CC BY 4.0 协议发布(署名 4.0 国际)。引用、转载、二次创作请保留署名:xiaohui5206。

English

Skill ID: 03-vision-input | Series: DeepSeek Harness Improvement Plan (Part 1: Context Window · Part 2: Reasoning Effort)

What This Is
一个遵循 Agent Skills 标准的独立技能仓库(SKILL.md + YAML frontmatter + 通过 references/ 实现渐进式披露)。它告诉 AI:当模型原生支持图像输入,但 DSH 的 read_image 工具却报告“does not declare image input”时,如何通过配置声明(模型条目 input 中的 image)启用视觉能力——以及如何事先验证能力,以及当模型没有视觉能力时该回退到什么方案。

项目目的

在 DSH 0.1.0-rc.7 中手动集成第三方模型时,能力门控默认根据声明拦截图像输入:即使模型原生支持视觉,read_image 也会报告“does not declare image input”,图像在发送之前就被拒绝。

本仓库是一个 Agent Skill——为 AI 编写的“修复手册”,而非可执行软件。阅读 SKILL.md 后,AI 会按照流程验证模型能力并自行修复 settings.yaml(在模型条目的 input 中声明 image;保存即生效)。

⚠️ 铁律:在声明之前,先验证模型确实支持视觉。过度声明的代价高于声明不足——过度声明会让会话反复重发注定失败的请求(参见 SKILL.md 中的“核心机制”)。

症状速查

当出现以下任一情况时,本技能适用:

- read_image 报错:model "" does not declare image input
- 模型原生支持图像输入,但 DSH 在请求发送前拒绝发送图像(能力门控拦截)
- 当消息包含图像时,适配器报告 UNSUPPORTED_CONTENT

仓库结构

03-vision-input/
├── SKILL.md                # 技能入口(由 AI 阅读)
├── README.md               # 仓库概览(由人类阅读)
├── AGENTS.md               # 维护规则(供维护本仓库的 AI 使用)
└── references/
├── deep-dive.md        # 门控源码、验证细节、无视觉回退变通方案、故障排查表
└── examples.yaml       # 完整配置示例

使用方法

1. 安装:将整个目录复制到你的 AI 的技能目录中(位置因 AI 而异——请遵循其文档;项目级技能目录也可以)。
2. 触发:向 AI 描述症状或直接粘贴错误,例如:
read_image 失败并报:model "" does not declare image input

AI 一旦识别出“图像输入未声明”的症状,就会自动加载 SKILL.md。
3. AI 会做什么(按照 SKILL.md 流程):
- 验证模型的视觉能力(本地 pi-ai 内置目录 / 官方文档);
- 定位 settings.yaml(SKILL.md 中有跨平台路径);
- 在模型条目上声明 input: [text, image](保存即生效,无需重启)。注意:只声明 input——在 0.1.0-rc.7 中,inputModalities 不是配置键;写入它会被静默忽略;
- 提示词验证:用 read_image 读取任意 jpg/png;成功意味着模型开始描述图像。
4. 你需要做什么:
- 批准提权权限:settings.yaml 位于工作区之外;写入需要提权并获得你的批准;
- 确认网关透传:中继网关必须透传图像消息——通过关卡 ≠ 能够看到图像;
- 编辑后备份:通过 DSH UI 更改提供商设置可能会重写配置,并静默移除手动添加的字段;
- 如果模型确实没有视觉能力:请参阅 references/deep-dive.md 中的回退变通方案(OCR / PPT 整页图像提取 / 时间线对齐)。

版本基线

内容基于 DSH 0.1.0-rc.7 + @earendil-works/pi-ai 0.82.1(经实践验证,2026-08)。DSH 升级后字段名可能会变化;请对照 references/deep-dive.md 中的源代码入口点重新验证,并更新 frontmatter 中的 metadata.baseline。

许可证

本文档依据 CC BY 4.0(署名 4.0 国际)发布。引用、转载或创作衍生作品时请保留署名:xiaohui5206。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群