🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

342949145/dsh-vision-bridge

DeepSeek Harnessspec-screened扫描:中风险在 GitHub 查看 ↗
未验证

DSH 识图桥接插件:让 DeepSeek…

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/16 · 已提供中文文档

DSH 识图桥接插件:让 DeepSeek 等纯文本模型会话也能发送图片,图片自动经视觉模型识图转文字(识图桥接,read_image 工具兼容)

综合分
27.2
GitHub 分
27.2
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add 342949145/dsh-vision-bridge
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · vision
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 40 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-llm@deepseek-ai/dsh-settings@deepseek-ai/dsh-tools@deepseek-ai/schemastery@deepseek-ai/dsh
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-vision-bridge

GitHub:https://github.com/342949145/dsh-vision-bridge · 许可证:MIT

适用范围:本插件只服务网页版 DSH(~/.dsh,如 profiles/web/)。桌面版 Deepseek Harness EAC(当前 DeepSeek 会话所在形态)由内置插件 dsh-tool-vision 接管识图,配置在 %DSH_HOME%\settings.yaml 的 tool-vision 命名空间(当前模型 qwen3.7-plus / 阿里云百炼),无需安装本插件;两套配置互不相通,排查识图问题时先确认 DSH 形态。

让 DeepSeek 等纯文本模型 的 DSH 会话也能正常发送图片:图片在进入模型之前自动交给外部视觉模型(阿里云百炼 qwen-vl)识别,识别结果以文字形式喂给当前模型。无需切换模型、无需手动运行任何命令。

用户发图片 ──▶ DSH 会话(不再提示“当前模型不支持图片”)──▶ 本插件自动识图 ──▶ 文字描述 ──▶ DeepSeek 模型

解决的问题

DSH 将 DeepSeek 系列模型的输入能力声明为仅文本(inputModalities: ["text"]),因此:

- 发送带图片的消息会被拒绝:“当前模型不支持图片,请切换支持图片的模型”(错误码 MODEL_DOES_NOT_SUPPORT_IMAGES);
- read_image 工具同样被模型能力检查拦截;
- 即使放行,DeepSeek API 本身也不接收图片。

本插件从两个层面解决:

1. 放行:包装 ctx.llm.resolveModelInfo,对目标 provider(默认 deepseek)的模型补充声明 image 输入能力,使所有模型能力检查通过;
2. 转译:包装目标 provider 适配器的 stream 方法,在消息进入序列化之前把 image 块逐个取出,调用百炼视觉 API 识图,替换为文字块——模型最终收到的始终是纯文本。

纯服务端插件,GUI 无需任何改动。不修改会话记录,不拦截原生支持图片的模型(如 pi-ai)。

安装

方式一:npm 安装(推荐,桌面版插件市场同款)

npm install dsh-vision-bridge

然后在 DSH profile(如 ~/.dsh/profiles/web/)中启用:

~/.dsh/profiles/web/cordis.patch.yml
- insert:
- id: dsh-vision-bridge
name: "dsh-vision-bridge"

或把 dsh-vision-bridge 加入 package.json 的 dsh.profile.bundles 列表。

方式二:本地开发挂载(link)

npm install link:./tools/dsh-vision-bridge   # 或 npm link

配置

配置优先级:环境变量 > 插件目录 .env > VISION_SKILL_DIR 指向目录的 .env / vision.js。

| 变量 | 必填 | 默认 | 说明 |
|---|---|---|---|
| DASHSCOPE_API_KEY | ✅ | — | 阿里云百炼 API Key(申请) |
| DASHSCOPE_BASE_URL | | https://dashscope.aliyuncs.com/compatible-mode/v1 | OpenAI 兼容端点 |
| VISION_MODEL | | qwen-vl-max | 视觉模型(如 qwen-vl-plus、qwen3.7-flash-2026-07-15) |
| VISION_FALLBACK_MODELS | | qwen-vl-plus,qwen3.7-flash-2026-07-15 | 主模型失败时的回退列表(网络错误/限流/5xx 自动回退,认证与参数错误不重试) |
| VISION_PROMPT | | 请用中文简洁描述这张图片的内容。 | 识图提示词 |
| VISION_MAX_TOKENS | | 256 | 识别结果长度上限 |
| VISION_MAX_EDGE | | 512 | 图片压缩最长边(像素) |
| VISION_JPEG_QUALITY | | 80 | 图片压缩质量 |
| VISION_PROVIDERS | | opencode-go,deepseek-official,deepseek | 接管哪些纯文本 provider(逗号分隔;opencode-go 为 pi-ai 实际路由,deepseek-official 为官方 DeepSeek 适配器路由) |
| VISION_CACHE | | true | 识别结果缓存(内存 + 落盘 %DSH_HOME%/storages/,跨会话/重启复用) |
| VISION_GEN_MODEL | | qwen-image | 文生图模型(generate_image 工具) |
| VISION_GEN_SIZE | | 1024x1024 | 文生图尺寸(1024x1024 / 720x1280 / 1280x720) |
| VISION_SKILL_DIR | | — | 复用 claude-vision-skill 配置的目录;自动读取其 .env / vision.js 中的 Key 与模型,无需重复填写 |
与内置 dsh-tool-vision 的图片桥冲突(重要):新版 DSH 内置插件 dsh-tool-vision 默认开启 bridgeTextOnly 图片桥(挂在 agent/pre-step 钩子),会把会话日志里的顶层 image 块替换成文本提示([User sent an image…, exported to: …]),结果是 GUI 永远不渲染图片、本插件的 generate_image 生成图也看不到。若 DSH 启用了 dsh-tool-vision,必须在 %DSH_HOME%/settings.yaml 的 tool-vision 段设置 bridgeTextOnly: false(settings.yaml 被 chokidar 实时监听,改动无需重启即热生效)。关闭后识图转换由本插件在 adapter.stream 层完成:日志保留 image 块(GUI 正常显示),发给模型的请求仍是纯文本。

最小配置示例(复制 .env.example 为 .env):

DASHSCOPE_API_KEY=sk-xxxxxxxx

本插件不包含任何真实 API Key 或本机路径,可安全开源;请通过 .env(已在 .gitignore 中)或环境变量提供配置。

设置页集成:插件注册了 dsh-vision-bridge 设置命名空间(%DSH_HOME%/settings.yaml),DSH 设置页可编辑;运行时优先级:设置页 > 环境变量 > .env > claude-vision-skill。

能力清单

| 能力 | 说明 |
|---|---|
| 图片上传放行 | DeepSeek 等纯文本模型会话可正常附加图片(不再提示“当前模型不支持图片”) |
| 自动识图转文字 | 图片(含 read_image 工具结果、tool-result 嵌套、历史重放)自动经视觉模型识图后喂给模型 |
| 模型回退链 | qwen-vl-max → qwen-vl-plus → flash,可恢复错误自动回退 |
| 文生图(generate_image) | 对模型说“画一张…”即调用百炼 Qwen-Image 生成图片并保存为附件,模型可看到生成结果 |
| 识别缓存 | 同图不重复调用 API(内存 + 落盘) |
| URL / OCR / 多图对比 | lib/vision.js 导出 describeImageUrl、ocrPrompt、describeImagesCompare、dataUrlFor 供复用 |

与 claude-vision-skill 的关系

claude-vision-skill 提供独立的 vision.js 识图脚本(手动运行 node vision.js )。本插件内置了等价的识图实现(压缩 + 百炼 API),并可通过 VISION_SKILL_DIR 自动复用其 API Key 与模型配置,两者互不干扰:

- Codex / 手动场景:继续使用 claude-vision-skill;
- DSH 会话场景:由本插件自动接管,发图即识图。

兼容性

- 已验证 DSH 版本:0.1.0-rc.6(网页版 DSH 与 Deepseek Harness EAC 桌面版内置版本一致);
- 上游 DSH 处于开发者预览期,如有破坏性变更请关注本仓库 Release 与 Issues。

工作原理

session.prompt(带图片)
└─▶ ctx.llm.resolveModelInfo(插件包装)→ inputModalities 含 "image" → 检查放行
└─▶ agent-loop prepareCall().stream(request)
└─▶ adapter.stream(插件包装)
├─ 逐条检查 user 消息的 image 块
├─ attachments.readImage(ref) 读取图片字节
├─ 压缩(Windows PowerShell System.Drawing)→ data URL
├─ 调百炼 chat/completions(qwen-vl)→ 文字描述
└─ 替换为 text 块 → 原始 adapter 继续

测试

node --test test/

License

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群