🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

xsoc1/dsh-image-vision

DeepSeek Harnessspec-screened扫描:中风险在 GitHub 查看 ↗
未验证

给纯文本的 DeepSeek 加上眼睛:聊天里传图 + 识图,一个插件搞定。

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/16 · 已提供中文文档

为纯文本 DeepSeek 赋予视觉能力:view_image 工具(本地 Ollama 或任何兼容 OpenAI 的 VLM)+ 聊天图片附件桥接——在聊天中粘贴/拖放图片,模型即可看到它们。

综合分
27
GitHub 分
27
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add xsoc1/dsh-image-vision
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · vision
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 41 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/22(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-attachment@deepseek-ai/dsh-llm@deepseek-ai/dsh-system-prompt@deepseek-ai/dsh-tools
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-image-vision

给纯文本的 DeepSeek 加上眼睛:聊天里传图 + 识图,一个插件搞定。

- view_image 工具:模型带着问题调用它(OCR、数数、读图表、看 UI 布局……任意视觉问题),插件把图片和问题转发给任意 OpenAI 兼容的 VLM 端点(本地 Ollama / 智谱 / DashScope / 豆包……),答案以文本返回。
- 图片附件桥:在聊天对话框拖拽或粘贴图片即可发送——dsh web 输入框原生接收图片附件,本插件在模型请求前把附件改写为 [用户上传的图片:] 标记,并引导模型调用 view_image 查看,纯文本模型因此“看见”你上传的图。

用户: (拖一张截图进对话框)帮我看看这个报错
模型 → view_image(source="…vision-bridge/xxx.png", question="这个报错的完整文本是什么?")
← "TypeError: Cannot read properties of undefined (reading 'map') at …"
模型: 这是一个 … 建议 …

安装

dsh plugin --profile web add dsh-image-vision

或经 dsh-market 插件市场安装。

注意:host 在消息提交时会校验当前模型的 inputModalities 声明。纯文本模型(如 deepseek-v4-flash 经网关路由)需要在 profile 的 settings.yaml 里把该模型声明为支持图片输入,否则带图消息在提交时就被拒绝:

llm-pi-ai:
providers:
opencode-go:
apiKeyEnv: OPENCODE_GO_API_KEY
modelOverrides:
deepseek-v4-flash:
input: ['text', 'image']

(网关模型目录里本就直接声明 image 能力的模型无需此步。)

后端选择

一套配置(baseURL + apiKey + model)覆盖所有后端:

| 场景 | baseURL | model | 说明 |
| --- | --- | --- | --- |
| 默认(免费) | https://open.bigmodel.cn/api/paas/v4 | glm-4.6v-flash | 智谱免费视觉模型,零成本开箱;高峰限流自动降级 |
| 本地 Ollama | http://localhost:11434/v1 | qwen3-vl:4b | 离线、无 key;小模型对穷举任务较慢,建议 maxTokens: 4096 + timeoutMs: 300000 |
| DashScope | https://dashscope.aliyuncs.com/compatible-mode/v1 | qwen3-vl-flash | 百炼 VL 线,高精度 OCR |
| 火山豆包 | https://ark.cn-beijing.volces.com/api/v3 | doubao-seed-2-1-turbo-260628 | Ark 模型 ID 带日期后缀 |

API key 读取顺序:插件配置 apiKey → $VISION_API_KEY → $DSH_VISION_API_KEY(仅 export)→ $ZHIPUAI_API_KEY → $DASHSCOPE_API_KEY。本地端点(localhost)无需 key。

免费档降级链:默认配置下插件自动依次降级 glm-4.6v-flash → glm-4.1v-thinking-flash → glm-4v-flash(可用 fallbackModels 覆盖)。thinking 系模型的  推理块会被自动剥离。

配置

dsh-image-vision:
baseURL: http://localhost:11434/v1
apiKey: ""            # 留空则读环境变量;本地端点无需 key
model: qwen3-vl:4b
maxTokens: 4096       # 推理型模型建议 ≥2048
timeoutMs: 300000     # 本地冷加载与穷举 OCR 需 1-4 分钟
maxImageBytes: 10485760

工作原理

1. 传图:对话框拖拽/粘贴 → dsh 附件服务持久化(~/.dsh/attachments/v1/)→ 消息带 image 块。
2. 桥接:llm/stream 瀑布最前拦截 → 图片导出为 ~/.dsh/vision-bridge/. → 替换为 [用户上传的图片:] 文本标记 → 递归重入(无图时直通,不循环)。纯文本适配器不再报 UNSUPPORTED_CONTENT。
3. 识图:模型看到标记 → 调用 view_image → VLM 返回文本描述 → 模型基于描述回答。

License

BSD-3-Clause。view_image 转发逻辑移植自 dsh-vision(BSD-3-Clause)。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

同作者(xsoc1)的其他插件

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群