DeepSeek Harness Hub
← 返回列表

视觉工具包YYTbit/dsh-plugin-vision-toolkit

DeepSeek 客户端兼容 / 相关生态spec-screened在 GitHub 查看 ↗
未验证

让纯文本智能体看图、定位元素并裁剪图像

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/13 · 已提供中文文档

# 面向 DeepSeek Harness 的视觉工具包——为纯文本智能体赋予视觉能力

综合分
27.4
GitHub 分
27.4
用户评分
★ Stars
1
周下载量
兼容 / 相关生态插件(非 dsh 原生,请按其对应运行时安装)
git clone https://github.com/YYTbit/dsh-plugin-vision-toolkit.git
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-plugin-vision-toolkit

面向 DeepSeek Harness 的视觉工具包——让纯文本智能体获得查看图像的能力。

功能简介

提供 CLI 工具,调用视觉 API(DeepSeek VL、GPT-4V 或任何 OpenAI 兼容端点)来对图像中的元素进行描述、定位、检测和裁剪。已注册为 dsh 技能,因此智能体知道何时以及如何使用这些工具。

工具

- glance——描述、询问或对图像进行 OCR
- ground——定位特定元素(返回边界框)
- detect——查找某一类元素的所有实例
- crop——从图像中裁剪一个区域

安装

dsh plugin --profile your-profile add dsh-plugin-vision-toolkit

配置

设置环境变量:

export VISION_API_KEY=sk-xxx           # 视觉 API 密钥(回退到 DEEPSEEK_API_KEY)
export VISION_BASE_URL=https://...     # API 端点(回退到 DEEPSEEK_BASE_URL)
export VISION_MODEL=deepseek-vl2       # 视觉模型名称

使用示例

描述一张图像
glance screenshot.png

提问
glance screenshot.png -q "What error is shown?"

OCR
glance screenshot.png --ocr

查找一个按钮
ground screenshot.png "the login button"
输出:450,820,620,870

查找所有按钮
detect screenshot.png "buttons"

裁剪一个区域
crop screenshot.png 450,820,620,870 button.png

工作原理

该插件在系统提示中注册一项技能,向智能体介绍这些视觉工具。当智能体遇到图像时(用户粘贴一张、引用一张截图等),它会调用相应的 CLI 工具,该工具会:

1. 读取图像文件
2. 将其编码为 base64
3. 附带提示将其发送到视觉 API
4. 返回文本响应

智能体永远不会看到原始像素——它得到的是可以据此推理的文本描述。

支持的视觉提供商

- DeepSeek VL(deepseek-vl2、deepseek-vl2.5)
- OpenAI GPT-4V / GPT-4o
- 任何 OpenAI 兼容的多模态端点

许可证

MIT——YYTbit

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群