← 返回列表
未验证
让纯文本智能体看图、定位元素并裁剪图像
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/13 · 已提供中文文档
# 面向 DeepSeek Harness 的视觉工具包——为纯文本智能体赋予视觉能力
综合分
27.4
GitHub 分
27.4
用户评分
—
★ Stars
1
周下载量
—
兼容 / 相关生态插件(非 dsh 原生,请按其对应运行时安装)
git clone https://github.com/YYTbit/dsh-plugin-vision-toolkit.git数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
dsh-plugin-vision-toolkit 面向 DeepSeek Harness 的视觉工具包——让纯文本智能体获得查看图像的能力。 功能简介 提供 CLI 工具,调用视觉 API(DeepSeek VL、GPT-4V 或任何 OpenAI 兼容端点)来对图像中的元素进行描述、定位、检测和裁剪。已注册为 dsh 技能,因此智能体知道何时以及如何使用这些工具。 工具 - glance——描述、询问或对图像进行 OCR - ground——定位特定元素(返回边界框) - detect——查找某一类元素的所有实例 - crop——从图像中裁剪一个区域 安装 dsh plugin --profile your-profile add dsh-plugin-vision-toolkit 配置 设置环境变量: export VISION_API_KEY=sk-xxx # 视觉 API 密钥(回退到 DEEPSEEK_API_KEY) export VISION_BASE_URL=https://... # API 端点(回退到 DEEPSEEK_BASE_URL) export VISION_MODEL=deepseek-vl2 # 视觉模型名称 使用示例 描述一张图像 glance screenshot.png 提问 glance screenshot.png -q "What error is shown?" OCR glance screenshot.png --ocr 查找一个按钮 ground screenshot.png "the login button" 输出:450,820,620,870 查找所有按钮 detect screenshot.png "buttons" 裁剪一个区域 crop screenshot.png 450,820,620,870 button.png 工作原理 该插件在系统提示中注册一项技能,向智能体介绍这些视觉工具。当智能体遇到图像时(用户粘贴一张、引用一张截图等),它会调用相应的 CLI 工具,该工具会: 1. 读取图像文件 2. 将其编码为 base64 3. 附带提示将其发送到视觉 API 4. 返回文本响应 智能体永远不会看到原始像素——它得到的是可以据此推理的文本描述。 支持的视觉提供商 - DeepSeek VL(deepseek-vl2、deepseek-vl2.5) - OpenAI GPT-4V / GPT-4o - 任何 OpenAI 兼容的多模态端点 许可证 MIT——YYTbit
扫码进群