DeepSeek Harness Hub
← 返回列表

jin123-alpha/dsh-ext-vision-proxy

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

为 DeepSeek Harness 设计的外部多模态视觉代理插件。通过无缝桥接 OpenAI 兼容的视觉模型…

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/19 · 已提供中文文档

DeepSeek Harness 的外部视觉代理扩展,使纯文本模型能够通过 OpenAI 兼容的视觉 API 分析和理解图像。

综合分
29.2
GitHub 分
29.2
用户评分
★ Stars
3
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add jin123-alpha/dsh-ext-vision-proxy
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis@deepseek-ai/dsh-tools
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-ext-vision-proxy

为 DeepSeek Harness 设计的外部多模态视觉代理插件。通过无缝桥接 OpenAI 兼容的视觉模型 API,使 DeepSeek-V3 / DeepSeek-R1 等纯文本 LLM 获得强大的图片阅读、解析与问答能力。

📸 界面效果预览

1. 视觉代理配置面板(服务商管理与一键连通性测试)
设置面板预览

2. 对话输入框控制栏(经典胶囊开关与模型选择)
输入框控制栏预览

🌟 核心特性

- 🖼️ 纯文本大模型多模态赋能:让 DeepSeek-V3 / R1 等纯文本模型能够自主调用 vision_describe 工具,精准识别并解答用户上传的图片、图表、截图或附件内容。
- 🔘 输入框原生控制开关:在会话工具栏 (conversation.input.left) 中无缝嵌入经典风格的「视觉代理」开关与快速模型切换下拉面板。
- ⚙️ 完整的设置面板与连通性测试:在设置页中提供独立的「视觉代理」配置板块,支持自定义 Base URL、API Key、模型能力过滤与一键连通性测试。
- 🎛️ 严谨的 4 状态会话矩阵:
1. 多模态 LLM + 开关开启:vision_describe 工具可见。模型可自主决定是由代理模型识别还是走原生通道;附带图片提交时弹窗提醒用户。
2. 多模态 LLM + 开关关闭:工具不可见。模型通过 DSH 原生图片消息流处理图片,代理插件零干扰。
3. 纯文本 LLM + 开关开启:工具可见,放行图片上传。LLM 自动调用 vision_describe 工具传入附件 ID 或路径获取解析结果。
4. 纯文本 LLM + 开关关闭:工具不可见,阻断图片发送(提示切换支持图片的模型)。与未安装该插件时效果 100% 一致。
- 🔍 智能附件与图片寻址:支持内容寻址哈希(sha256:...)、本地绝对/相对路径、HTTP/HTTPS URL,并通过文件二进制魔数自动识别 PNG/JPEG/WEBP/GIF/BMP 等格式。

🏗️ 架构设计

- 宿主端 (Node.js): src/index.ts
- 注册 vision_describe 工具 Schema 与执行逻辑;
- 基于 Cordis system-prompt/assemble 瀑布流拦截器,按会话动态剔除/暴露视觉工具与系统提示;
- 在 webServer 上挂载设置管理、连通性探测及会话状态同步 REST API。
- 客户端 (React / 浏览器): src/client/
- 注册 settings.section 插槽 (VisionSettingsSection) 用于服务商与 API Key 配置;
- 注册 conversation.input.left 插槽 (VisionComposerButton) 提供输入框开关与模型快速选择。

📦 安装与构建

方式一:在 DSH Profile 中通过 Link 安装(开发推荐)

在 ~/.dsh/profiles/web/package.json 中添加依赖和 bundle 项:

{
"dependencies": {
"dsh-ext-vision-proxy": "link:/path/to/dsh-ext-vision-proxy"
},
"dsh": {
"profile": {
"bundles": [
"@deepseek-ai/dsh-base",
"@deepseek-ai/dsh-web-app",
"dsh-ext-vision-proxy"
]
}
}
}

方式二:本地打包安装

安装依赖并编译打包
npm install
npm run build

打包为 tarball
npm pack

🚀 使用指南

1. 启动 DSH Web:
dsh web

2. 配置视觉 API:
- 在浏览器中打开 DSH Web(http://127.0.0.1:3080);
- 进入 设置 (Settings) -> 视觉代理;
- 输入兼容 OpenAI 的视觉 API 基础地址(如 https://api.openai.com/v1 或中转服务地址)及 API Key;
- 点击 获取模型列表,挑选默认视觉代理模型(如 gpt-4o、gemini-2.5-flash、qwen-vl-max 等);
- 点击 测试连通性 验证通过后点击保存。
3. 对话与图片识别:
- 在选用 DeepSeek-V3 或 DeepSeek-R1 的会话中,将输入框左侧的 「视觉代理」 开关切换为开启;
- 上传或粘贴图片并输入问题(例如:“请详细描述这张图片的内容”);
- 模型将在后台调用 vision_describe 工具识别图像并给出详细解答。

📄 开源协议

MIT © 2026 Fan Yuejin

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群