← 返回列表
未验证
DSH DeepSeek Vision 是一个开源的 DeepSeek Harness DSH 视觉插件,
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/7 · 已提供中文文档
仅文本的 DeepSeek Harness 模型的图像理解、OCR 和持久化视觉证据
综合分
30.3
GitHub 分
30.3
用户评分
—
★ Stars
2
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Argonaut790/dsh-deepseek-vision该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/schemastery@deepseek-ai/cordis@deepseek-ai/dsh-agent@deepseek-ai/dsh-api-remotes@deepseek-ai/dsh-attachment@deepseek-ai/dsh-brand@deepseek-ai/dsh-client-connection@deepseek-ai/dsh-client-locale@deepseek-ai/dsh-client-runtime@deepseek-ai/dsh-client-ui-conversation@deepseek-ai/dsh-client-ui-primitives@deepseek-ai/dsh-client-ui-slots用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
DSH DeepSeek Vision CI License: MIT DSH DeepSeek Vision 是一个开源的 DeepSeek Harness (DSH) 视觉插件, 它为纯文本的 DeepSeek 模型添加了图像理解、全屏 OCR 和持久化视觉证据功能, 而无需替换父模型。 与 provider-pool 或 CLI 拦截工具不同,此插件让 DeepSeek Harness 继续掌管模型、附件、会话和 UI。它添加了: - see_image,支持 latest、all 和显式图像选择 - 一个会话作用域的视觉分析师,具备后续追问记忆 - 结构化摘要、问题回答、详尽 OCR 和不确定性说明 - 一个只读的 Evidence 标签页和每次调用的证据卡片 - 位于 Choose Model 旁边的全局 Vision: … provider/model 选择器 - 实时路由变更;更改路由会启动新的分析师 截图 启用视觉的 DeepSeek Harness 编辑器 DeepSeek Harness 编辑器使用 Grok Latest 作为视觉模型,DeepSeek V4 Pro High 作为父模型 父 DeepSeek 模型保持控制权,而独立的 Vision 路由 负责图像理解和 OCR。 紧凑的视觉模型选择器 紧凑的 DSH Vision 模型选择器位于 DeepSeek 父模型选择器旁边 全局选择器使当前激活的图像能力模型可见,并让用户 无需更改对话模型即可更改视觉分析路由。 对话中的证据卡片 DeepSeek Harness 对话中带有证据卡片的视觉分析回复 每次 see_image 调用都会渲染一张证据卡片,包含结构化摘要、 问题回答和任何不确定性说明,因此分析结果在 对话中始终可审查。 GitHub 项目概览 GitHub 上的开源 DSH DeepSeek Vision 仓库 要求 - Node.js ^22.19.0 或 >=24 - DeepSeek Harness 0.1.0-rc.6 - 在 Harness 目录中注册的图像能力模型 - DSH spawn 子代理提供程序 Harness 必须提供 delegated-image 提示准入、模型输入 模态、see-image-model 设置命名空间以及 Web 对话 插槽。此插件无法将这些契约回溯适配到旧版本中。 当等效的树内 see-image-model、 tool-subagent-image 或 vision-picker 行已启用时,请勿挂载此包。重复的服务 和工具将发生冲突。 从 GitHub 安装 此项目未发布到 npm。构建一个检出副本,并将该本地 包添加到 Web 配置文件中: git clone https://github.com/Argonaut790/dsh-deepseek-vision.git cd dsh-deepseek-vision corepack yarn install --frozen-lockfile corepack yarn build dsh plugin --profile web add . 随附的 cordis.patch.yml 会挂载全局路由服务和 see_image;其包元数据会暴露 Web 选择器和 Evidence UI。 配置 打开一个对话,然后从 Vision: … 标签中选择一个支持图像的路由。只有当 Harness 目录明确声明了 image 输入时,模型才会被列出。 对于无头配置,请在 $DSH_HOME/settings.yaml 中配置相同的全局路由: see-image-model: provider: openrouter model: '~x-ai/grok-latest' maxTokens: 8192 提供商和模型名称仅为示例。它们必须与你的 Harness 中注册的 路由匹配。支持的输出 token 范围为 1–32768。 可以在工具行上设置一个可选的静态回退: - id: deepseek-vision-tool name: dsh-deepseek-vision/tool config: provider: spawn agentOptions: provider: openrouter model: '~x-ai/grok-latest' maxTokens: 8192 当全局选择器包含完整路由时,它会优先。 工作原理 1. Harness 会将粘贴的图像保留为持久的 delegated-image 附件。 2. 纯文本父级会通过问题和一个图像 选择来调用 see_image。 3. 插件会为该对话复用最新的匹配视觉分析师, 仅转发该分析师尚未收到的图像。 4. 分析师不会接收任何工具,使用固定的反提示注入人格, 并且必须返回严格的 JSON。 5. 父级会收到简洁的面向模型的文本,而完整的结构化 记录会被保留,用于证据卡片和 Evidence 标签页。 6. 如果持久续接不可用,插件会执行一次隔离的 一次性结构化回读。 调用会由 Harness 工具运行时按对话串行化。路由 变更会创建一个新的分析师,而不是在现有 子级背后修改模型。 隐私、信任与成本 - 选中的图像会发送到配置的视觉提供商。使用前请查看该 提供商的保留、区域和隐私条款。 - 每个分析师回合都会消耗所选模型的 token,并可能产生 提供商费用。后续追问可以复用视觉上下文,但仍然 是模型调用。 - OCR 和视觉结论是模型生成的证据,并非有保证的 事实。请独立验证高影响决策。 - 图像内发现的文本会被视为不可信数据,绝不会被视为 指令。分析师没有工具或外部操作权限。 - 证据记录会在对话历史中保留附件标识符和派生文本; 它们不会嵌入图像字节。 图像选择 see_image 支持: - latest(默认):来自包含 委托图像的最新对话事件的图像 - all:去重后的对话图像目录 - ids:该目录中已存在的精确附件 ID 一次调用最多接受 12 个问题,每个问题 2,000 个字符,总计 8,000 个字符。 开发 使用 Corepack 管理的 Yarn: corepack yarn install --frozen-lockfile corepack yarn typecheck corepack yarn build corepack yarn test 构建会在 lib/index.js 和 lib/tool.js 生成 Host 条目,在 lib/types 下生成声明文件,并在 lib/client.js 生成浏览器 __ModuleLoader__ 打包文件。 参见 CONTRIBUTING.md、SECURITY.md 和 CHANGELOG.md。
扫码进群