DeepSeek Harness Hub
← 返回列表

go-farther-and-farther/dsh-tool-eyes

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

DeepSeek Harness DSH 本地视觉眼睛插件:screen 工具截图/图片交给本地视觉模型描述+ ocr…

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/16 · 已提供中文文档

DeepSeek Harness (DSH) 本地视觉眼睛插件:screen 工具(截图/图片交给本地视觉模型描述)+ ocr 工具(Windows 内置 OCR 逐字提取文字)。零云端、OCR 零 GPU、图片不出本机。

综合分
28.1
GitHub 分
28.1
用户评分
★ Stars
2
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add go-farther-and-farther/dsh-tool-eyes
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/19(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-tools@deepseek-ai/schemastery@deepseek-ai/cordis
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-tool-eyes

DeepSeek Harness (DSH) 的本地视觉"眼睛"插件。

给纯文本 Agent 加上两个模型侧工具:

- screen — 截屏(或描述已有图片),通过本地 OpenAI 兼容视觉端点(llama.cpp --mmproj / LM Studio / Ollama 等)返回视觉模型的文字描述。
- ocr — 用 Windows 内置 OCR 引擎逐字提取全部文字:零模型、零 GPU、零云端、毫秒级。

screen  =  截图 / 图片  ->  本地视觉模型  ->  文字描述(理解)
ocr     =  截图 / 图片  ->  Windows OCR  ->  逐字原文        (提取)

为什么

DeepSeek 的 chat-completions 是纯文本的。与其把整个对话切到视觉模型,不如保留文本大脑、用工具加眼睛:

- 默认私有 — screen 指向本地端点,图片不出本机。
- 便宜 — 0.8B~4B 的本地视觉模型描述屏幕绰绰有余;ocr 则完全零成本。
- 默认诚实 — screen 的提示词要求视觉模型"只描述所见、除非画面中有明确标签否则不猜应用/游戏/角色名",实测能显著减少小模型的名称幻觉。

环境要求

- Windows 10/11(ocr 使用 WinRT OCR;screen 用 .NET 截图)
- Node.js >= 22.19,DeepSeek Harness >= 0.1.0-rc.6
- screen 额外需要一个 OpenAI 兼容视觉端点,例如:
- llama.cpp:llama-server -m model.gguf --mmproj mmproj.gguf --port 1235
- LM Studio(已加载视觉模型)、Ollama,或任意 OpenAI 兼容网关

安装

本包仅发布在 GitHub(未发布到 npm)。

dsh plugin --profile web add https://github.com/go-farther-and-farther/dsh-tool-eyes

然后重启 dsh web,screen / ocr 工具会自动出现在 Agent 工具集中。

手动安装(离线 / 源码方式)

把本包复制到 profile 的 node_modules,并在 $DSH_HOME/profiles//cordis.patch.yml 注册:

- insert:
- id: tool-eyes
name: 'dsh-tool-eyes'
config:
baseUrl: http://127.0.0.1:1235/v1
model: ''
timeoutMs: 180000

配置

插件配置(全部可选):

| 键 | 默认值 | 含义 |
|---|---|---|
| baseUrl | http://127.0.0.1:1235/v1 | screen 使用的 OpenAI 兼容端点 |
| model | '' | 发送的模型 id;留空由服务端决定(llama.cpp 单模型服务) |
| timeoutMs | 180000 | 单次截图+推理的超时上限 |
| captureScript | 内置 capture.ps1 | 替换截图脚本的绝对路径 |

在 profile 的 cordis.patch.yml 里按 id 覆盖:

- id: tool-eyes
name: 'dsh-tool-eyes'
config:
baseUrl: http://127.0.0.1:1235/v1
model: qwen3.5-4b
timeoutMs: 120000

用法

对话中 Agent 可以直接:

- screen — "看看我屏幕"、"描述这张图片",可用 prompt 聚焦某区域或细节。
- ocr — "把屏幕上的字全读出来"、"转写这个报错弹窗"。

两者都支持可选 image 路径;不填则截屏。内置 PowerShell 脚本也可单独使用:

powershell -NoProfile -ExecutionPolicy Bypass -File lib\capture.ps1 -Prompt "..." -BaseUrl http://127.0.0.1:1235/v1
powershell -NoProfile -ExecutionPolicy Bypass -File lib\ocr.ps1 -Image C:\path\x.png

隐私

- ocr 完全本地(WinRT OCR,无网络)。
- screen 会把截图发送到配置的 baseUrl;指向本地端点(llama.cpp / LM Studio / Ollama)即可保证图片不出本机。

相关项目

- dsh-vision-proxy — 聊天输入框直接贴图自动转文字(Chatbox 式),无需给路径,与本插件互补。

开发

npm test    # node --test tests/

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群