🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

xiaozhengdeng/dsh_omnivision

DeepSeek Harnessspec-screened扫描:低风险在 GitHub 查看 ↗
未验证

OmniVision — 由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/16 · 已提供中文文档

DeepSeek Harness 的 GUI 智能体插件:OmniParser 屏幕识别、桌面自动化,以及 OmniVision 视觉停靠栏

综合分
27.2
GitHub 分
27.2
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add xiaozhengdeng/dsh_omnivision
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · vision
装得上吗
本站尚未做安装检查
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 40 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis@deepseek-ai/dsh-client-runtime
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh_omnivision

OmniVision — 由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件

中文

OmniVision 是一款由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件。它可将桌面或任意图像转换为结构化元素(文本 + 带像素坐标的图标),使模型能够在没有多模态视觉能力的情况下看到并操作屏幕。

截图

| 视觉视图(智能识别) | 识别历史(识别记录) |
| --- | --- |
| Vision view | Recognition history |

功能特性

| 功能 | 描述 |
| --- | --- |
| 🖥 屏幕识别 | 捕获桌面(或解析图像),并通过 OmniParser 获取带像素坐标的可交互元素 |
| 🖱 桌面自动化 | 单击、双击、右键单击、拖拽、输入(unicode 安全)、按键、快捷键、滚动 — 可通过元素 id 或原始 x/y 坐标操作 |
| 👁 实时视觉停靠栏 | 实时识别视图,带 SOM 标注叠加层、悬停高亮、点击缩放 |
| 🕘 识别历史 | 每次捕获的缩略图,与最新结果对比(新增 / 移除 / 移动) |
| 📋 一键摘要 | 将识别到的元素发送到会话,供模型进行摘要 |
| 🖼 文件解析 | 从停靠栏解析本地图像,绕过模型的多模态限制 |
| 📊 调用日志 | 追踪每一次 gui_ 工具调用和操作,便于检查 |

工具

该插件将以下 gui_ 工具注册到共享工具注册表中:

- gui_capture — 捕获桌面屏幕并运行 OmniParser 提取可交互元素(文本 + 带像素坐标的图标),刷新共享视觉状态并保存 SOM 标注叠加层
- gui_act — 在桌面上执行真实的鼠标/键盘操作:单击 / 双击 / 右键单击 / 移动 / 输入 / 按键 / 快捷键 / 滚动 / 拖拽
- gui_find — 按文本或类型搜索上次捕获的元素
- gui_state — 显示当前视觉状态,不进行解析
- gui_verify — 重新捕获并检查某文本是否存在或缺失,重试直至稳定
- gui_task — 执行脚本化的多步骤 UI 计划,步骤之间重新解析,并可选进行断言
- gui_open_app — 通过 Windows AUMID 按名称启动已安装的桌面应用
- gui_parse_image — 将第三方图像(来自对话附件)解析到共享视觉状态中

安装

dsh plugin --profile web add dsh_omnivision
或使用本地路径:
dsh plugin --profile web add G:\deepseek\plugins\dsh_omnivision

安装后重启 web 进程。该插件作为 profile 包层加载:

- 宿主端将 gui_ 工具注册到共享的 tools 注册表中,并通过 HTTP 路由(/dsh-omnivision/)为浏览器端提供服务
- 客户端将 OmniVision 停靠栏挂载到 shell.overlay,并在侧边栏底部添加一个切换按钮

前置条件

- Windows 系统,且 OmniParser FastAPI 服务器运行在 http://127.0.0.1:8000(例如通过 G:\omni\OmniParser\start_server.bat 启动)
- Python venv 需要 pyautogui 用于截图和输入自动化

用法

从模型侧调用 gui_ 工具;浏览器中的 OmniVision 停靠面板提供可视化界面:

| 控件 | 说明 |
| --- | --- |
| 智能识别 | 实时元素列表 + SOM 标注图像(悬停高亮,点击放大) |
| 🖼 解析图片 | 选择本地图片文件进行解析(绕过模型多模态限制) |
| 📋 总结 | 将当前识别信息发送到会话,供模型总结 |
| 识别记录 | 带缩略图的历史记录 + 与最新对比(新增 / 移除 / 移动) |
| 调用记录 | 最近的 gui_ 工具调用和操作日志 |
| 探测 | 检查 OmniParser 服务器连通性 |

开发

pnpm build      # tsc (host) + tsc (client) + tsdown (client bundle)
pnpm typecheck

许可证

MIT

中文

OmniVision 是 DeepSeek Harness 的 OmniParser 驱动的 GUI 智能体插件。它把桌面或任意图片变成结构化元素(文本 + 图标 + 像素坐标),让模型无需多模态能力就能「看见」并操作屏幕。

界面截图

| 智能识别视图 | 识别记录视图 |
| --- | --- |
| 智能识别 | 识别记录 |

功能

| 功能 | 说明 |
| --- | --- |
| 🖥 屏幕识别 | 截取桌面(或解析图片),经 OmniParser 提取带像素坐标的可交互元素 |
| 🖱 桌面自动化 | 点击 / 双击 / 右键 / 拖拽 / 输入(Unicode 安全)/ 按键 / 热键 / 滚轮,按元素 id 或原始坐标操作 |
| 👁 实时识别 Dock | 实时识别视图 + SOM 标注图(悬停高亮、点击放大) |
| 🕘 识别记录 | 每次识别的缩略图 + 与最新对比(新增 / 移除 / 位移) |
| 📋 一键总结 | 把当前识别信息发到会话,由模型按提示词总结 |
| 🖼 图片解析 | 从 Dock 选择本地图片解析,绕开模型多模态限制 |
| 📊 调用记录 | 记录每次 gui_ 工具调用与动作,便于排查 |

工具

插件向共享工具注册表注册以下 gui_ 工具:

- gui_capture — 以原生分辨率截取桌面,运行 OmniParser 提取可交互元素(文本 + 图标 + 像素坐标),刷新共享视觉状态并保存 SOM 标注图
- gui_act — 在桌面上执行真实鼠标/键盘操作:点击 / 双击 / 右键 / 移动 / 输入 / 按键 / 热键 / 滚轮 / 拖拽
- gui_find — 按文本或类型搜索上一次识别的元素
- gui_state — 查看当前视觉状态(不重新解析)
- gui_verify — 重新截屏解析,反复确认某文本出现或消失
- gui_task — 按脚本执行多步 UI 计划,步骤间重新解析并支持断言
- gui_open_app — 通过 Windows AUMID 按名称启动已安装的桌面应用
- gui_parse_image — 解析会话中的第三方图片(附件)进入共享视觉状态

安装

dsh plugin --profile web add dsh_omnivision
或本地路径:
dsh plugin --profile web add G:\deepseek\plugins\dsh_omnivision

安装后重启 web 进程。插件作为 profile bundle 层加载:

- Host 半把 gui_ 工具注册进共享 tools 注册表,并通过 HTTP 路由(/dsh-omnivision/)为浏览器半提供数据
- Client 半把 OmniVision Dock 挂到 shell.overlay,侧栏底部挂开关按钮

前置依赖

- Windows + 运行在 http://127.0.0.1:8000 的 OmniParser FastAPI 服务(如 G:\omni\OmniParser\start_server.bat)
- Python venv 需安装 pyautogui(截图与输入自动化)

使用

模型侧直接调用 gui_ 工具;浏览器里的 OmniVision Dock 提供可视化操作:

| 控件 | 说明 |
| --- | --- |
| 智能识别 | 实时元素列表 + SOM 标注图(悬停高亮、点击放大) |
| 🖼 解析图片 | 选择本地图片文件解析(绕开模型多模态限制) |
| 📋 总结 | 把当前识别信息发到会话,由模型按提示词总结 |
| 识别记录 | 历史缩略图 + 与最新对比(新增 / 移除 / 位移) |
| 调用记录 | 最近 gui_ 工具调用与动作日志 |
| 探测 | 检查 OmniParser 服务连通性 |

开发

pnpm build      # tsc (host) + tsc (client) + tsdown (client bundle)
pnpm typecheck

许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

同作者(xiaozhengdeng)的其他插件

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群