← 返回列表
未验证
OmniVision — 由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/16 · 已提供中文文档
DeepSeek Harness 的 GUI 智能体插件:OmniParser 屏幕识别、桌面自动化,以及 OmniVision 视觉停靠栏
综合分
27.2
GitHub 分
27.2
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add xiaozhengdeng/dsh_omnivision该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
- 是什么
- dsh 原生插件 · vision
- 装得上吗
- 本站尚未做安装检查
- 安全吗
- 本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
- 还在维护吗
- 更新放缓:最近一次提交在 40 天前
档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →
数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis@deepseek-ai/dsh-client-runtime用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
由 DeepSeek 最新模型翻译生成dsh_omnivision OmniVision — 由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件 中文 OmniVision 是一款由 OmniParser 驱动的 DeepSeek Harness GUI 智能体插件。它可将桌面或任意图像转换为结构化元素(文本 + 带像素坐标的图标),使模型能够在没有多模态视觉能力的情况下看到并操作屏幕。 截图 | 视觉视图(智能识别) | 识别历史(识别记录) | | --- | --- | | Vision view | Recognition history | 功能特性 | 功能 | 描述 | | --- | --- | | 🖥 屏幕识别 | 捕获桌面(或解析图像),并通过 OmniParser 获取带像素坐标的可交互元素 | | 🖱 桌面自动化 | 单击、双击、右键单击、拖拽、输入(unicode 安全)、按键、快捷键、滚动 — 可通过元素 id 或原始 x/y 坐标操作 | | 👁 实时视觉停靠栏 | 实时识别视图,带 SOM 标注叠加层、悬停高亮、点击缩放 | | 🕘 识别历史 | 每次捕获的缩略图,与最新结果对比(新增 / 移除 / 移动) | | 📋 一键摘要 | 将识别到的元素发送到会话,供模型进行摘要 | | 🖼 文件解析 | 从停靠栏解析本地图像,绕过模型的多模态限制 | | 📊 调用日志 | 追踪每一次 gui_ 工具调用和操作,便于检查 | 工具 该插件将以下 gui_ 工具注册到共享工具注册表中: - gui_capture — 捕获桌面屏幕并运行 OmniParser 提取可交互元素(文本 + 带像素坐标的图标),刷新共享视觉状态并保存 SOM 标注叠加层 - gui_act — 在桌面上执行真实的鼠标/键盘操作:单击 / 双击 / 右键单击 / 移动 / 输入 / 按键 / 快捷键 / 滚动 / 拖拽 - gui_find — 按文本或类型搜索上次捕获的元素 - gui_state — 显示当前视觉状态,不进行解析 - gui_verify — 重新捕获并检查某文本是否存在或缺失,重试直至稳定 - gui_task — 执行脚本化的多步骤 UI 计划,步骤之间重新解析,并可选进行断言 - gui_open_app — 通过 Windows AUMID 按名称启动已安装的桌面应用 - gui_parse_image — 将第三方图像(来自对话附件)解析到共享视觉状态中 安装 dsh plugin --profile web add dsh_omnivision 或使用本地路径: dsh plugin --profile web add G:\deepseek\plugins\dsh_omnivision 安装后重启 web 进程。该插件作为 profile 包层加载: - 宿主端将 gui_ 工具注册到共享的 tools 注册表中,并通过 HTTP 路由(/dsh-omnivision/)为浏览器端提供服务 - 客户端将 OmniVision 停靠栏挂载到 shell.overlay,并在侧边栏底部添加一个切换按钮 前置条件 - Windows 系统,且 OmniParser FastAPI 服务器运行在 http://127.0.0.1:8000(例如通过 G:\omni\OmniParser\start_server.bat 启动) - Python venv 需要 pyautogui 用于截图和输入自动化 用法 从模型侧调用 gui_ 工具;浏览器中的 OmniVision 停靠面板提供可视化界面: | 控件 | 说明 | | --- | --- | | 智能识别 | 实时元素列表 + SOM 标注图像(悬停高亮,点击放大) | | 🖼 解析图片 | 选择本地图片文件进行解析(绕过模型多模态限制) | | 📋 总结 | 将当前识别信息发送到会话,供模型总结 | | 识别记录 | 带缩略图的历史记录 + 与最新对比(新增 / 移除 / 移动) | | 调用记录 | 最近的 gui_ 工具调用和操作日志 | | 探测 | 检查 OmniParser 服务器连通性 | 开发 pnpm build # tsc (host) + tsc (client) + tsdown (client bundle) pnpm typecheck 许可证 MIT 中文 OmniVision 是 DeepSeek Harness 的 OmniParser 驱动的 GUI 智能体插件。它把桌面或任意图片变成结构化元素(文本 + 图标 + 像素坐标),让模型无需多模态能力就能「看见」并操作屏幕。 界面截图 | 智能识别视图 | 识别记录视图 | | --- | --- | | 智能识别 | 识别记录 | 功能 | 功能 | 说明 | | --- | --- | | 🖥 屏幕识别 | 截取桌面(或解析图片),经 OmniParser 提取带像素坐标的可交互元素 | | 🖱 桌面自动化 | 点击 / 双击 / 右键 / 拖拽 / 输入(Unicode 安全)/ 按键 / 热键 / 滚轮,按元素 id 或原始坐标操作 | | 👁 实时识别 Dock | 实时识别视图 + SOM 标注图(悬停高亮、点击放大) | | 🕘 识别记录 | 每次识别的缩略图 + 与最新对比(新增 / 移除 / 位移) | | 📋 一键总结 | 把当前识别信息发到会话,由模型按提示词总结 | | 🖼 图片解析 | 从 Dock 选择本地图片解析,绕开模型多模态限制 | | 📊 调用记录 | 记录每次 gui_ 工具调用与动作,便于排查 | 工具 插件向共享工具注册表注册以下 gui_ 工具: - gui_capture — 以原生分辨率截取桌面,运行 OmniParser 提取可交互元素(文本 + 图标 + 像素坐标),刷新共享视觉状态并保存 SOM 标注图 - gui_act — 在桌面上执行真实鼠标/键盘操作:点击 / 双击 / 右键 / 移动 / 输入 / 按键 / 热键 / 滚轮 / 拖拽 - gui_find — 按文本或类型搜索上一次识别的元素 - gui_state — 查看当前视觉状态(不重新解析) - gui_verify — 重新截屏解析,反复确认某文本出现或消失 - gui_task — 按脚本执行多步 UI 计划,步骤间重新解析并支持断言 - gui_open_app — 通过 Windows AUMID 按名称启动已安装的桌面应用 - gui_parse_image — 解析会话中的第三方图片(附件)进入共享视觉状态 安装 dsh plugin --profile web add dsh_omnivision 或本地路径: dsh plugin --profile web add G:\deepseek\plugins\dsh_omnivision 安装后重启 web 进程。插件作为 profile bundle 层加载: - Host 半把 gui_ 工具注册进共享 tools 注册表,并通过 HTTP 路由(/dsh-omnivision/)为浏览器半提供数据 - Client 半把 OmniVision Dock 挂到 shell.overlay,侧栏底部挂开关按钮 前置依赖 - Windows + 运行在 http://127.0.0.1:8000 的 OmniParser FastAPI 服务(如 G:\omni\OmniParser\start_server.bat) - Python venv 需安装 pyautogui(截图与输入自动化) 使用 模型侧直接调用 gui_ 工具;浏览器里的 OmniVision Dock 提供可视化操作: | 控件 | 说明 | | --- | --- | | 智能识别 | 实时元素列表 + SOM 标注图(悬停高亮、点击放大) | | 🖼 解析图片 | 选择本地图片文件解析(绕开模型多模态限制) | | 📋 总结 | 把当前识别信息发到会话,由模型按提示词总结 | | 识别记录 | 历史缩略图 + 与最新对比(新增 / 移除 / 位移) | | 调用记录 | 最近 gui_ 工具调用与动作日志 | | 探测 | 检查 OmniParser 服务连通性 | 开发 pnpm build # tsc (host) + tsc (client) + tsdown (client bundle) pnpm typecheck 许可证 MIT