DeepSeek Harness Hub
← 返回列表

视觉插件套件SuperMate-Ai/SuperMate-Harness-System

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

为智能体接入本地或云端视觉模型,让它读懂图片与图形文件

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/5 · 已提供中文文档

Give DeepSeek Eyes · 给 DeepSeek 装眼睛 — a DeepSeek Harness (DSH) Skill: local vision models or vision APIs let DeepSeek read images and graphic files

综合分
29.5
GitHub 分
29.5
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add SuperMate-Ai/SuperMate-Harness-System
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

SuperMate Harness 系统

“一切皆插件” —— 一个由 DeepSeek Harness 插件架构组装而成的自包含真智能体。一次下载,即可获得 deepseek-ai 官方技能/插件 + SuperMate 原创内容 —— 无需额外获取。

License
DSH Plugin
MiniMax H3
Vision
Zero API Key

天人合一 · Heaven–Human Unity —— 云端灵感 · 本地可控 · 本地/云端工具统一

中文版:README-cn.md

DSH 版本支持(对 GitHub 用户很重要)
- 适用于 DSH rc.5(旧版,无认证) 和 0.1.2 / 0.1.3+(每次启动令牌认证)。
启动器会自动检测:GET / 返回 200 -> 旧版纯 URL;返回 401 -> 打开
由 dsh web 打印的每次启动令牌 URL。
- 要升级到最新 DSH?请先阅读 skills/dsh-upgrade-runbook(BOM/schema 陷阱、
官方 git-clone 步骤、预检脚本)。
- 不升级?无需操作 —— 旧版 DSH 会继续以旧版模式运行。
- 备份:本仓库的 git 历史是旧版本的回退方案;升级前请务必备份你的 DSH_HOME
(sessions/settings/storages)。

✨ 亮点

| | |
|---|---|
| 🚀 一键入口 | 用一个图标启动 Harness + Quark + 千问悬浮侧边栏 |
| 🧠 AI 大脑 | DeepSeek(云端)+ 本地 LLM —— 推理、规划、生成 |
| 👁️ 眼睛 | 视觉技能 —— Ollama 本地、Quark 浏览器 Qwen,或任意 OpenAI 兼容 API |
| 🎬 工作室 | 视频制作 —— Doubao Seedance 2.0、RunningHub MiniMax H3,全部由网页自动化驱动 |
| 🧩 一切皆插件 | 技能(如何做)+ 插件(能做什么),可自由组合与替换 |
| 🔥 零 API Key 矩阵 | DeepSeek 大脑 + Qwen 视觉/图像生成 + Doubao 视频 + H3 云端视频 —— 全部通过 CDP 网页自动化,无需 Ollama、无需 API key、无需 GPU |

📦 内含内容

SuperMate Harness System
├── skills/                        → 技能层(任务级:如何做)
│    ├── Supermate-harness-launcher/ 🚀 一键启动:Harness + Quark + 千问侧边栏
│    ├── quark-qwen-vision/         🖼️ Quark 浏览器视觉 + 图像生成(零 API key)
│    ├── Deepseek-eyes/             👁️ 视觉技能(Ollama / 视觉 API)
│    ├── doubao-creator/            🎬 Doubao 文本转视频(Seedance 2.0,零 API key)
│    ├── rh-workflow/               🎥 RunningHub 云端 H3 工作流 API
│    ├── rh-workflow-9b/            📋 9B RH 执行器章程
│    ├── MiniMax h3-video-producer/ 🎞️ H3 视频制作流水线
│    ├── Supermate/                 🤖 SuperMate 智能体身份
│    └── DSH Official/              官方 deepseek-ai 技能(13 · fork 副本)
└── plugins/                        → 插件层(系统级:can-do)
├── Supermate/                 自研插件(核心增强 = 闭源商业)
└── DSH Official/              官方 deepseek-ai 插件(49 个系列 · fork 副本)

⚡ 快速开始

一键环境 — Harness + 夸克 + 千问悬浮侧边栏:

1. 将启动器技能复制到 DSH 的技能目录
Copy-Item skills\Supermate-harness-launcher\ ~\.dsh\skills\ -Recurse

2. 编辑 config.ps1 — 设置你的 Harness 启动命令 / 夸克路径
$HarnessStartCmd = 'E:\deepseek-harness-v013\start-web.cmd'   (留空 = 手动启动 Harness)

3. 运行它 — Harness 启动,夸克打开,千问悬浮侧边栏弹出
powershell -ExecutionPolicy Bypass -File scripts\launch.ps1

任何其他技能用法相同:将其文件夹复制到 ~/.dsh/skills/ 并重启 DSH 会话。

🧩 原创技能

围绕夸克浏览器构建 — 夸克自带内置的千问侧边栏 + 夸克网盘,使其成为 SuperMate Harness 系统扩展(视觉、图像生成、网盘、视频)的理想基础。

| 技能 | 功能 |
|-------|--------------|
| Supermate-harness-launcher | 🚀 一键入口(基础) — 启动 Harness → 打开夸克(调试端口 9222)→ 打开 Harness GUI + 千问侧边栏 → 自动点击夸克原生的 “问AI” 按钮,使千问悬浮侧边面板在你的对话旁弹出。跨机器 / 分辨率 / DPI 自适应 |
| quark-qwen-vision | 🖼️ 零 API 密钥视觉 + 图像生成 — 通过 CDP 驱动夸克浏览器内置的 Qwen(qwen-vl + Qwen-Image 2.0):图像分析、提示词逆向工程、文生图 |
| Deepseek-eyes | 👁️ 给文本模型装上眼睛 — 图像 → 本地视觉(Ollama)/ OpenAI 兼容视觉 API → 结构化文本 |
| dsh-deepseek-vision-bridge | 🧠 架构突破 — 文本 DeepSeek 原生读取图像 — 对 DSH 自身 llm-deepseek 适配器的补丁:将图像粘贴到 Harness GUI 中,deepseek-v4-flash(纯文本,inputModalities:['text'])即可接受它。适配器自动将每张图像通过夸克千问侧边栏(CDP,零显存 / 零 API 密钥)路由,并在序列化前注入干净的中文描述。模型从未“看到”图像 — 却能完全理解它。适用于 GUI、IM、任何绑定 DeepSeek 的图像。多图像串行 + 冷却、仅成功缓存、自动重试、无附件接缝时零回归 |
| doubao-creator | 🎬 零 API 密钥文本转视频 — 通过 CDP 驱动豆包网页版(Seedance 2.0):图像分析、10 秒竖版视频广告、人像保护变通方案(先描述再锚定) |
| dsh-im-wecom | 💬 企业微信机器人 × DSH — 通过 @xmanrui/dsh-im 插件将企业微信智能机器人接入 Harness(官方长连接,零手写桥接);千问侧边栏图像代理:企业微信图片 → 夸克千问 CDP 分析 → 仅以文本输入模型(纯文本模型也能“看见”图片) |
| rh-workflow | 🎥 RunningHub 云端 H3 工作流 API — I2V / T8 / Ref2VA 视频生成 |
| rh-workflow-9b | 📋 9B RH 执行器章程 — 面向本地 9B 模型的无漂移执行规则 |
| MiniMax h3-video-producer | 🎞️ 本地 H3 全流程视频制作:分镜 → H3 提示词 → 分段生成 → 合成 + 背景音乐 |
| video-production-studio | 🎥 通用视频制作流水线 — 提炼自 zenstory-ai/drama-skills(MIT):五份创作者文档 + 预览→确认→制作关卡 + 原生 MiniMax H3 提示词 + 本地渠道接入(Z-Image / RH Ref2VA·I2V / 豆包 Seedance / ffmpeg) |
| lyric-mv-storyboard | 🎵 歌词驱动 MV 分镜 — 歌词(或 .lrc 时间轴)+ 角色图像 → 三层表演系统(目标/节拍/面部时序)→ 定时分镜 + Ref2VA 演唱提示词(每段一句,避免念白);附可移植的 skill.json 源文件 |
| SuperMate | 🤖 SuperMate 智能体身份 — 组装后的智能体端到端如何表现 |

🚀 精选 · 一键启动 — Harness + 夸克 + 千问侧边栏

双击一个图标 → Harness 启动 → 夸克打开 → 千问悬浮侧边栏在你的对话旁滑出。

Supermate-harness-launcher 是你整个工作环境的单一入口:

1. 启动 Harness — 如果 http://127.0.0.1:3080 未运行,启动你配置的启动脚本并等待就绪(≤120 秒)
2. 打开夸克 — 确保浏览器以 --remote-debugging-port=9222 运行,打开 Harness GUI 标签页 + 千问侧边栏页面
3. 弹出悬浮侧边栏 — 截图定位夸克原生的 “问AI” 工具栏按钮(蓝色 ✨ 星形,右上角)并自动点击

跨机器 / 分辨率 / DPI 自适应:按钮的像素位置会变化,但其在窗口内的比例是稳定的 — DPI 感知截图 + 蓝色星形颜色扫描(最顶部聚类)+ 按比例缩放的兜底方案。

⚠️ “问AI”按钮是一个开关(再次运行会关闭面板)。千问侧边栏页面必须使用带参数的 URL(entry=frame&tab_id=...)—— 普通 URL 只会加载一个损坏的外壳。

👁️ 精选 · 给 DeepSeek 一双眼睛
图像 → 视觉模型将其转换为文本 → 文本模型“看到”

deepseek-eyes 将图像——截图、照片、图表、设计稿、插画、角色设定图、AI 生成图像——转换为结构化文本,供 DeepSeek(或任何文本模型)进行推理。

图像 / 图形文件 → 技能 → 本地视觉模型或视觉 API → 结构化文本 → DeepSeek 读取并推理

在 RTX 5080 16GB 上实测——英文手册 · 中文手册

🧠 架构突破 · dsh-deepseek-vision-bridge

“看见”是一种能力,而非模型的属性。 DeepSeek 的权重中不包含视觉编码器——这是任何提示词技巧都无法跨越的物理限制。但这座桥证明了 harness 可以在架构层面跨越它:视觉通道(夸克千问侧边栏)从“手动调用”升级为“模型请求流水线中的一个自动阶段”。

将图像粘贴到 GUI → 宿主接受(适配器现在声明支持图像输入)
→ 图像被持久保留(在历史记录中可见,永不丢失)
→ llm-deepseek 适配器在每次请求前扫描图像块
→ 夸克千问侧边栏(CDP)逐一描述(约 6-12 秒,之后缓存)
→ 干净的文本替换图像块 → 序列化(assertTextOnly 永不触发)
→ DeepSeek 如同亲眼所见般作答

为何这是突破——而非取巧:

- 原生层,普适效果——补丁位于 DSH 自身的 llm-deepseek 适配器中,因此每一张发往 DeepSeek 的图像——GUI 粘贴、IM 渠道、任何来源——都会经过它。无需为每个渠道维护单独的桥接(不同于仅桥接的方案)。
- 图像永不丢失——原始字节保留在持久附件存储中;只有发送给模型的副本会变成文本。
- 零显存,零 token——视觉能力依托已打开的夸克浏览器通过 CDP 运行;不会向 ComfyUI H3 采样所需的 16 GB GPU 中加载任何内容。
- 为运行而生,而非演示——严格串行 + 1.5 秒冷却(侧边栏是网页会话,在突发请求下会卡顿),仅成功时缓存(同一图像重复时毫秒级返回),失败时降级为占位符并在下一轮自动重试(绝不污染后续请求),并且该组合在没有附件接缝时保持原生纯文本行为(零回归,158 项测试全绿)。
- 上游通用,而非 SuperMate 私有——该补丁仅触及官方 @deepseek-ai/dsh-llm-deepseek 包;所有依赖均为 @deepseek-ai/ + Node 内置模块 + 原版夸克 CDP。克隆官方 deepseek-ai/deepseek-harness,放入 patch/,重新构建,重启——即可获得相同能力。本仓库只是其分发点(可向上游贡献)。
- 两个智能体胜过投影器——本地多模态模型通过挂载 mmproj 实现权重级静态对齐(一只无法被质询的固定本地之眼)。而这座桥接则让文本智能体(DeepSeek)在运行时自动调用云端满血版千问(qwen-vl-max 级别):一只借来的眼睛,远比任何本地 9B/35B 视觉模型更锐利,而且你可以以对话方式质询、替换和迭代——这是静态 mmproj 无法做到的。
- 诚实的边界——首张图片在模型请求内约需 10 秒;缓存是按进程隔离的;侧边栏作为一个会话,是极端多图突发场景的上限。

源码补丁 + 文档:skills/dsh-deepseek-vision-bridge/patch/ · 含回滚。

🏛 官方内容随本仓库一同发布

| | 数量 | 来源 |
|---|---|---|
| skills/DSH Official | 13 个官方技能 | deepseek-ai · Apache-2.0 · 附 NOTICE 归属的 fork 副本 |
| plugins/DSH Official | 49 个官方插件家族 | deepseek-ai · Apache-2.0 · 附 NOTICE 归属的 fork 副本 |

🔗 生态与许可

属于 DeepSeek Harness 插件生态的一部分——话题 dsh-plugin · DeepSeek Harness · Agent Skills

许可 · Apache-2.0 含专利条款 · 双许可边界(闭源商业核心:调度 / 记忆治理 / 沙箱 / 评估)——见 双许可说明

SuperMate Harness System · 构建于 DeepSeek Harness(DSH)插件生态之上——话题 dsh-plugin*

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群