DeepSeek Harness Hub
← 返回列表

MJorgin/dsh-media-skills

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
⚠ 装前注意

🎨 dsh-media-skills

基本兼容但装前注意:未发布到 npm registry,仅可从源码安装 · 最近上游提交 2026/9/17 · 已提供中文文档

为 DeepSeek Harness(rc.7 / rc.8 / v0.1.1-rc.1 / rc.2 / v0.1.2-alpha.3)提供的免费图像读取与生成——粘贴图像读取,支持自动视觉转录,DeepSeek-V4-Flash-Vision-Exp / GLM-4V-Flash / SenseNova / Gemini 故障转移,Kolors + U1 Fast 生成。仓库中不含密钥。

综合分
42.4
GitHub 分
42.4
用户评分
★ Stars
18
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add MJorgin/dsh-media-skills
未发布到 npm registry,仅可从源码安装,改用 GitHub 源安装
数据截至 2026/9/17(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查⚠ 装前注意

以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。

npm 包dsh-media-skills(未发布到 npm,仅可源码安装)
Node 引擎未声明 engines.node
dsh CLI 依赖未声明 dsh 版本约束
入口文件main/exports/bin 已声明

未发布到 npm registry,仅可从源码安装

验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/17 23:38:58

用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

🎨 dsh-media-skills

为 DeepSeek Harness 装上眼睛——以及一支画笔。在任何聊天中读取图像、生成新图像,全部使用免费模型。

License: MIT
Python 3.9+
DeepSeek Harness
Free vision
Free generation
No hardcoded keys
Docs
Harness

DeepSeek Harness 在推理方面非常出色——但纯文本模型无法看到你刚刚拖入聊天中的图像。这个工具包通过两个免费技能、一条免费视觉模型路线以及一条视觉引擎故障转移链解决了这个问题:

- 📎 粘贴即可读取——在任何会话中粘贴、拖拽或选择图像;免费的视觉模型会将其转换为当前模型能理解的文本。(由 DeepSeek Harness 核心自动描述路径驱动——参见 docs/HARNESS_PATCH_EN.md;本工具包提供了视觉模型路线及其所依赖的技能。)
- 👁️ vision-review——分析图像和截图,捕捉 UI 视觉缺陷,检测水印,将图像转换为文本。
- 🎨 media-tools——使用免费、无水印的模型生成插图、头像、背景和横幅。
- 🔀 引擎故障转移——GLM-4V-Flash(免费)→ DeepSeek-V4-Flash-Vision-Exp(与你的 agent 使用相同密钥,质量更高)→ SiliconFlow Qwen3-VL → SenseNova → Google Gemini(AI Studio)→ 任何 OpenAI 兼容端点,并输出 ModLens 风格的结构化证据。

没有硬编码密钥,没有付费 API,没有文件保存,没有会话切换。

为什么 · 快速开始 · 实际效果 · 使用方法 · 密钥与隐私 · 常见问题 · 示例

English · 简体中文 · 繁體中文 · 日本語 · 한국어 · Español · Deutsch · Português · Русский

🤔 为什么
大多数 DSH 视觉插件只能读取图像——而且很多会把你引向一个共享的第三方端点。dsh-media-skills 采取了不同的立场:

| | 本捆绑包 | 典型的纯视觉插件 |
|---|---|---|
| 免费读取图像 | ✅ GLM-4V-Flash(免费)· DeepSeek-V4-Flash-Vision-Exp(v0.1.1 默认,同一密钥) | ✅ |
| 免费生成图像 | ✅ SenseNova U1 Fast → SiliconFlow Kolors | ❌ 通常没有 |
| 选择器中的自动模型路由 | ✅ 自动安装 | 有时 |
| 密钥提交到仓库 | ❌ 从不——密钥保留在本地 | ⚠️ 通常需要 |
| 多语言文档 | ✅ 9 种语言 | ❌ 通常只有英文 |
| 隐私 | ✅ 由你选择提供商;图像只会发送到你的提供商 | 共享的免费端点可以看到你的图像 |

为什么要自带免费密钥,而不是使用内置的匿名端点? 隐私和可靠性。你的图像只会发送到你选择的提供商,使用你的账户和你的速率限制——中间没有共享的第三方服务。

新版本适配:在 DeepSeek Harness ≥ v0.1.1-rc.1 上,deepseek-official 路由原生附带 DeepSeek-V4-Flash-Vision-Exp——粘贴图像转录和视觉模型路由会自动使用你的 agent 已有的密钥识别它(零额外密钥)。rc.7 / rc.8 应用捆绑的补丁(见 HARNESS_PATCH)。

✨ 你将获得

| 能力 | 功能 | 模型 | 费用 |
|---|---|---|---|
| 🖼️ 粘贴图像读取 | 在纯文本会话中,将图像粘贴、拖拽或选取(添加图像按钮,由 client-ux 补丁恢复)到输入框;它由视觉模型描述(v0.1.1:默认 DeepSeek-V4-Flash-Vision-Exp;rc.7/rc.8:GLM-4V-Flash,带 SiliconFlow Qwen3-VL 故障转移,每条路由 15 秒),并作为文本连同实时缩略图交给当前模型。(rc.7/rc.8 上的 Harness 核心功能:需要 api-proxy 准入补丁 + rc.8 client-ux 补丁——见 docs/HARNESS_PATCH.md / HARNESS_PATCH_EN.md,补丁文件包含 rc.7、rc.8、v0.1.1-rc.1 和 v0.1.1-rc.2 版本;本捆绑包提供它所依赖的视觉路由 + 技能) | v0.1.1:DeepSeek-Vision-Exp · rc.7/8:GLM-4V-Flash + Qwen3-VL | GLM 免费;DeepSeek 从你的余额计费(v0.1.1 默认) |
| 🧠 视觉模型路由 | 「智谱 GLM-4V-Flash(视觉)」会自动出现在模型选择器中;在 v0.1.1 上,deepseek 路由还原生附带 DeepSeek-V4-Flash-Vision-Exp(同一密钥)——任选其一开始新对话,直接谈论图像 | 智谱 GLM-4V-Flash · DeepSeek-V4-Flash-Vision-Exp(v0.1.1) | GLM 免费;DeepSeek 计费 |
| 👁️ vision-review | 分析 / 识别 / 描述图像与截图;捕捉 UI 视觉缺陷(重叠、溢出、错位);检测水印/徽标;将图像转为文本。可选的 --structured 模式返回 ModLens 风格的证据 JSON(摘要、完整 OCR、阅读顺序布局、实体/关系、不确定性)。引擎故障转移链:GLM-4V-Flash → DeepSeek-V4-Flash-Vision-Exp / SiliconFlow Qwen3-VL / SenseNova / Google Gemini(有密钥时自动加入)→ 任意 OpenAI 兼容端点 | GLM-4V-Flash + DeepSeek-Vision-Exp + Qwen3-VL + SenseNova + Gemini | GLM/SiliconFlow 免费;DeepSeek 使用你的 API 余额(可选) |
| 🎨 media-tools | 生成图像、插图、头像、背景、横幅 | SenseNova U1 Fast → SiliconFlow Kolors | 免费,无水印 |

⚡ 快速开始

dsh plugin --profile  add github:MJorgin/dsh-media-skills

1. 密钥:
- v0.1.1-rc.1+:无需额外密钥——粘贴读取和视觉路由运行在你 agent 现有的 DEEPSEEK_API_KEY(DeepSeek-V4-Flash-Vision-Exp)上。
- rc.7 / rc.8(或添加免费引擎):智谱 — open.bigmodel.cn → API Keys(glm-4v-flash 免费);SiliconFlow — siliconflow.cn → API Keys(Kolors 免费);(可选) Google Gemini — aistudio.google.com → Get API key;自动加入视觉故障转移链
2. 添加它们 在 Web GUI 中(Settings → Models → zhipu-vision 提供商的 API Key 字段),或使用凭据文件:

~/.dsh/.credentials.yaml (chmod 600)
GLM_API_KEY:

3. 重启 dsh web,然后强制刷新(Cmd+Shift+R)。

验证:模型选择器显示 智谱 GLM-4V-Flash(视觉)。如果你的 Harness 构建支持粘贴图像读取,输入栏还会有一个 📎 Add image 按钮——在任何会话中粘贴图像,它会以文本描述的形式到达。

完整演练和故障排除:docs/SETUP_VISION_EN.md。

📸 实际效果

在纯文本会话中粘贴图像 → 免费视觉模型描述它 → 你的模型作答。同一个包还能按需生成新图像。

一图看懂工作原理:

🚀 使用方法

读取图像的三种方式:

| 方式 | 如何操作 | 何时使用 |
|---|---|---|
| A. 直接粘贴(推荐) | 在任何会话中,点击 📎 按钮 / 拖拽 / 粘贴图像并发送 | 日常图像问题——无需保存文件,无需切换模型 |
| B. 视觉模型会话 | 新建对话,选择智谱 GLM-4V-Flash(视觉),粘贴图片并聊天 | 多轮图片对话,原生 read_image |
| C. 文件 + 技能 | 将图片放入工作区,然后说“用 vision-review 读取这张图片” | 批量审查,脚本化工作流 |

描述跟随你的消息语言(中文消息 → 中文描述;英文消息 → 英文描述;无文本 → 中文)。

也可以直接说:

- “看看这张图片 / 检查这个截图有没有视觉问题” → vision-review
- “生成一张……的图片” → media-tools

🔑 密钥与隐私

密钥从不存储在此仓库中。技能脚本按以下顺序读取:环境变量 → ~/.dsh/secrets/media-tools.env → ~/.codex/secrets/media-tools.env(旧版回退)。视觉模型路由从 DSH 的凭据存储中读取 GLM_API_KEY。

在哪里获取密钥(全部免费):智谱 — open.bigmodel.cn → API Keys(glm-4v-flash)。SiliconFlow — siliconflow.cn → API Keys(Kolors)。Google(可选,会自动加入视觉故障转移链)— aistudio.google.com → Get API key。

~/.dsh/secrets/media-tools.env (chmod 600, one KEY=value per line)
GLM_API_KEY=...
SILICONFLOW_API_KEY=...
GEMINI_API_KEY=...   # optional

你的图片只会发送给你所配置的提供商——绝不会发送到此仓库,也绝不会发送到共享的匿名端点。

关于 Gemini 的隐私说明:Google 的免费层密钥附带数据使用条款——请求可能会被用于改进 Google 产品。对于敏感图片(身份证件、内部文档、客户数据),请优先使用国内的直连引擎(智谱 / SiliconFlow)。

❓ 常见问题

粘贴图片读取需要 DeepSeek Harness 核心补丁吗?
自动描述流水线位于 Harness 核心中(api-proxy 图片准入逻辑;参见 docs/HARNESS_PATCH_EN.md)。此捆绑包提供的是模型路由 + 技能:视觉模型在任何 DSH 构建上都能工作,但粘贴图片读取需要带有该核心支持的 Harness 构建——参见 docs/SETUP_VISION_EN.md 中的常见问题 Q1。

为什么不直接使用内置的免费端点,完全不需要密钥?
我们更希望让你掌控路由:你的图片发送给你所选择的提供商,受你的速率限制约束,没有共享的中间人。密钥是免费的,创建大约只需两分钟。

media-tools 真的免费吗?
是的——SiliconFlow Kolors 免费且无水印。如果某个模型被临时禁用,技能会列出可用模型,你可以切换。

🎁 示例

可立即尝试的示例素材——6 张 AI 生成的图片及其提示词,外加一张专门制作的视觉测试卡(标题、按钮、柱状图数值),用于检查读取准确度:

→ examples/README.md
🗺️ 布局

dsh-media-skills/
├── package.json           # dsh.bundle 清单
├── cordis.patch.yml       # 插件层
├── index.js               # 注册技能 + 初始化 zhipu-vision 模型路由
├── skills/
│   ├── vision-review/     # 图像读取
│   └── media-tools/       # 图像生成
├── examples/              # 示例图片 + 视觉测试卡
├── docs/
│   ├── screenshots/       # 演示效果图与工作原理图
│   ├── SETUP_VISION_EN.md # 详细配置指南(英文)
│   ├── SETUP_VISION.md    # 详细配置指南(中文)
│   ├── HARNESS_PATCH_EN.md# 本体补丁说明(英文)
│   ├── HARNESS_PATCH.md   # 本体补丁说明(中文)
│   ├── COMPARE_MODLENS.md # 与 ModLens 的对比/共存(中文)
│   └── lang/              # 9 种语言的 README
├── scripts/make-banner.py # 重新生成 docs/social-preview.png
└── docs/social-preview.png

🧩 与 ModLens 一起使用?

本插件包与 ModLens 都能为纯文本模型赋予视觉能力。二者同时安装不会冲突:ModLens 会优先拦截粘贴操作(路径 → modlens_read_image 工具),而本插件包的 api-proxy 回退机制会处理它未接管的部分。完整的对比、粘贴路由顺序,以及如何让 ModLens 指向同一个免费的智谱端点,请参见 docs/COMPARE_MODLENS.md(中文)。

🤝 加入 DSH 插件生态

DeepSeek Harness 开发者预览版仍处于面向 Harness 开发者的测试阶段;核心插件与基础 API 将持续迭代。我们期待与全球开发者一起,在开源、开放、可复用、可组合的基础设施之上,共同探索智能的上限。

- dsh-plugin 话题
- 快速开始
- DeepSeek Harness 仓库
- dsh-agent-conductor — 同作者的指挥家:在 DSH 里派活给 11 种外部 agent CLI(Codex / Claude Code / TraeCode…)

本仓库已打上 dsh-plugin 标签,并收录于 awesome-dsh-plugin 精选列表。欢迎提交 PR、issue 和翻译。

📄 许可证

MIT

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群