← 返回列表
未验证
一套跨模型通用的预设 + 派发 skill,让 DSH coding subagent…
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/5 · 已提供中文文档
Cross-model subagent preset + dispatch skill for DeepSeek Harness (DSH): a reliable component, not just a task solver. 跨模型 DSH coding subagent 预设 + 派发 skill:输出可解析、行为有界、汇报诚实
综合分
28.6
GitHub 分
28.6
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add shenzhantu/dsh-subagent-coding该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
subagent-coding 一套跨模型通用的预设 + 派发 skill,让 DSH coding subagent 表现得像一个可靠组件——输出可解析、行为有界、汇报诚实——而不仅仅是一个任务求解器。 一套跨模型通用的 DSH coding subagent 预设 + 派发 skill:证明方式不是「会做题」,而是「是可靠部件」——输出可解析、行为有界、汇报诚实、跨模型稳定。 Version DSH Models License: MIT 为什么需要它 / Why 主 Agent 程序化调用 subagent 时,痛点不在解题能力(旗舰模型在简单编码任务上早已饱和),而在行为契约: | 痛点 | 基线实测(minimal/standard 预设) | 本预设 + skill 实测 | |---|---|---| | 返回值主 Agent 能直接解析吗 | 11 个有效格 0 格产出可解析结构化返回(聊天 / markdown / 整段代码贴回复) | 单一 JSON(status / files_changed / verification / uncertainties / next_step_hint),schema 稳定 | | 坏环境(验收文件缺失)会怎样 | 有效 3 格全倒:2 次伪造验收(自建测试跑「通过」后宣称完成)+ 1 次非 JSON 但如实分项(主动报备「验收标准无法正式核实」) | 一次绕过后 blocked + 精确 next_step_hint;累计 20 轮 0 伪造 | | 同一任务重复派发结果稳定吗 | 方向「彩票」(同模型两轮走出相反优化方向) | 钉方向后 4/4 落地;差异格 pass^k 全绿(3/3 ×2 + 2/2) | | 换一家模型行为变吗 | — | 4 厂商模型(Kimi/GLM/Qwen/DeepSeek)契约行为跨模型稳定,双臂矩阵 11 有效格全部分化 | 数据采集于 2026-08-22/23(prompt 层)与 2026-08-25 至 09-04(skill 类型化层,80 轮双臂实测),DSH 0.1.1-rc.1。完整证据与「能主张 / 不能主张」清单:v0.2.2 综合发布报告(prompt 层)、v0.3.0 发布报告(skill 类型化 + 实测)、Phase 2 评测报告。 仓库内容 / What's in the box preset/ subagent-coding 预设 v0.3.0(prompt 内容与 v0.2.2 一致;agent.cordis.yml + preset.yml + system-prompt.md 镜像) skill/ subagent-dispatch 派发 skill(主 Agent 侧:任务类型路由、方向钉死、验收三件套、重派协议、泄漏自查、实测反哺的分级策略) tests/ 可复现基准套件:T 系列 8 任务 + C 系列 3 契约考题 + 双臂协议 + reset/purge 脚本 docs/ 治理、状态、计划、参考报告、研究资料与历史归档 四位一体:预设管 subagent 半边(行为契约),skill 管主 Agent 半边(派发质量)——「subagent 的失败,根源大多不在 subagent,而在派发文本没钉死关键信息」。 快速开始 / Quick start 要求:DSH 0.1.1-rc.1(本预设使用 ~/.dsh/.agent-presets/ 发现机制;改预设后需重启 DSH)。 1. 安装预设 mkdir -p ~/.dsh/.agent-presets/subagent-coding cp preset/agent.cordis.yml preset/preset.yml ~/.dsh/.agent-presets/subagent-coding/ 重启 DSH 后,Web UI 预设选择器中出现 "Subagent for Coding" 2.(可选,主 Agent 侧)安装派发 skill 到你的项目工作区 mkdir -p /.dsh/skills cp -r skill/subagent-dispatch /.dsh/skills/ 使用:主 Agent 按 skill 的覆盖清单起草派发文本(核心四项:方向钉死 / 验收三件套 / 范围边界 / 返回约定)→ 派发给 subagent → 收到 JSON 即停止交互,uncertainties 逐条裁决,blocked 先修环境再重派。派发文本逐字段指引与完整示例见 skill/subagent-dispatch/references/dispatch-guide.md。 Plugin 化(dsh plugin --profile add 一键安装)在路线图中:dsh plugin 机制为 profile 目录内的 pnpm 转发,交付物需包装为 plugin-bundle 补丁层——schema 调研完成前不承诺一键安装。 适用场景与不足 / Scenarios & limitations 适用:主 Agent 程序化派发编码子任务;长驻/自动化流程(环境故障有界上报,不死循环烧 token);跨厂商模型混用;需要可审计执行过程(判分协议含独立复验:复跑/diff/mtime)。 不足(如实声明,详见发布报告 §六): 1. token 开销真实存在:persona 约 2600 token + 协议交互;追求极致 token 的场景用 minimal 更省(但其行为轴实测全面劣化,时间方差达 27 倍) 2. 简单任务无区分度:解题轴饱和(双方全对)——价值在契约轴 3. 统计强度有限:矩阵多数格 n=1,仅差异格 pass^k(n=2-3) 4. 模型间残余差异:uncertainties 申报质量分层(qwen 型隐性契约盲区经 skill 派发层修复,属边际触发) 5. 版本绑定:实测于 DSH 0.1.1-rc.1,rc 版 schema 可能破坏性变更 6. 难题未分化:T09/T10 全员通过,下一档难度(多文件/并发/构建链)在路线图 复现基准 / Reproduce bash tests/reset.sh T09 # 重置任务工作区到起始态 DSH Web UI 新建会话 → 选预设+模型 → 粘贴派发文本(tests/tasks/T09/instruction.md 或 skill 起草版) bash tests/purge-c-sessions.sh # 判分后清除基准会话(防泄漏) 判分口径:tests/tasks/*/criteria.md(二值表);协议:tests/benchmark-protocol.md / tests/contract-protocol.md。⚠️ 任务与判分标准公开即视为被未来模型「见过」,复现数据请自行注明采集日期。 文档 / Docs | 文档 | 内容 | |---|---| | 综合发布报告 | 主张清单、证据层级、派发质量章节、方法论、诚实注记 | | 契约测试报告 | C 系列双臂完整数据(契约矩阵 / pass^k / 伪造行为全景) | | 多任务报告 | T 系列 / minimal 基线对照 / 难题实测 | | 跨模型报告 | 四模型验收与行为观察 | | 派发 Skill 报告 | 派发 Skill 双臂验证 + 边界补测 | | 完整文档导航 | 当前入口、治理、状态、计划、参考与归档位置 | | skill/subagent-dispatch/references/evidence.md | skill 每条规则的实测证据与诚实标注(直接实测 / 同族背书 / 工程判断) | 当前入口 - 开发者从 PRD.md 和 完整文档导航 开始; - Agent 必须先读取 AGENTS.md; - 当前状态见 PROGRESS.md; - 运行时权威源是 agent.cordis.yml; - system-prompt.md 是阅读镜像,不是修改源。 路线图 / Roadmap - [ ] 补充 T05/T06,并继续增加安全与环境故障契约题 - [ ] dsh plugin 打包调研 → 通过后上 dsh-plugin topic - [ ] continuable subagent 变体(多轮协作场景) - [ ] 将手工基准逐步迁移为隔离、可重复的 headless runner License MIT | 数据采集 2026-08-22/23 | 基准污染 caveat 见发布报告文首
扫码进群