DeepSeek Harness Hub
← 返回列表

插件进化实验室Milbaxter/dsh-evolution-lab

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

用可复现实验筛选更优插件配置并公开结果

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/8 · 已提供中文文档

通过可复现、预算可控的实验和社区贡献,开放研究更好的DeepSeek Harness插件和配置。

综合分
29.1
GitHub 分
29.1
用户评分
★ Stars
0
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Milbaxter/dsh-evolution-lab
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

DSH 进化实验室

免费检查
许可证:MIT

一个开放研究实验室,通过可复现的实验寻找更好的 DeepSeek Harness 配置。 从官方默认插件和最便宜的已验证 DeepSeek 文本模型开始。诊断失败,测试一个小改动,测量其准确率、成本和速度,只有在证据站得住脚时才保留它。

我希望参与 DSH 插件生态系统并为其持续演进做出贡献:有用的插件、更好的基准测试、独立复现以及诚实的负面结果。这个仓库是我的工作实验室和研究笔记,在 AI 辅助下开发。欢迎对方法论提出贡献和挑战。

当前结果:没有任何插件获得晋升。默认 DSH 仍是现任者。
这是早期研究,并非声称已构建出最智能的 harness。

我们试图发现什么?

哪种模型加 harness 的配置对于指定的工作负载、成本限制和延迟目标表现最佳?我们能否在不针对用于开发它的任务过拟合的情况下反复改进它?插件何时比更简单的配置更改更好——或者比给默认 agent 相同的额外推理预算更好?

其雄心是覆盖编码、推理、调查和会话恢复的广泛能力。目前的测量覆盖带有本地证据的小型自编测试夹具。真实仓库基准测试、实时研究和真正的多会话记忆评估仍需努力。

研究循环

flowchart LR
A[Shipped default] --> H[Calibrate difficulty on development tasks]
H --> B[Audit failures and costs]
B --> C[One structural or guidance change]
C --> D[Free checks and cheap screening]
D --> E[Paired development tests]
E --> F[Fresh confirmation and replication]
F --> G[Keep, replace or remove components]
G --> A

- 在扩展实验之前,要求默认准确率在一个单独的、经过审计的开发集上总体以及每个声称的领域都低于 50%。遵循基线校准门;CLI 不会强制执行它。
- 让观察到的失败驱动候选方案的开发。
- 允许添加、移除和替换。更多插件并不天然更好。
- 将结构性更改与指导性更改分开;在合并前测试交互作用。
- 保留有用的准确率/成本/速度权衡,并带有不确定性,而不是宣布一个无条件的单一赢家。在配置文件之间进行路由也需要自己的测试。
- 将 agent 的自我反馈视为需要对照轨迹进行检查的主张,而不是因为模型说了它就变成真的解释。
- 保留失败的运行和验证器的错误。在确认之前冻结候选方案。

参见实验协议、研究全景
和路线图。HarnessCompass、HarnessLens 以及对 harness
演进的批评为这些问题提供了参考;本仓库并不声称复现了它们的结果。

九月的对外 MBPP/BBH/HotpotQA 测试套件还暴露了一个天花板问题:
默认设置在全部 75 次编码尝试和全部 75 次推理尝试中均通过(每个领域 25 个任务重复三次)。这些结果来自一个有限的测试套件,是观察结果,而非广泛的能力判定。保留简单任务用于回归检查;未来的主评估必须先在独立的开发数据上通过难度校准。

已实现的内容

| 组件 | 状态 |
|---|---|
| 真实的 DSH 无头运行时、固定依赖和原生插件补丁 | 可用 |
| Docker 隔离和按量计费的仅限 DeepSeek 网关 | 可用 |
| 持久化的全局、活动、运行和请求次数限制 | 可用;基于固定价格的估算,并非账户范围的计费保证 |
| 配对随机实验和精确评分器 | 可用;验证器更正会被记录 |
| 独立的编辑清单、静态任务标记 lint 和冻结的引导适配器 | 可用;仍需进行语义审查 |
| 有界的盲测/事后反馈包和引文锚点检查 | 准备工作可用;反馈收集和因果审查尚未自动化 |
| 组合分析和保守的晋升审计 | 可用;无自动晋升 |
| 自主持续插件发明、独立留出服务、生态系统排行榜 | 未实现 |

本地候选方案为 verify-first 和
core-tools。其他分支会更改已发布的 PTC/剪枝设置或
思考投入。模型设置的更改与插件收益分开报告。

初步证据——2026 年 9 月 7 日

公开的证据档案包含五个付费开发活动、84 次尝试的任务运行、逐次调用记账、报告、验证器勘误、可获取时的源快照,以及生成的工作区产物。

| 实验 | 观察结果 | 解读 |
|---|---|---|
| 12 任务诊断筛选 | 默认、关闭思考和 verify-first:12/12;PTC:11/12 | 范围狭窄、得分触及天花板的筛选;无晋升 |
| 减少工具暴露 | 首个主请求约 41KB → 19KB;26 → 6 个 schema | 更少的输入并未转化为可比的账单节省,因为缓存和输出成本也很重要 |
| 最终更正契约冒烟测试,3 个任务 | 默认:3/3;低思考和禁用思考:各 2/3 | 两种更便宜的设置都触及了修复响应限制;样本量太小,无法得出一般性结论 |

实验室还发现了自身的评分器错误:数值相等判断和未充分指定的
JSON 输出格式。原始结果仍然可用,并附有明确的勘误。
当前套件是 diagnostic-v2 和 transfer-v3。公开生成的种子划分
并非秘密的、独立管理的留出集。绝不要在没有合理比较设计的情况下,
将不同套件版本合并到同一个排行榜中。

运行免费检查

需要 Python 3.9+;此处不需要 API 密钥、Docker 或付费生成。

git clone https://github.com/Milbaxter/dsh-evolution-lab.git
cd dsh-evolution-lab
python3 -m unittest discover -s tests -v

运行实际的测试框架

初始主机是一台 8GB 的 Apple 芯片 Mac,使用 Colima,配置为 2 个 CPU/2GB RAM。
对于已安装 Colima 和 Docker CLI 的 macOS:

colima start --profile deepseek-lab --cpu 2 --memory 2 --disk 16 --vm-type vz --mount-type virtiofs
export DSH_LAB_DOCKER_CONTEXT=colima-deepseek-lab
docker --context "$DSH_LAB_DOCKER_CONTEXT" build -f containers/Dockerfile.agent -t deepseek-lab-agent:0.1 .
docker --context "$DSH_LAB_DOCKER_CONTEXT" build -f containers/Dockerfile.gateway -t deepseek-lab-gateway:0.1 .
docker --context "$DSH_LAB_DOCKER_CONTEXT" pull python:3.12-slim
python3 scripts/check_graders.py
python3 -m lab.run --mock --suite transfer --variants default core-tools

对于 Linux 上现有的 Docker Engine,请设置 DSH_LAB_DOCKER_CONTEXT=default,
并对相同的构建命令使用该上下文。此可移植性选项已包含在内;
最初的付费证据是在 Mac 上收集的,并未跨平台验证。
模拟运行会启动真实的测试框架,但返回固定响应:其任务分数
不是模型性能证据。

在免费检查之后,若要进行有意的小规模付费运行:

python3 scripts/set_key.py       # hidden input; stores the key outside this repo
python3 scripts/check_balance.py # free credit lookup
python3 -m lab.run --stage smoke --suite transfer --variants default verify-first --campaign-cap 0.12

当前共享响应限制:每次模型调用 16,384 个输出 token,包括推理内容。
维护者选择了此预算;早期报告使用了 4,096,
并且必须保留其原始标签。

模型和资费快照:deepseek-v4-flash,检查于 2026-09-07。恢复时请核实
官方定价;
网关会拒绝超过七天的价格。初始累计实验室
上限为 20 美元。充值绝不会重置账本,也不会悄悄提高该上限。
每个辅助请求和重试都必须通过同一个网关。

将 state/、logs/、reports/ 和凭据保留在本地。公开证据归档
是经过审查的导出,并不是盲目提交未来原始会话的理由。在
Mac VM 上,当网关运行时,从 Linux 通过 lab.run.live_accounting 访问实时 SQLite 记账。
在进行任何更大规模的活动之前,请参阅协议。

加入这项工作

打开一个 issue 或一个
discussion,或者发送一个
pull request。最有用的早期贡献是:
- 带有强大且独立检查的评分器的外部任务包。
- 我们的基线和负面结果的可复现。
- 与特定观察到的失败相关联的候选方案,并附有预测成本和风险。
- 真正的重启/内存场景、匹配预算的对照组,以及更好的归因。
- 与现有 DSH 评估项目的互操作性,而不是重复的基础设施。

阅读 CONTRIBUTING.md。社区结果应说明它击败了什么、在哪些任务上、在哪些约束下,以及具有何种不确定性。目标是朝着更好的测试框架共同进步——而不是让某个偏好的插件通过设计获胜。

MIT 许可;第三方声明见 NOTICE.md。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群