← 返回列表
未验证
用可复现实验筛选更优插件配置并公开结果
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/8 · 已提供中文文档
通过可复现、预算可控的实验和社区贡献,开放研究更好的DeepSeek Harness插件和配置。
综合分
29.1
GitHub 分
29.1
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Milbaxter/dsh-evolution-lab该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
DSH 进化实验室 免费检查 许可证:MIT 一个开放研究实验室,通过可复现的实验寻找更好的 DeepSeek Harness 配置。 从官方默认插件和最便宜的已验证 DeepSeek 文本模型开始。诊断失败,测试一个小改动,测量其准确率、成本和速度,只有在证据站得住脚时才保留它。 我希望参与 DSH 插件生态系统并为其持续演进做出贡献:有用的插件、更好的基准测试、独立复现以及诚实的负面结果。这个仓库是我的工作实验室和研究笔记,在 AI 辅助下开发。欢迎对方法论提出贡献和挑战。 当前结果:没有任何插件获得晋升。默认 DSH 仍是现任者。 这是早期研究,并非声称已构建出最智能的 harness。 我们试图发现什么? 哪种模型加 harness 的配置对于指定的工作负载、成本限制和延迟目标表现最佳?我们能否在不针对用于开发它的任务过拟合的情况下反复改进它?插件何时比更简单的配置更改更好——或者比给默认 agent 相同的额外推理预算更好? 其雄心是覆盖编码、推理、调查和会话恢复的广泛能力。目前的测量覆盖带有本地证据的小型自编测试夹具。真实仓库基准测试、实时研究和真正的多会话记忆评估仍需努力。 研究循环 flowchart LR A[Shipped default] --> H[Calibrate difficulty on development tasks] H --> B[Audit failures and costs] B --> C[One structural or guidance change] C --> D[Free checks and cheap screening] D --> E[Paired development tests] E --> F[Fresh confirmation and replication] F --> G[Keep, replace or remove components] G --> A - 在扩展实验之前,要求默认准确率在一个单独的、经过审计的开发集上总体以及每个声称的领域都低于 50%。遵循基线校准门;CLI 不会强制执行它。 - 让观察到的失败驱动候选方案的开发。 - 允许添加、移除和替换。更多插件并不天然更好。 - 将结构性更改与指导性更改分开;在合并前测试交互作用。 - 保留有用的准确率/成本/速度权衡,并带有不确定性,而不是宣布一个无条件的单一赢家。在配置文件之间进行路由也需要自己的测试。 - 将 agent 的自我反馈视为需要对照轨迹进行检查的主张,而不是因为模型说了它就变成真的解释。 - 保留失败的运行和验证器的错误。在确认之前冻结候选方案。 参见实验协议、研究全景 和路线图。HarnessCompass、HarnessLens 以及对 harness 演进的批评为这些问题提供了参考;本仓库并不声称复现了它们的结果。 九月的对外 MBPP/BBH/HotpotQA 测试套件还暴露了一个天花板问题: 默认设置在全部 75 次编码尝试和全部 75 次推理尝试中均通过(每个领域 25 个任务重复三次)。这些结果来自一个有限的测试套件,是观察结果,而非广泛的能力判定。保留简单任务用于回归检查;未来的主评估必须先在独立的开发数据上通过难度校准。 已实现的内容 | 组件 | 状态 | |---|---| | 真实的 DSH 无头运行时、固定依赖和原生插件补丁 | 可用 | | Docker 隔离和按量计费的仅限 DeepSeek 网关 | 可用 | | 持久化的全局、活动、运行和请求次数限制 | 可用;基于固定价格的估算,并非账户范围的计费保证 | | 配对随机实验和精确评分器 | 可用;验证器更正会被记录 | | 独立的编辑清单、静态任务标记 lint 和冻结的引导适配器 | 可用;仍需进行语义审查 | | 有界的盲测/事后反馈包和引文锚点检查 | 准备工作可用;反馈收集和因果审查尚未自动化 | | 组合分析和保守的晋升审计 | 可用;无自动晋升 | | 自主持续插件发明、独立留出服务、生态系统排行榜 | 未实现 | 本地候选方案为 verify-first 和 core-tools。其他分支会更改已发布的 PTC/剪枝设置或 思考投入。模型设置的更改与插件收益分开报告。 初步证据——2026 年 9 月 7 日 公开的证据档案包含五个付费开发活动、84 次尝试的任务运行、逐次调用记账、报告、验证器勘误、可获取时的源快照,以及生成的工作区产物。 | 实验 | 观察结果 | 解读 | |---|---|---| | 12 任务诊断筛选 | 默认、关闭思考和 verify-first:12/12;PTC:11/12 | 范围狭窄、得分触及天花板的筛选;无晋升 | | 减少工具暴露 | 首个主请求约 41KB → 19KB;26 → 6 个 schema | 更少的输入并未转化为可比的账单节省,因为缓存和输出成本也很重要 | | 最终更正契约冒烟测试,3 个任务 | 默认:3/3;低思考和禁用思考:各 2/3 | 两种更便宜的设置都触及了修复响应限制;样本量太小,无法得出一般性结论 | 实验室还发现了自身的评分器错误:数值相等判断和未充分指定的 JSON 输出格式。原始结果仍然可用,并附有明确的勘误。 当前套件是 diagnostic-v2 和 transfer-v3。公开生成的种子划分 并非秘密的、独立管理的留出集。绝不要在没有合理比较设计的情况下, 将不同套件版本合并到同一个排行榜中。 运行免费检查 需要 Python 3.9+;此处不需要 API 密钥、Docker 或付费生成。 git clone https://github.com/Milbaxter/dsh-evolution-lab.git cd dsh-evolution-lab python3 -m unittest discover -s tests -v 运行实际的测试框架 初始主机是一台 8GB 的 Apple 芯片 Mac,使用 Colima,配置为 2 个 CPU/2GB RAM。 对于已安装 Colima 和 Docker CLI 的 macOS: colima start --profile deepseek-lab --cpu 2 --memory 2 --disk 16 --vm-type vz --mount-type virtiofs export DSH_LAB_DOCKER_CONTEXT=colima-deepseek-lab docker --context "$DSH_LAB_DOCKER_CONTEXT" build -f containers/Dockerfile.agent -t deepseek-lab-agent:0.1 . docker --context "$DSH_LAB_DOCKER_CONTEXT" build -f containers/Dockerfile.gateway -t deepseek-lab-gateway:0.1 . docker --context "$DSH_LAB_DOCKER_CONTEXT" pull python:3.12-slim python3 scripts/check_graders.py python3 -m lab.run --mock --suite transfer --variants default core-tools 对于 Linux 上现有的 Docker Engine,请设置 DSH_LAB_DOCKER_CONTEXT=default, 并对相同的构建命令使用该上下文。此可移植性选项已包含在内; 最初的付费证据是在 Mac 上收集的,并未跨平台验证。 模拟运行会启动真实的测试框架,但返回固定响应:其任务分数 不是模型性能证据。 在免费检查之后,若要进行有意的小规模付费运行: python3 scripts/set_key.py # hidden input; stores the key outside this repo python3 scripts/check_balance.py # free credit lookup python3 -m lab.run --stage smoke --suite transfer --variants default verify-first --campaign-cap 0.12 当前共享响应限制:每次模型调用 16,384 个输出 token,包括推理内容。 维护者选择了此预算;早期报告使用了 4,096, 并且必须保留其原始标签。 模型和资费快照:deepseek-v4-flash,检查于 2026-09-07。恢复时请核实 官方定价; 网关会拒绝超过七天的价格。初始累计实验室 上限为 20 美元。充值绝不会重置账本,也不会悄悄提高该上限。 每个辅助请求和重试都必须通过同一个网关。 将 state/、logs/、reports/ 和凭据保留在本地。公开证据归档 是经过审查的导出,并不是盲目提交未来原始会话的理由。在 Mac VM 上,当网关运行时,从 Linux 通过 lab.run.live_accounting 访问实时 SQLite 记账。 在进行任何更大规模的活动之前,请参阅协议。 加入这项工作 打开一个 issue 或一个 discussion,或者发送一个 pull request。最有用的早期贡献是: - 带有强大且独立检查的评分器的外部任务包。 - 我们的基线和负面结果的可复现。 - 与特定观察到的失败相关联的候选方案,并附有预测成本和风险。 - 真正的重启/内存场景、匹配预算的对照组,以及更好的归因。 - 与现有 DSH 评估项目的互操作性,而不是重复的基础设施。 阅读 CONTRIBUTING.md。社区结果应说明它击败了什么、在哪些任务上、在哪些约束下,以及具有何种不确定性。目标是朝着更好的测试框架共同进步——而不是让某个偏好的插件通过设计获胜。 MIT 许可;第三方声明见 NOTICE.md。
扫码进群