DeepSeek Harness Hub
← 返回列表

四模式评测审计Stakataka-3030/dsh-pe998-audit

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
需源码安装

对比四种运行模式的成本耗时与验证量

暂不能直接安装(需源码编译或环境不满足):仓库缺少 package.json,无法用 dsh 插件安装命令安装。 · 最近上游提交 2026/8/20 · 已提供中文文档

DSH × PE998 四模式评测审计:standard/anchored/zero/router 对比(成本/耗时/思维链/验证量);附 GPT-5.6 Sol / Claude Fable 5 / Opus 4.8 网络参考评测

综合分
33
GitHub 分
33
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Stakataka-3030/dsh-pe998-audit
仓库缺少 package.json,无法用 dsh 插件安装命令安装,改用 GitHub 源安装
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查需源码安装

以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。

npm 包dsh-pe998-audit(未发布到 npm,仅可源码安装)
Node 引擎未声明 engines.node
dsh CLI 依赖未声明 dsh 版本约束
入口文件缺少入口声明

仓库缺少 package.json,无法用 dsh 插件安装命令安装

验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/18 17:00:33

用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

DSH × PE998 四模式评测审计

DeepSeek Harness(DSH)四种运行模式在 Project Euler 998 (Squaring the Triangle) 上的对比审计。
另含 2026-08-16 的 V4 Flash × dsh-routing-suite 补充评测(见下文)。
任务:求 T(10^6)(最小包围正方形边长为整数的非全等整数三角形周长之和)。
权威答案:*(已通过两个独立来源验证;按 Project Euler 条款不在本仓库公开)。

评测对象

| 模式 | 来源 |
|---|---|
| Standard | DeepSeek Harness 本体官方模式 |
| Anchored Standard | xiaobright/dsh-anchored-standard |
| Zero Anchored Standard | xiaobright 插件变体(零注入版) |
| Router Standard | yjh051108/dsh-router-standard |

结果摘要

| 项 | Standard | Anchored | Zero Anchored | Router |
|---|---|---|---|---|
| 结果 | ✅ PASS | ✅ PASS | ✅ PASS | ❌ 中断 |
| steps | 89 | 98 | 163 | 104 |
| 输出 token | 272,418 | 125,586 | 133,960 | 274,098 |
| 总耗时(墙钟) | 101.9m | 46.7m | 53.7m | 160.1m |
| 折算成本 | ¥7.04 | ¥3.43 | ¥4.24 | ¥8.74 |
| 验证量 | 充足 | 充分 | 过度 | 失衡 |
| 思维风格 | I/let me | We/our | We/let's | I/let me |

\ 按 DeepSeek 官方 API 单价折算(缓存命中 ¥0.15/M、未命中 ¥4.5/M、输出 ¥13.5/M);实际运行于 opencode-go 订阅制。

V4 Flash 补充评测(2026-08-16)

在相同环境(DSH rc.6 / opencode-go / reasoning_effort=max)下追加一轮 deepseek-v4-flash × dsh-routing-suite 评测(套件 v0.1.0:Router Standard / Router Spec 预设 + super-injector v0.3.3)。
四路:A=官方 Standard(对照)、B=Router Standard、C=Router Spec、D=Router Spec+锁 react(dev_router_mode react)。墙钟上限 90 分钟。

| 项 | A Standard | B Router Std | C Router Spec | D Spec+react |
|---|---|---|---|---|
| 结果 | ⚠️ 算出未提交 | ✅ PASS | ❌ 未完成 | ✅ PASS |
| 答案 |  |  | — |  |
| 墙钟 | ~90m | 33.6m | ~91m | 77.5m |
| 输出 token | 205,618 | 83,654 | 208,701 | 215,050 |
| 折算成本 | ¥7.15 | ¥5.55 | ¥7.15 | ¥9.42 |
| 验证量 | 过度 | 恰当偏充分 | 充分但慢 | 恰当 |
| 思维风格 | I / let me | We / let's(零 let me) | 雷霆大思考 | I / let me |

关键结论:
- Router Standard 是 Flash 上最优:33.6m / 83.7K 输出 / 零 let me / 双语言交叉验证;
- 同一插件在 Pro 上失败(Router 中断)、在 Flash 上两路完成——插件价值强依赖模型;
- Router Spec 在 Flash 上失败:雷霆大思考吞掉 65–75% 输出预算且最终算法无法在时限内跑完;
- 对照 Standard 已算出答案,但因验证过度与自造的产物文件覆盖事故未提交。

详细见 AUDIT-REPORT-FLASH.md。

文件

AUDIT-REPORT.md      完整审计报告(测试逻辑/测试内容/分项审议/结论/附录)
AUDIT-REPORT-FLASH.md  V4 Flash × dsh-routing-suite 补充评测(2026-08-16,脱敏)
scripts/             评测脚手架:grade.py(判分) monitor.py(监控) analysis_tool.py(日志分析) task-message.md(统一任务消息)
results/             四路思维链/工具/代词/高频词统计 (stats.json)

测试环境(2026-08-15)

| 类别 | 值 |
|---|---|
| 操作系统 | Windows 11 家庭版 中文版(Build 26200) |
| CPU | Intel Core i9-14900HX(24 核 / 32 线程) |
| 内存 | 31.7 GB |
| Node.js | v22.20.0 |
| Python | 3.11.5 |
| C++ 编译器 | g++ 15.1.0(MinGW-w64) |
| PowerShell | 7.6.4 |
| DeepSeek Harness | 0.1.0-rc.6(npx @deepseek-ai/dsh web) |
| 模型 | opencode-go(OpenCode Zen 订阅)/ deepseek-v4-pro(0813)/ reasoning_effort=max,contextWindow 1M / maxTokens 384K |
| 评测插件 | xiaobright/dsh-anchored-standard @43668dc(含 Zero Anchored);yjh051108/dsh-router-standard @5737535 |
| 运行方式 | Web UI 多工作区四会话并行;flash 子代理后台监控 |
| 时区 / 窗口 | Asia/Shanghai;14:15–16:56(北京) |

复现要点

- 环境:DSH(npx @deepseek-ai/dsh web)+ opencode-go / deepseek-v4-pro / reasoning_effort=max
- 四工作区完全隔离并行,四路使用同一任务消息(scripts/task-message.md)
- 任务硬性禁网;强制先复现官方检查点 T(40)=346 / T(400)=76402 / T(2000)=3237036
- 判分:answer.txt 与独立判分基准比对(值未公开,grade.py)
- 额度护栏:每会话 steps ≤ 1500(monitor.py)

外部参考评测(来自网络)

下表为网络上已有的 PE 998 跨模型实测(来源:classmethod 开发者博客,作者 Takeda,2026-07-11;链接见文末)。该评测为各模型在 Coding Agent 环境下的单次运行(非严格 benchmark),token 口径不一致(Claude=输出含思考;Codex CLI=CLI 报告值),仅作横向参考。

| 模型 | effort | 结果 | 耗时 | token(参考) |
|---|---|---|---|---|
| Claude Fable 5 | medium | ✅ 正确 | 38.6 min | 61.0K |
| Claude Fable 5 | high | ✅ 正确 | 52.0 min | 56.2K |
| Claude Opus 4.8 | medium | ✅ 正确 | 168 min | 185.8K |
| Claude Opus 4.8 | high | ✅ 正确 | 98.0 min | 179.9K |
| GPT-5.6 Sol | medium | ❌ 错误(候选未做最终验证,样例全过但答案错) | ~10 min | 74.7K |
| GPT-5.6 Sol | high | ✅ 正确 | ~20 min | 125.6K |

出处:I had Fable 5, Opus 4.8, and GPT 5.6 Sol solve difficult Project Euler problems and compared them(DevelopersIO, 2026-07-11)

对照本评测:V4 Pro(max)三路成功模式耗时 46.7–101.9 min、输出 125K–272K token,与上述闭源旗舰的 medium/high 档处于同一量级;本评测中三路成功者均完整复现官方检查点,未出现"样例过但答案错"。[^independent]

核心结论

1. 三路独立 PASS(与独立判分基准一致,基准值未公开);模型验证习惯可靠
2. Anchored 全面最优(成本/耗时/工程/验证性价比)
3. 思维风格是强预测因子:spec 集体风格(We)两路省且成功;react 单数风格(I/let me)烧 token 多,Router 失败
4. Router 失败模式=有解法没闭环:快速算法接近正确但未验证,退回 O(n³) 暴力死路

注意事项

- 本项目涉及 Project Euler 101+ 题目(998),报告含答案与解题思路;请遵守 Project Euler 使用条款,勿扩散题解
- 本仓库不包含模型的解题代码产物(仅评测框架、统计与报告)

免责声明

1. 非官方评测:本评测由独立 AI 代理(Codex)设计、执行、复核并撰写,与 DeepSeek、OpenCode、GitHub、任何模型厂商及本仓库引用的插件作者均无隶属或委托关系。
2. 时效与环境:结果仅代表 2026-08-15(v4-pro)与 2026-08-16(v4-flash)两次独立评测、opencode-go / reasoning_effort=max、Windows 环境的有限次数运行;模型与平台随时可能更新,结论不保证可复现。
3. 不构成建议:报告中的对比、成本估算与结论不构成对任何模型、插件、服务或订阅方案的推荐或贬损;请基于自身场景独立验证。
4. 数据局限:成本按官方 API 单价折算,实际订阅制费用另计;网络参考评测数据版权归原出处所有,本仓库仅作引用。
5. 内容合规:本仓库涉及 Project Euler 101+ 题目(998),含答案与解题思路,请遵守 Project Euler 使用条款;发布者不对他人违规扩散负责。
6. 责任免除:使用本仓库任何内容所产生的直接或间接后果,由使用者自行承担。
7. Project Euler 合规:PE 998 属 Project Euler 101+ 题目;本仓库已按官方条款移除答案与解法细节(以  代替),请勿试图在本仓库获取或传播该题答案/解法。

License

报告与数据:CC BY 4.0;脚本:MIT

[^independent]: 本评测由独立 AI 代理(Codex)设计、执行、复核并撰写,非 DeepSeek / OpenCode / 任何模型厂商的官方评测;网络参考评测数据版权归原出处所有。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群