← 返回列表
需源码安装
对比四种运行模式的成本耗时与验证量
暂不能直接安装(需源码编译或环境不满足):仓库缺少 package.json,无法用 dsh 插件安装命令安装。 · 最近上游提交 2026/8/20 · 已提供中文文档
DSH × PE998 四模式评测审计:standard/anchored/zero/router 对比(成本/耗时/思维链/验证量);附 GPT-5.6 Sol / Claude Fable 5 / Opus 4.8 网络参考评测
综合分
33
GitHub 分
33
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Stakataka-3030/dsh-pe998-audit仓库缺少 package.json,无法用 dsh 插件安装命令安装,改用 GitHub 源安装
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查需源码安装
以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。
✗npm 包dsh-pe998-audit(未发布到 npm,仅可源码安装)
✓Node 引擎未声明 engines.node
✓dsh CLI 依赖未声明 dsh 版本约束
✗入口文件缺少入口声明
仓库缺少 package.json,无法用 dsh 插件安装命令安装
验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/18 17:00:33
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
DSH × PE998 四模式评测审计 DeepSeek Harness(DSH)四种运行模式在 Project Euler 998 (Squaring the Triangle) 上的对比审计。 另含 2026-08-16 的 V4 Flash × dsh-routing-suite 补充评测(见下文)。 任务:求 T(10^6)(最小包围正方形边长为整数的非全等整数三角形周长之和)。 权威答案:*(已通过两个独立来源验证;按 Project Euler 条款不在本仓库公开)。 评测对象 | 模式 | 来源 | |---|---| | Standard | DeepSeek Harness 本体官方模式 | | Anchored Standard | xiaobright/dsh-anchored-standard | | Zero Anchored Standard | xiaobright 插件变体(零注入版) | | Router Standard | yjh051108/dsh-router-standard | 结果摘要 | 项 | Standard | Anchored | Zero Anchored | Router | |---|---|---|---|---| | 结果 | ✅ PASS | ✅ PASS | ✅ PASS | ❌ 中断 | | steps | 89 | 98 | 163 | 104 | | 输出 token | 272,418 | 125,586 | 133,960 | 274,098 | | 总耗时(墙钟) | 101.9m | 46.7m | 53.7m | 160.1m | | 折算成本 | ¥7.04 | ¥3.43 | ¥4.24 | ¥8.74 | | 验证量 | 充足 | 充分 | 过度 | 失衡 | | 思维风格 | I/let me | We/our | We/let's | I/let me | \ 按 DeepSeek 官方 API 单价折算(缓存命中 ¥0.15/M、未命中 ¥4.5/M、输出 ¥13.5/M);实际运行于 opencode-go 订阅制。 V4 Flash 补充评测(2026-08-16) 在相同环境(DSH rc.6 / opencode-go / reasoning_effort=max)下追加一轮 deepseek-v4-flash × dsh-routing-suite 评测(套件 v0.1.0:Router Standard / Router Spec 预设 + super-injector v0.3.3)。 四路:A=官方 Standard(对照)、B=Router Standard、C=Router Spec、D=Router Spec+锁 react(dev_router_mode react)。墙钟上限 90 分钟。 | 项 | A Standard | B Router Std | C Router Spec | D Spec+react | |---|---|---|---|---| | 结果 | ⚠️ 算出未提交 | ✅ PASS | ❌ 未完成 | ✅ PASS | | 答案 | | | — | | | 墙钟 | ~90m | 33.6m | ~91m | 77.5m | | 输出 token | 205,618 | 83,654 | 208,701 | 215,050 | | 折算成本 | ¥7.15 | ¥5.55 | ¥7.15 | ¥9.42 | | 验证量 | 过度 | 恰当偏充分 | 充分但慢 | 恰当 | | 思维风格 | I / let me | We / let's(零 let me) | 雷霆大思考 | I / let me | 关键结论: - Router Standard 是 Flash 上最优:33.6m / 83.7K 输出 / 零 let me / 双语言交叉验证; - 同一插件在 Pro 上失败(Router 中断)、在 Flash 上两路完成——插件价值强依赖模型; - Router Spec 在 Flash 上失败:雷霆大思考吞掉 65–75% 输出预算且最终算法无法在时限内跑完; - 对照 Standard 已算出答案,但因验证过度与自造的产物文件覆盖事故未提交。 详细见 AUDIT-REPORT-FLASH.md。 文件 AUDIT-REPORT.md 完整审计报告(测试逻辑/测试内容/分项审议/结论/附录) AUDIT-REPORT-FLASH.md V4 Flash × dsh-routing-suite 补充评测(2026-08-16,脱敏) scripts/ 评测脚手架:grade.py(判分) monitor.py(监控) analysis_tool.py(日志分析) task-message.md(统一任务消息) results/ 四路思维链/工具/代词/高频词统计 (stats.json) 测试环境(2026-08-15) | 类别 | 值 | |---|---| | 操作系统 | Windows 11 家庭版 中文版(Build 26200) | | CPU | Intel Core i9-14900HX(24 核 / 32 线程) | | 内存 | 31.7 GB | | Node.js | v22.20.0 | | Python | 3.11.5 | | C++ 编译器 | g++ 15.1.0(MinGW-w64) | | PowerShell | 7.6.4 | | DeepSeek Harness | 0.1.0-rc.6(npx @deepseek-ai/dsh web) | | 模型 | opencode-go(OpenCode Zen 订阅)/ deepseek-v4-pro(0813)/ reasoning_effort=max,contextWindow 1M / maxTokens 384K | | 评测插件 | xiaobright/dsh-anchored-standard @43668dc(含 Zero Anchored);yjh051108/dsh-router-standard @5737535 | | 运行方式 | Web UI 多工作区四会话并行;flash 子代理后台监控 | | 时区 / 窗口 | Asia/Shanghai;14:15–16:56(北京) | 复现要点 - 环境:DSH(npx @deepseek-ai/dsh web)+ opencode-go / deepseek-v4-pro / reasoning_effort=max - 四工作区完全隔离并行,四路使用同一任务消息(scripts/task-message.md) - 任务硬性禁网;强制先复现官方检查点 T(40)=346 / T(400)=76402 / T(2000)=3237036 - 判分:answer.txt 与独立判分基准比对(值未公开,grade.py) - 额度护栏:每会话 steps ≤ 1500(monitor.py) 外部参考评测(来自网络) 下表为网络上已有的 PE 998 跨模型实测(来源:classmethod 开发者博客,作者 Takeda,2026-07-11;链接见文末)。该评测为各模型在 Coding Agent 环境下的单次运行(非严格 benchmark),token 口径不一致(Claude=输出含思考;Codex CLI=CLI 报告值),仅作横向参考。 | 模型 | effort | 结果 | 耗时 | token(参考) | |---|---|---|---|---| | Claude Fable 5 | medium | ✅ 正确 | 38.6 min | 61.0K | | Claude Fable 5 | high | ✅ 正确 | 52.0 min | 56.2K | | Claude Opus 4.8 | medium | ✅ 正确 | 168 min | 185.8K | | Claude Opus 4.8 | high | ✅ 正确 | 98.0 min | 179.9K | | GPT-5.6 Sol | medium | ❌ 错误(候选未做最终验证,样例全过但答案错) | ~10 min | 74.7K | | GPT-5.6 Sol | high | ✅ 正确 | ~20 min | 125.6K | 出处:I had Fable 5, Opus 4.8, and GPT 5.6 Sol solve difficult Project Euler problems and compared them(DevelopersIO, 2026-07-11) 对照本评测:V4 Pro(max)三路成功模式耗时 46.7–101.9 min、输出 125K–272K token,与上述闭源旗舰的 medium/high 档处于同一量级;本评测中三路成功者均完整复现官方检查点,未出现"样例过但答案错"。[^independent] 核心结论 1. 三路独立 PASS(与独立判分基准一致,基准值未公开);模型验证习惯可靠 2. Anchored 全面最优(成本/耗时/工程/验证性价比) 3. 思维风格是强预测因子:spec 集体风格(We)两路省且成功;react 单数风格(I/let me)烧 token 多,Router 失败 4. Router 失败模式=有解法没闭环:快速算法接近正确但未验证,退回 O(n³) 暴力死路 注意事项 - 本项目涉及 Project Euler 101+ 题目(998),报告含答案与解题思路;请遵守 Project Euler 使用条款,勿扩散题解 - 本仓库不包含模型的解题代码产物(仅评测框架、统计与报告) 免责声明 1. 非官方评测:本评测由独立 AI 代理(Codex)设计、执行、复核并撰写,与 DeepSeek、OpenCode、GitHub、任何模型厂商及本仓库引用的插件作者均无隶属或委托关系。 2. 时效与环境:结果仅代表 2026-08-15(v4-pro)与 2026-08-16(v4-flash)两次独立评测、opencode-go / reasoning_effort=max、Windows 环境的有限次数运行;模型与平台随时可能更新,结论不保证可复现。 3. 不构成建议:报告中的对比、成本估算与结论不构成对任何模型、插件、服务或订阅方案的推荐或贬损;请基于自身场景独立验证。 4. 数据局限:成本按官方 API 单价折算,实际订阅制费用另计;网络参考评测数据版权归原出处所有,本仓库仅作引用。 5. 内容合规:本仓库涉及 Project Euler 101+ 题目(998),含答案与解题思路,请遵守 Project Euler 使用条款;发布者不对他人违规扩散负责。 6. 责任免除:使用本仓库任何内容所产生的直接或间接后果,由使用者自行承担。 7. Project Euler 合规:PE 998 属 Project Euler 101+ 题目;本仓库已按官方条款移除答案与解法细节(以 代替),请勿试图在本仓库获取或传播该题答案/解法。 License 报告与数据:CC BY 4.0;脚本:MIT [^independent]: 本评测由独立 AI 代理(Codex)设计、执行、复核并撰写,非 DeepSeek / OpenCode / 任何模型厂商的官方评测;网络参考评测数据版权归原出处所有。
扫码进群