🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

aispin-dev/llm-as-a-Verifier-dsh

DeepSeek Harnessspec-screened扫描:低风险在 GitHub 查看 ↗
未验证

面向 dsh 的 LLM-as-a-Verifier——Best-of-NBo5对话模式

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/25 · 已提供中文文档

LLM-as-a-Verifier(arXiv:2607.05391)作为 dsh 插件——Best-of-N 对话模式:为 DeepSeek V4 Flash 提供测试时扩展。Bo5 自验证在 Terminal-Bench 2.1 上达到 88%,以极低成本击败部分前沿模型。细粒度 logprob 期望评分、PPT 锦标赛、零配置。

综合分
28.7
GitHub 分
28.7
用户评分
—
★ Stars
2
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add aispin-dev/llm-as-a-Verifier-dsh
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
信任档位:已验证本站已于 0 天前真实安装成功
是什么
dsh 原生插件 · chat
装得上吗
本站已真实安装成功(非静态推断)
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
更新放缓:最近一次提交在 31 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

🟢实装验证通过· 2026/9/25
由本站实装验证器在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/21(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/cordis@deepseek-ai/dsh-client-runtime@deepseek-ai/dsh-client-ui-settings@deepseek-ai/dsh-client-web-react@deepseek-ai/dsh-credentials@deepseek-ai/dsh-llm@deepseek-ai/dsh-settings@deepseek-ai/dsh-tools@deepseek-ai/schemastery
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
面向 dsh 的 LLM-as-a-Verifier——Best-of-N(Bo5)对话模式

为 DeepSeek V4 Flash 赋予测试时扩展能力:V4 Flash + Bo5 自验证可达到 Fable-5 级别的分数——在 Terminal-Bench 2.1 上达到 88%,以极低的成本(约便宜 11 倍)实现前沿模型的准确率。

这是对 LLM-as-a-Verifier(arXiv:2607.05391,MIT)中测试时选择方法的独立 dsh 原生实现。方法由论文作者提出;本实现由 Aispin 完成。

一分钟读懂论文思路

廉价模型可以生成出色的答案——只是无法识别哪一个出色。LLM-as-a-Verifier 弥合了这一差距:

1. 从廉价模型(DeepSeek V4 Flash)采样 N 个候选:对同一任务略有不同的尝试。
2. 用细粒度验证器评分——让同一个廉价模型在 A–T 字母量表上对成对候选进行评分。分数不是采样得到的字母:而是对评分 token 的 logprob 分布的期望,Σ p(token)·φ(letter)——即模型的完整信念,而非一次掷骰子。
3. 每对候选的两种排序可抵消验证器的位置偏差;重复评估会交替槽位。
4. 选出最佳——论文的核心结果:V4 Flash 采样 5 个候选 + 自验证,在 Terminal-Bench 2.1 上达到 Fable-5 级别的前沿分数(88.0%),成本约为 1/11。

本插件将该流程打包为 dsh 插件,并加入对话式设计:每个助手回合都自动变为 Best-of-N——你看到的是一个答案,而模型生成了五个。

一个插件,三种形态

| 形态 | 入口 | 用途 |
|---|---|---|
| 工具 | verify 工具 | 按需使用——“用 verify 工具比较 A/B/C”,由 agent 调用 |
| 服务 | ctx.verifier.verify({ task, candidates }) | 供代码使用——编排行、其他插件 |
| 模式 | Best-of-N 对话模式 | 无感——Bo-N 会话对每个回合采样 N 种方式,验证,仅重放胜出者 |

安装

从 npm 安装(推荐路径——通过你的 profile 解析所有依赖):

dsh plugin --profile  add @aispin/plugin-verifier

或直接使用 npm:

npm install @aispin/plugin-verifier

零配置:验证器继承 dsh 已配置的 provider 状态(凭据 + 设置接缝)——如果你已在 Models 页面配置了 DeepSeek,它就能直接工作。本地试用:

git clone https://github.com/aispin-dev/llm-as-a-Verifier-dsh.git
dsh plugin --profile  add /path/to/llm-as-a-Verifier-dsh

Best-of-N:三态开关(热)

① settings global (Web UI panel) → ② session preset ("Bo-N mode") → ③ profile config default → off
Web 设置面板中的两个独立层级:全局层级(全局开关为每个会话开启的内容)和“Bo-N 模式”预设层级(选择了 Bo-N 预设的会话所使用的内容——默认为 Bo5,可独立设置)。外加一个用户可调的验证超时(默认 90 秒——这是排序自身的预算,绝不被采样借用)。

采样降级链:每次 rollout 都将采样预算作为自身的墙钟时间上限——一个 Bo5 若有 2 个 rollout 超时,就降级为 Bo3,并仍然对幸存者进行排序(页脚显示:采样 5 路 2 路未完成 · 3 选 1);若幸存者少于 2 个,该轮次则故障开放为普通回答。

Web 设置面板以透明的成本卡片呈现各层级:

| 层级 | 模型调用 | Token | 延迟 |
|---|---|---|---|
| 关闭 | 1 | 1× | 1× |
| 快速 · Bo-3 | ~9 | 2–3× | ~7–15s |
| 精确 · Bo-5 | ~16 | 3–5× | ~12–30s |
| 自定义 | 2–8 路 | 线性 | 线性 |

每一轮的页脚都会计量实际开销:⚡ Best-of-N · 5 选 1 → 候选 #2 · 20.0/20 · 24.3s · 10.8K tok

内部机制(与论文的实现对齐)

- 细粒度奖励:在 top-20 logprob 分布上的期望等级,A=20…T=1 分组带标度,在温度 1.0 下评分(自然信念分布——绝不坍缩)
- PPT 枢轴锦标赛(论文的 O(N·k) 选择):随机哈密顿环(每个候选在每个槽位恰好出现一次——偏差在环内抵消)→ top-k 枢轴 → 仅对非枢轴×枢轴对评分。实测验证:Bo-5 评分调用从 20 次降至 11 次(−45%)
- 前缀缓存提示布局(论文 v0.2.0,未缓存 token 减少 3.4 倍):评分标准放在提示末尾;角色 + 标度 + 任务 + 候选构成共享前缀
- 能力自适应评分:logprobs 端点(DeepSeek 官方)使用期望等级评分;无 logprob 的端点(MiniMax、各类网关提供商)自动降级为带双重评估的字母采样评分——任何 OpenAI 兼容端点均可工作(严格模式使用 autoDegrade: false)
- 故障开放纪律:任何故障都降级为普通回答,并附上说明性页脚——绝不出现死轮次

许可证

MIT © 2026 Aispin。该方法来自 LLM-as-a-Verifier(arXiv:2607.05391,MIT)。与论文作者或 DeepSeek 无隶属关系。

中文文档

给 DeepSeek V4 Flash 测试时扩展能力:V4 Flash + Bo5 自验证达到 Fable 5 级评分——Terminal-Bench 2.1 上 88%,以前沿模型级别的准确率、约 1/11 的成本完成任务。

LLM-as-a-Verifier(arXiv:2607.05391,MIT)测试时选择方法的 dsh 原生独立实现。方法归论文作者,实现归 Aispin。

论文的思想,一分钟讲清

便宜模型能生成好答案——只是认不出哪个是好答案。LLM-as-a-Verifier 补上这一环:

1. 采样 N 个候选(DeepSeek V4 Flash):同一任务的多个略有差异的尝试。
2. 细粒度验证器评分——同一个便宜模型,对候选两两成对按 A–T 字母量表打分。分数不是采样出的那个字母,而是 grade token 对数概率分布上的期望值 Σ p(token)·φ(letter)——模型的完整信念,不是掷一次骰子。
3. 每对双向各评一次抵消验证器的位置偏置;重复评估交替 A/B 槽位。
4. 选出最佳——论文核心结论:V4 Flash 采样 5 条候选 + 自验证择优,在 Terminal-Bench 2.1 上达到 Fable 5 级前沿评分(88.0%),成本约 1/11。
本插件把这套管线做成 dsh 插件,并加上对话形态:每个回答自动变成 Best-of-N——你看到一条答案,模型实际做了五条。

一个插件,三张面孔

| 面孔 | 入口 | 用法 |
|---|---|---|
| 工具面 | verify 工具 | 有感——对话里说“用 verify 工具比较 A/B/C”,模型主动调用 |
| 服务面 | ctx.verifier.verify({ task, candidates }) | 代码消费(编排线、其他插件) |
| 模式面 | Best-of-N 对话模式 | 无感——选中模式的会话,每轮后台 N 路采样 + 择优,只把胜者呈现给用户 |

安装

npm 安装(推荐——依赖经你的 profile 完整解析):

dsh plugin --profile  add @aispin/plugin-verifier

或直接 npm:

npm install @aispin/plugin-verifier

零配置:验证器继承 dsh 已配置的 provider 状态(credentials + settings seam)——在 Models 页面配过 DeepSeek 即可直接用。本地试用:

git clone https://github.com/aispin-dev/llm-as-a-Verifier-dsh.git
dsh plugin --profile  add /path/to/llm-as-a-Verifier-dsh

Best-of-N:三态开关(热生效)

① settings 全局(Web 设置面板)→ ② session preset(“Bo-N 模式”)→ ③ profile config 默认 → 关

Web 设置面板的两层独立档位:全局档位(全局开关开启时所有会话用)+ “Bo-N 模式”档位(选中该 preset 的会话用,默认 Bo5,单独设置互不影响)。另有用户可调的评分超时(默认 90 秒——评审阶段的独立预算,不被采样挤占)。

采样降级链:每路采样以采样预算为自身时限——Bo5 有 2 路超时则降级为 Bo3 继续对存活者择优(footer 明示:采样 5 路 2 路未完成 · 3 选 1);存活不足 2 路才 fail-open 为普通回答。

Web 设置面板的档位卡直接标注消耗透明:

| 档位 | 模型调用 | token | 延迟 |
|---|---|---|---|
| 关闭 | 1 次 | 1× | 1× |
| 快速经济 · Bo-3 | ~9 次 | 2–3× | ~7–15s |
| 精准 · Bo-5 | ~16 次 | 3–5× | ~12–30s |
| 自定义 | 2–8 路 | 线性 | 线性 |

每轮回答尾部 footer 显示实际开销:⚡ Best-of-N · 5 选 1 → 候选 #2 · 20.0/20 · 24.3s · 10.8K tok

实现要点(与论文对齐)

- 细粒度奖励:top-20 logprob 分布上的期望分(A=20…T=1 分组带量表),评分温度 1.0(读自然信念分布,绝不坍缩)
- PPT 概率枢轴锦标赛(论文 O(N·k) 选择算法):随机哈密顿环(每候选恰好在 A/B 槽各一次——环内天然消位置偏置)→ top-k 枢轴 → 只补非枢轴×枢轴对。实测 Bo-5 评分调用 20 → 11(−45%)
- 前缀缓存布局(论文 v0.2.0,未缓存 token −3.4×):criteria 置于 prompt 尾部,角色+量表+任务+候选构成跨调用共享前缀
- 能力自适应评分:有 logprobs 的端点(DeepSeek 官方)用期望分;没有的(MiniMax、部分网关)自动降级采样评分(每对双评补偿方差)——任何 OpenAI 兼容端点都能当评审(autoDegrade: false 切严格模式)
- Fail-open 纪律:任何断裂降级为普通回答并在 footer 说明原因,绝不杀死对话轮

许可

MIT © 2026 Aispin。方法来自 LLM-as-a-Verifier(arXiv:2607.05391, MIT)。与论文作者及 DeepSeek 无隶属关系。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群