DeepSeek Harness Hub
← 返回列表

多模型评审团gjjkbssg/dsh-model-jury

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

让多个模型盲评互审并给出确定性裁决

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/31 · 已提供中文文档

为DeepSeek Harness设计的结构化跨模型同行评审——盲审推理、匿名批评、修订以及确定性裁决。

综合分
28.3
GitHub 分
28.3
用户评分
★ Stars
0
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add gjjkbssg/dsh-model-jury
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
依赖的 DSH / Cordis 模块
@deepseek-ai/dsh-subagent-codex@deepseek-ai/schemastery@deepseek-ai/cordis@deepseek-ai/dsh-agent@deepseek-ai/dsh-commands@deepseek-ai/dsh-llm@deepseek-ai/dsh-subagent
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

dsh-model-jury

面向 DeepSeek Harness 的结构化跨模型同行评审。

模型进行审议。代码进行计数。异议得以保留。

盲独立回答 → 匿名同行批评 → 修订 → 确定性裁决。

没有永久主席。裁判是代码。

兼容性:已在 DeepSeek Harness 0.1.2-alpha.2、提交 0a53fb55bea101816fa226bb964ae2bed71c343b 上验证。DSH 处于开发者预览阶段,可能会引入破坏性变更。参见 COMPATIBILITY.md。

一个问题
│
┌─────────────────┼─────────────────┐
▼                 ▼                 ▼
通过 Codex 的 GPT       GLM            DeepSeek
ChatGPT 订阅              API               API
│                 │                 │
└──────── 盲轮 ─────────────┘
│
P1 / P2 / P3
│
匿名同行评审
│
修订
│
确定性聚合
┌─────────┼─────────┐
▼         ▼         ▼
多数意见    异议      风险

发布验证:3 个提供方 · 3 轮 · 9 次真实模型调用 · 0 次身份泄露 · 第 1 轮最大调度偏差 6 毫秒。

完整的已脱敏提供方记录、投票、异议、风险和计时记录见 REAL_DEMO.md。

30 秒内安装

从 npm 将预构建包安装到 DSH Web 配置文件中,检查组合后的层,并启动 DSH:

dsh plugin --profile web add dsh-model-jury
dsh --profile web --dump-config
dsh web

或者,从 GitHub Release 下载带版本号的 tarball,验证其发布的 SHA-256 校验和,然后直接安装:

dsh plugin --profile web add ./dsh-model-jury-0.1.0.tgz

该 tarball 和 npm 包包含编译后的 lib/ 输出。安装不需要运行包构建脚本的权限。

设置

Model Jury 使用 DSH 的提供方中立公共服务。它不实现私有 HTTP 客户端,也不代理提供方流量。

通过原生 Codex 身份验证使用 GPT

GPT 席位使用 DSH 的第一方 Codex app-server 提供方以及用户原生的 ChatGPT/Codex 订阅身份验证。不需要 OPENAI_API_KEY。该 bundle 注册了一个隔离的 model-jury-codex 路由,因此 GLM 和 DeepSeek 提供方配置无法替换 Codex 身份验证。

GLM

通过 DSH 的 @deepseek-ai/dsh-llm-pi-ai 提供方配置一个 GLM 路由。将凭据保存在 DSH 设置或 DSH 启动环境中:

- id: llm-pi-ai
config:
providers:
glm:
displayName: GLM
api: openai-completions
baseURL: ''yaml
apiKeyEnv: GLM_API_KEY
models:
- id: ''
name: GLM jury model

DeepSeek 与陪审团模型

DSH 基础配置提供了第一方 deepseek-official 路由。通过 DSH 设置或启动环境配置 DEEPSEEK_API_KEY,然后用你账户可用的模型 ID 覆盖配置文件的 cordis.patch.yml 中完整的 model-jury 行:
yaml
- id: model-jury
config:
storageDir: .dsh-model-jury
maxQuestionChars: 12000
maxFieldChars: 6000
codex:
provider: model-jury-codex
timeoutMs: 180000
maxRetries: 1
glm:
provider: glm
model: ''
timeoutMs: 120000
maxTokens: 16384
maxRetries: 1
deepseek:
provider: deepseek-official
model: ''
timeoutMs: 120000
maxTokens: 16384
maxRetries: 1

凭据绝不应出现在此包、补丁、测试夹具或运行产物中。

Doctor
text
/jury doctor

Doctor 会为每个席位执行一次最小化的真实请求,因此可能消耗提供商配额。它会报告提供商、模型、状态、耗时、安全诊断信息以及原生 Codex 认证情况,但不会打印凭据值。

Run
text
/jury Should this inference runtime prioritize iOS support or ARM SIMD optimization?
/jury --style adversarial Should this inference runtime prioritize iOS support or ARM SIMD optimization?

balanced 是默认值。adversarial 会强化批评指令,但不改变提供商拓扑或聚合方式。

为什么选择 Model Jury

大多数模型委员会会询问多个模型,然后再让另一个模型来评判它们。Model Jury 采用了不同的方法:

1. 模型独立作答。
2. 相互竞争的答案被匿名化。
3. 模型相互批评。
4. 模型有机会进行修订。
5. 代码计算法定人数和投票状态。
6. 异议和关键风险保持可见。

当前参考部署使用 GPT/Codex、GLM 和 DeepSeek。协议本身与提供商无关:CouncilSeat 实现可以通过相同的盲审、匿名、结构化状态机路由其他兼容模型。

协议

第 1 轮将相同的问题、指令和 JSON schema 并发发送给全部三个席位。任何席位都看不到其他席位的响应。随后,每次运行随机映射将响应分配给 P1、P2 和 P3。这些标签仅标识参与者位置;诸如 Strategy A/B 之类的答案选项仍属于普通问题内容。

第 2 轮向每个模型提供其自己的第一轮答案以及匿名化后的立场。提供商、模型和常见产品身份术语会从重新分发的字段中清除。提示要求给出最强论点、最弱论点、缺失证据、实际分歧以及校准后的严重程度,而不奖励共识。
第 3 轮允许每个存活的模型进行修订、合并、保持未决或保留异议。确定性聚合器仅接受 P1、P2、P3、hybrid 或 undecided;计算投票状态与法定人数;并让具名的最终异议对用户可见。

三个最终席位产生正常裁决。两个产生显式的 DEGRADED 裁决。零个或一个产生失败报告。单个结构化关键风险标志会被醒目地呈现,但不具有否决权。两个兼容的归一化关键风险类别会触发 CRITICAL REVIEW REQUIRED。

产物

每次运行都会在以下路径下写入仅所有者可访问的追踪文件:
text
.dsh-model-jury/runs//
request.json
config.json
state.json
prompts/round1|round2|round3/.txt
round1|round2|round3/.json
redistribution.json
calls.json
verdict.json
report.md

产物包含可见的结构化响应、安全的调用元数据、提示词、聚合数据以及最终报告。它们排除环境快照、请求头、API 密钥、OAuth 状态、提供商请求体以及隐藏的思维链。形似凭据的字段会被递归脱敏。

安全

Model Jury 仅用于审议。它从不应用建议、编辑项目文件、安装依赖、提交、推送、部署或执行蓄意的网络变更。GLM 和 DeepSeek 不接收任何工具。Codex 使用 permissionMode: never 以及禁止变更的提示词;DSH 经过测试的公共 Codex 提供商不暴露严格的只读标志,因此这仍是一项已记录的局限。在使用敏感工作区内容之前,请阅读 SECURITY.md。

开发与打包
sh
pnpm install --frozen-lockfile
pnpm test
pnpm typecheck
pnpm build
pnpm pack

确定性假转录位于 DEMO.md。提供商与主机验证记录在 PRE_FLIGHT.md 中。欢迎在 CONTRIBUTING.md 下贡献。

已知局限

- GLM 和 DeepSeek 需要用户提供提供商凭据和模型 ID。
- 经过测试的公共 DSH Codex 提供商无法通过其插件配置强制执行硬性只读沙箱。
- 投票共识使用显式的结构化标签,而非对文本式 hybrid 提案进行语义聚类。
- 每次 Codex 调用都会启动一个临时的应用服务器线程。
- 没有自动实现、研究、主席模型、部署或五/七席位模式。

MIT 许可。参见 LICENSE。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群