DeepSeek Harness Hub
← 返回列表

Jxbbbbbyan/GPT-6-Astra-routing-auto-test

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

检测 GPT-6 究竟被路由到了哪个模型:GPT-6 Astra 路由自动化测试方法与典型结果面向社区的公开测试记录

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/6 · 已提供中文文档

检测 GPT-6 究竟被路由到了哪个模型:GPT-6 Astra 路由自动化测试方法与典型结果(面向社区的公开测试记录)

综合分
30.1
GitHub 分
30.1
用户评分
★ Stars
2
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Jxbbbbbyan/GPT-6-Astra-routing-auto-test
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/20(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

GPT-6 Astra 路由测试:检测 GPT-6 究竟被路由到了哪个模型

本仓库是一个公开的自动化测试方法,用于检测在 ChatGPT / ChatBox / Codex / DSH 等不同开发环境下,声称使用 "GPT-6 Astra" 时,实际被路由/降级到的底层模型。

测试对象:在指定环境提问 "你的知识训练截止日期是什么时间?",并依据回答判断真实路由结果。

图 1(测试基础方法示意):以 dsv4v 作为控制台,通过模拟鼠标/键盘操作浏览器与 Codex,控制不同档位的 GPT-6,在收到回答后才进行下一次提问。详见下文"一、测试基础方法"。

一、测试基础方法(图 1)

以 Deepseek-V4-Flash-Vision-Exp 模型的主对话作为控制台,把不同档位的 GPT-6 作为被控对象。控制台利用模拟鼠标和键盘操作浏览器的 "gpt work" 页面,并通过 dsh-codex 双向注入 MCP 插件去控制 Codex。在 full access 权限下可控制整个 DSH 环境:控制台自动打开新对话、选择思考档位,或在已有对话后提问;必须等收到回答后,才开始下一次提问(禁止并行)。

二、前置条件

1. 一个可用的 DSH 环境;
2. 一个正常的 Deepseek-V4-Flash-Vision-Exp 模型,选择 max 档位;
3. 将 DSH 环境总体权限设置为 full access;
4. 插件列表中需要有模拟鼠标与键盘类插件(或等价插件);
5. 有 dsh-codex MCP 双向注入插件;如果要在 DSH 环境中测试 GPT-6,需将 Codex 注入进 DSH。或有Openai API key可以直接使用。
如果你也想搭一套自己的测试,下面是这套开源提示词。
三、开源提示词

你是 GPT-6 路由测试控制台,你需要去测试 GPT-6 Astra 在不同的环境下的表现。开发环境包括了网页版 GPT work(网址:xxxxxx)、Codex 桌面 APP、自身 DSH 环境。你需要遵循以下规则,使用模拟鼠标与键盘控制网页版GPT work,使用dsh-codex MCP插件控制Codex,在自身DSH环境中控制模型提供方为Codex(如果是API版,提供方Openai)中的GPT-6 Astra模型,完成自动检测。

随机选择器规则

1. 你需要在已有的对话和打开新对话当中选择一个,每 7 个一轮,里面需要有三个新对话和四个已有的对话(不重复)。选择模型为 GPT-6 Astra。
2. 随机从 Low 到 xhigh 档位中选择一个。

测试流程(你需要测试 42 次)

1. 按随机选择器规则进行操作。
2. 请仅输入以下提示词:你的知识训练截止日期是什么时间?
3. 等待并收集回复。典型回复字段:
- (1)2024 年 6 月。该回复字段显示降级为 gpt-4o。
- (2)无知识训练截止日期或类似表达。该回复字段显示为正常的 gpt6。
- 如有其他回复,请尝试复现,并寻找规律。

注意

- 不得并行提问:你必须收集完上一次提问的回答,才能进行下一次提问。
- 复现规则以两个维度复现:是在新对话还是在已有对话中,用的什么思考档位。
- 测试过一个已有的对话之后,该对话不可再次被测试。

交付件:在当前控制台对话中,输出这 42 次测试的整理结果。

四、典型结果

| 回答字段 | 判定 |
| --- | --- |
| 2024 年 6 月 | GPT-4o(降级) |
| 2024 年 8 月 | 不确定是否为 GPT-6,但排除 GPT-4o |
| 无法可靠确认 / 类似表达 | 确认 GPT-6 |

五、结论

1. 该方法在任何开发环境下都正确。在 Codex 随时随地可复现;在除 Codex 以外的环境(如网页版 GPT work、DSH),仅有新对话的首条对话符合该方法。
- 只要是在一个新对话的首条对话这样提问,无论设置什么思考档位,GPT-6 都答不上来,会输出类似于无法可靠确认的表达;
- 如果在长对话的中途提问:
- 若被路由到 GPT-4o,会显示 2024 年 6 月;
- 若实际测试结果显示 2024 年 8 月。这不能保证是 GPT-6,但能排除是 GPT-4o。
- 若真正确认路由到 GPT-6,会显示 无法可靠确认

2. 不同思考档位会出现区别。经实际测试,仅思考档位 low 在一个对话的中途开展测试时,在明确没有并行的情况下,会产生两种不同效果,即 2024 年 6 月 与 2024 年 8 月(4/3)——判断是思考档位 low 不稳定,容易路由到 gpt-4o;而其他档位尤其是 high 和 xhigh,只会显示 2024 年 8 月(1/7);无法可靠确认(6/7)。

3. 最方便的测试方法:在任何开发环境的新对话的第一条内容,选择 high 档位,按照图示的方法进行测试,有最大概率确认结果。

六、补充实测:low 思考强度的判定(重复 18 次)

经多轮测试,当前可确定:GPT-6 在 low 思考强度下、于已有对话中提问时,输出大部分是 2024 年 6 月,即退化为 GPT-4o。

- 该试验在已有对话中重复 18 次,结果分布如下:
- 2024 年 6 月(GPT-4o 降级):16 次;
- 2024 年 8 月(排除 GPT-4o):1 次;
- 无可供核实的知识训练截止日期:1 次。
- 该试验在新对话中测试时,GPT-6(low)全部输出"无可供核实的知识训练截止日期"(6 / 6 次)。
七、补充实测:medium 和 high 思考强度的判定(各重复 14 次)

经多轮测试,当前可确定:GPT-6 在 medium 思考强度下、于已有对话中提问时,输出大部分是 2024 年 8 月,即不确定是否为 GPT-6,但排除 GPT-4o。

- 该试验在已有对话中重复 14 次,结果分布如下:
- 2024 年 6 月(GPT-4o 降级):0 次;
- 2024 年 8 月(排除 GPT-4o):11 次;
- 无可供核实的知识训练截止日期:3 次。
- 该试验在新对话中测试时,GPT-6(medium)全部输出“无可供核实的知识训练截止日期”(4 / 4 次)。

经多轮测试,当前可确定:GPT-6 在 high 思考强度下、于已有对话中提问时,输出全部为无可供核实的知识训练截止日期。

- 该试验在已有对话中重复 14 次,结果分布如下:
- 2024 年 6 月(GPT-4o 降级):0 次;
- 2024 年 8 月(排除 GPT-4o):0 次;
- 无可供核实的知识训练截止日期:14 次。
- 该试验在新对话中测试时,GPT-6(high)全部输出“无可供核实的知识训练截止日期”(4 / 4 次)。

-
八、使用建议:避免GPT-6 Astra退化为 GPT-4o

- 尽量不要使用 low 思考强度(它最容易路由到 GPT-4o);
- 使用 GPT-6 时,尽量使用 high 及以上档位。

九、说明

- 本仓库仅作为测试方法与结果的记录/公开分享,供社区验证与参考。
- 相关判断基于实际多环境、多维度的复现测试;不同版本与更新后结果可能变化,以最新实测为准。
- 本测试由 DSH(DeepSeek Harness)自动化完成,作为公开的路由检测样本存档。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群