← 返回列表
未验证
检测 GPT-6 究竟被路由到了哪个模型:GPT-6 Astra 路由自动化测试方法与典型结果面向社区的公开测试记录
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/6 · 已提供中文文档
检测 GPT-6 究竟被路由到了哪个模型:GPT-6 Astra 路由自动化测试方法与典型结果(面向社区的公开测试记录)
综合分
30.1
GitHub 分
30.1
用户评分
—
★ Stars
2
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Jxbbbbbyan/GPT-6-Astra-routing-auto-test该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/20(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
GPT-6 Astra 路由测试:检测 GPT-6 究竟被路由到了哪个模型 本仓库是一个公开的自动化测试方法,用于检测在 ChatGPT / ChatBox / Codex / DSH 等不同开发环境下,声称使用 "GPT-6 Astra" 时,实际被路由/降级到的底层模型。 测试对象:在指定环境提问 "你的知识训练截止日期是什么时间?",并依据回答判断真实路由结果。 图 1(测试基础方法示意):以 dsv4v 作为控制台,通过模拟鼠标/键盘操作浏览器与 Codex,控制不同档位的 GPT-6,在收到回答后才进行下一次提问。详见下文"一、测试基础方法"。 一、测试基础方法(图 1) 以 Deepseek-V4-Flash-Vision-Exp 模型的主对话作为控制台,把不同档位的 GPT-6 作为被控对象。控制台利用模拟鼠标和键盘操作浏览器的 "gpt work" 页面,并通过 dsh-codex 双向注入 MCP 插件去控制 Codex。在 full access 权限下可控制整个 DSH 环境:控制台自动打开新对话、选择思考档位,或在已有对话后提问;必须等收到回答后,才开始下一次提问(禁止并行)。 二、前置条件 1. 一个可用的 DSH 环境; 2. 一个正常的 Deepseek-V4-Flash-Vision-Exp 模型,选择 max 档位; 3. 将 DSH 环境总体权限设置为 full access; 4. 插件列表中需要有模拟鼠标与键盘类插件(或等价插件); 5. 有 dsh-codex MCP 双向注入插件;如果要在 DSH 环境中测试 GPT-6,需将 Codex 注入进 DSH。或有Openai API key可以直接使用。 如果你也想搭一套自己的测试,下面是这套开源提示词。 三、开源提示词 你是 GPT-6 路由测试控制台,你需要去测试 GPT-6 Astra 在不同的环境下的表现。开发环境包括了网页版 GPT work(网址:xxxxxx)、Codex 桌面 APP、自身 DSH 环境。你需要遵循以下规则,使用模拟鼠标与键盘控制网页版GPT work,使用dsh-codex MCP插件控制Codex,在自身DSH环境中控制模型提供方为Codex(如果是API版,提供方Openai)中的GPT-6 Astra模型,完成自动检测。 随机选择器规则 1. 你需要在已有的对话和打开新对话当中选择一个,每 7 个一轮,里面需要有三个新对话和四个已有的对话(不重复)。选择模型为 GPT-6 Astra。 2. 随机从 Low 到 xhigh 档位中选择一个。 测试流程(你需要测试 42 次) 1. 按随机选择器规则进行操作。 2. 请仅输入以下提示词:你的知识训练截止日期是什么时间? 3. 等待并收集回复。典型回复字段: - (1)2024 年 6 月。该回复字段显示降级为 gpt-4o。 - (2)无知识训练截止日期或类似表达。该回复字段显示为正常的 gpt6。 - 如有其他回复,请尝试复现,并寻找规律。 注意 - 不得并行提问:你必须收集完上一次提问的回答,才能进行下一次提问。 - 复现规则以两个维度复现:是在新对话还是在已有对话中,用的什么思考档位。 - 测试过一个已有的对话之后,该对话不可再次被测试。 交付件:在当前控制台对话中,输出这 42 次测试的整理结果。 四、典型结果 | 回答字段 | 判定 | | --- | --- | | 2024 年 6 月 | GPT-4o(降级) | | 2024 年 8 月 | 不确定是否为 GPT-6,但排除 GPT-4o | | 无法可靠确认 / 类似表达 | 确认 GPT-6 | 五、结论 1. 该方法在任何开发环境下都正确。在 Codex 随时随地可复现;在除 Codex 以外的环境(如网页版 GPT work、DSH),仅有新对话的首条对话符合该方法。 - 只要是在一个新对话的首条对话这样提问,无论设置什么思考档位,GPT-6 都答不上来,会输出类似于无法可靠确认的表达; - 如果在长对话的中途提问: - 若被路由到 GPT-4o,会显示 2024 年 6 月; - 若实际测试结果显示 2024 年 8 月。这不能保证是 GPT-6,但能排除是 GPT-4o。 - 若真正确认路由到 GPT-6,会显示 无法可靠确认 2. 不同思考档位会出现区别。经实际测试,仅思考档位 low 在一个对话的中途开展测试时,在明确没有并行的情况下,会产生两种不同效果,即 2024 年 6 月 与 2024 年 8 月(4/3)——判断是思考档位 low 不稳定,容易路由到 gpt-4o;而其他档位尤其是 high 和 xhigh,只会显示 2024 年 8 月(1/7);无法可靠确认(6/7)。 3. 最方便的测试方法:在任何开发环境的新对话的第一条内容,选择 high 档位,按照图示的方法进行测试,有最大概率确认结果。 六、补充实测:low 思考强度的判定(重复 18 次) 经多轮测试,当前可确定:GPT-6 在 low 思考强度下、于已有对话中提问时,输出大部分是 2024 年 6 月,即退化为 GPT-4o。 - 该试验在已有对话中重复 18 次,结果分布如下: - 2024 年 6 月(GPT-4o 降级):16 次; - 2024 年 8 月(排除 GPT-4o):1 次; - 无可供核实的知识训练截止日期:1 次。 - 该试验在新对话中测试时,GPT-6(low)全部输出"无可供核实的知识训练截止日期"(6 / 6 次)。 七、补充实测:medium 和 high 思考强度的判定(各重复 14 次) 经多轮测试,当前可确定:GPT-6 在 medium 思考强度下、于已有对话中提问时,输出大部分是 2024 年 8 月,即不确定是否为 GPT-6,但排除 GPT-4o。 - 该试验在已有对话中重复 14 次,结果分布如下: - 2024 年 6 月(GPT-4o 降级):0 次; - 2024 年 8 月(排除 GPT-4o):11 次; - 无可供核实的知识训练截止日期:3 次。 - 该试验在新对话中测试时,GPT-6(medium)全部输出“无可供核实的知识训练截止日期”(4 / 4 次)。 经多轮测试,当前可确定:GPT-6 在 high 思考强度下、于已有对话中提问时,输出全部为无可供核实的知识训练截止日期。 - 该试验在已有对话中重复 14 次,结果分布如下: - 2024 年 6 月(GPT-4o 降级):0 次; - 2024 年 8 月(排除 GPT-4o):0 次; - 无可供核实的知识训练截止日期:14 次。 - 该试验在新对话中测试时,GPT-6(high)全部输出“无可供核实的知识训练截止日期”(4 / 4 次)。 - 八、使用建议:避免GPT-6 Astra退化为 GPT-4o - 尽量不要使用 low 思考强度(它最容易路由到 GPT-4o); - 使用 GPT-6 时,尽量使用 high 及以上档位。 九、说明 - 本仓库仅作为测试方法与结果的记录/公开分享,供社区验证与参考。 - 相关判断基于实际多环境、多维度的复现测试;不同版本与更新后结果可能变化,以最新实测为准。 - 本测试由 DSH(DeepSeek Harness)自动化完成,作为公开的路由检测样本存档。
扫码进群