快速了解本文
GPT-6 Astra 发布日多项评测数据出现反复波动。
OpenAI 解释称修改旨在确保结果准确与流程验证。
研究人员质疑评测透明度及资源投入对分数的影响。
本摘要由 AI 辅助整理,请以正文内容为准。
美国东部时间 2026 年 9 月 3 日下午,OpenAI 上线了 GPT-6 Astra 的发布公告,随后该页面经历撤稿与重新发布。在互联网档案保存的页面快照中,多项评测基准数据在当天出现显著波动,引发行业对大模型评测透明度与“刷分”现象的讨论。
01关键指标反复调整
从快照记录看,数据修改覆盖多个模型与多项评测,部分变化幅度较大:
- GPT-6 Astra 的幻觉率最初为 4.2%,下午 5 点 20 分的快照降至 2%,随后又回到 4.2%。
- GPT-5.6 Sol 的幻觉率同步从 12.2% 降至 9.4%,随后恢复至 12.2%。
- GPT-5.6 Sol 在 ExploitBench 网络安全评测中的成绩一度从 5.5% 提高到 11.5%,OpenAI 后续表示正在研究是否恢复至 5.5%,并称 11.5% 对应的是当前并未向商业用户提供的推理能力等级。
- GPT-6 Astra 在 ARC-AGI-3 评测中的成绩从预发布草稿的 98.6% 变为公开博客的 99.99%。
- GPT-6 Astra 的代码能力评分从 57.7% 提高至 57.9%。
- 竞争对手 Anthropic Fable 5.1 在 FrontierMath Tier 4(v2)的成绩一度从 87.8% 降至 78%,随后回升至 83%;GPT-5.6 Sol 在同一评测中从 83% 降至 80.5%,随后恢复至 83%。
在 Astra 发布时重点强调的数学与网络安全能力上,官方最终给出的成绩为:FrontierMath Tier 4 得分 97.6%,ARC-AGI-3 成绩从 GPT-5.6 Sol 的 7.8% 跃升至 99.9%,ExploitBench 中 Astra 得分达到 100%,GPT-5.6 Sol 为 78.5%。OpenAI 总裁布洛克曼在发布吹风会上表示“欢迎来到 AGI 时代”。
02OpenAI 的解释与内部流程
OpenAI 发言人回应称,修改是为确保评测结果的准确性。不同模型检查点、测试框架和运行方式会导致几个百分点的波动,正式发布前验证评测结果属于正常流程。OpenAI 还披露,内部由不同研究团队负责不同评测指标,再由中央团队统一发布。
公告页面中的免责声明提到,评测分数是在任何计算资源投入下能够达到的最高成绩,这意味着公开成绩代表最佳条件下的表现,与普通用户实际体验可能存在差距。
03专家质疑与行业长期争议
斯坦福智能系统实验室和可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 指出,系统卡对部分评测方法细节说明不足,存在“Benchmaxxing”现象的可能。这一判断将讨论引向行业长期存在的评测透明度问题:当评测条件、检查点和资源投入可以影响最终分数时,基准测试在模型竞争中的参考价值需要更审慎地看待。
值得注意的是,数据修改并非全部有利于 Astra。在 HealthBench Professional 评测中,Anthropic 两款模型的成绩在不同版本之间有所提高:Claude Fable 5.1 从 56.6% 提高至 58.1%,Opus 5 从 54.5% 提高至 56.4%。这说明评测条件变化可能影响所有模型,而非单向有利于某一产品。

