一波三折的发布
OpenAI 原计划在美东时间 9 月 3 日下午 2 点发布博客,实际却两次延迟:下午 3 点 32 分官方 X 账号才发出链接,页面仍无法打开,奥特曼随后发帖称“部署博客时遇到一点小问题”;大约一小时后页面才恢复正常。OpenAI 先后把原因解释为 CMS 故障与互联网中断,且称撤稿与基准成绩无关。
数字在变
Wayback Machine 的快照显示,重新上线后的数据与此前不同,部分此后仍在调整。最典型的是幻觉率:首版 Astra 为 4.2%,页面基本可访问后的快照降至 2%,截至报道撰写时又回到 4.2%;GPT-5.6 Sol 的幻觉率也从 12.2% 降到 9.4% 再回到 12.2%。
竞争对手的数据同样被改过:Anthropic Fable 5.1 在 FrontierMath Tier 4(v2)的成绩先是从 87.8% 降至 78%,随后回升到 83%;GPT-5.6 Sol 则从 83% 降到 80.5% 再回到 83%。这些调整曾让 Astra 显得明显领先。
更早的预发布草稿也留下痕迹:受禁令限制的草稿中 Astra 在 ARC-AGI-3 的成绩是 98.6%,公开博客里变成 99.99%;基准创建方 Arc Prize Foundation 的独立评估则显示,配备更强工具框架时 Astra 可到 99.9%,用标准框架只有 63%。
OpenAI 怎么解释
OpenAI 发言人表示“非常重视评测结果的准确性”,由于模型检查点、测试框架与评测运行方式不同,多数结果本身存在几个百分点的波动,发布公告中的数据经过修正,代表对模型可用性能的最佳估计。OpenAI 也承认这些分数是在最佳条件下获得的,与普通用户实际可用的版本存在差异。
基准分数越是重要,围绕它的每一次修改就越会被放大审视。