Epoch AI 宣布 FrontierMath Tier 4 饱和:把不同模型、不同时间的尝试累积起来,这一层的每一道题都至少被成功解出过一次。补上最后一道题的是 GPT-6 Astra,OpenAI 公布的成绩为 97.6%——Astra 可能在某次测试中出错,但它答对的那道正是此前从未被解出的题。

一年零两个月,从约 5% 到饱和

FrontierMath 于 2024 年 11 月发布,初衷是避免数学基准被过快刷穿,题目由 Epoch AI 联合 60 多位数学家设计,其中包含此前从未公开的原创题。2025 年新增的 Tier 4 大多由数学教授和博士后设计:每个人围绕自己的研究方向做数周左右的短期研究,再把成果压缩成一道可自动验证的问题,最初共收录 50 道,发布时所有模型历次测试加起来也只解出 3 道。

2026 年 6 月推出的 v2 版本中,Tier 4 修正了 12 道题、移除了 7 道,留下 43 题。修订后成绩继续上行:GPT-5.6 Sol 做到 83.0%,Claude Fable 5 达到 90.2%,GPT-6 Astra 来到 97.6%。

一个出题人的观察

出题人之一、马凯特大学数学副教授 Jay Pantone 表示,以往 AI 都会找数值捷径,而这一次 Astra 的解法和自己相当接近。

真正的难题换了地方

饱和不等于数学已经被 AI 解决。FrontierMath 已经把重心移向两类新题:一是真正的开放问题,直接拿尚未被数学界解决的研究问题考模型;二是 FrontierMath Erdős,把 Erdős 开放问题形式化进 Lean,要求 AI 写出能通过形式化验证的完整证明。Astra 在这 68 道题里只解决了 2 道。

有标准答案、可自动验证的题目正在失去区分度;没有已知答案的题,才是下一道墙。