同一模型,两份成绩单
当地时间 9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。公司称它在考察“AI 面对陌生环境自行理解规则并解决问题”能力的 ARC-AGI-3 测试中最高取得 99.9%,且 96% 的测试关卡中行动次数少于受测人类的中位数;同场对比中,上一代 GPT-5.6 Sol 只有 7.8%。联合创始人兼总裁布罗克曼随即表示:欢迎来到 AGI 时代。
每日经济新闻 9 月 5 日的报道指出关键细节:99.9% 的成绩来自 OpenAI 自带的 Provider Adapter 框架,该模式允许模型在连续操作间保留内部推理状态、压缩超长对话;而在所有模型统一使用的中立 Standard Harness 环境中,GPT-6 Astra 得分降至 62.7%。ARC Prize Foundation 表示,未来真正的 AGI 应该在统一测试环境下解决 ARC-AGI-3。
高管口径与商业背景
与布罗克曼的高调不同,CEO 奥尔特曼在发布前两天公开称 AGI 是“定义得非常糟糕的术语”“充其量只是一个无关紧要的营销术语”;2026 年 4 月 OpenAI 与微软重订协议后,已不存在合同意义上的 AGI 触发条款。纽约大学荣休教授加里·马库斯等评论者认为,单一基准高分不足以证明通用智能,需要警惕营销话术的误导。
报道将这场争论放在商业竞争背景下:Menlo Ventures 调查显示企业大模型支出份额上 Anthropic 已反超 OpenAI,Anthropic 年化收入超过 650 亿美元、OpenAI 接近 600 亿美元;GPT-6 Astra 也被外界视为 OpenAI 在 Pre-IPO 阶段重树技术形象的一步棋。
99.9% 与 62.7% 之间的差距,不在模型本身,而在“在什么条件下考”。