一次「不加价」的换代

9 月 21 日,x.ai 发布 Grok 4.7。最值得记的一句在定价上:输入每百万 token 2 美元、输出 6 美元,与 Grok 4.6 完全相同,速度也保持一致。官方对外的说法是「同等模型里两倍的速度、一半的价格」,但可核验的部分是那张价格与基准同表:同一张表里 Grok 4.6 是 2 美元与 6 美元,GPT-5.6 Sol 是 4 美元与 20 美元,Fable 5.1 是 10 美元与 50 美元。

官方怎么描述这次训练

按官方说明,Grok 4.7 换了更大的底座模型,强化学习阶段比上一代跑得更久、任务组合更难,权重偏向需要多个小时才能解决的问题;模型在自我校验与长上下文管理上做了强化,并且专门训练过对自家 Bot 交互框架的原生理解,官方称这让它在对话类任务和通用知识工作上表现更好。

提升落在哪些基准上

  • 软件工程:CursorBench 4.0 从 40.4% 到 46.3%,DeepSWE v1.1 在高推理档位 71.0%(上一代 65.2%);
  • 终端长任务:Terminal-Bench 4.0 从 20.3% 到 38.0%,是这张表里跨度最大的一项;
  • 办公产出:AA Briefcase v1.1 从 1546 升到 1657 Elo,官方称文档与演示稿的生成质量有改善;
  • 专业领域:Harvey 法律智能体基准 15.8% 到 19.6%,HealthBench Professional 48.5% 到 56.7%,EEBench 53.0% 到 64.0%。

需要提醒的是,DeepSWE 的 71.0% 标注为高推理档位,与默认档位不可直接比较;Terminal-Bench 4.0 的 38.0% 仍低于同表里 Fable 5.1 的 57.9%。官方的说法是 4.7 在「价格—性能」这条线上处于前沿,而不是在所有单项上都领先。

对使用方意味着什么

同价换代降低了试错门槛,但也把判断责任推回给了使用方:基准是厂商自己选的,真正决定换不换的是你线上那批任务的端到端表现。把评测预算花在长时任务上,比花在通用问答上回报高得多。