一次没有换基座的升级

8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。官方口径很有意思:基座模型保持不变,能力的提升主要来自后训练(post-training)规模的扩大。这等于承认了一个行业趋势——在预训练 Scaling 见顶之后,后训练正在成为拉开差距的主战场。

按智谱的说法,GLM-5.3 的编程能力相比 GLM-5.2 提升 50%,在多项基准测试上拿到开源模型第一;编程与智能体(Agent)能力接近 Anthropic 的 Claude Fable 5。新能力还包括更强的网络安全能力,以及延续开源路线。

后训练 Scaling 改变了什么

  • 同样的基座,不同的后训练预算:数据、算力和对齐策略决定了最终能力
  • 编程是当前竞争最激烈的场景,代码数据的质量和难度直接影响分数
  • Agent 能力依赖工具调用、长流程规划等后训练阶段的行为塑造
后训练 Scaling 与模型能力的关系示意
后训练 Scaling 与模型能力的关系示意

开源与商业化并行

GLM 编程计划目前采用积分计费,轻量版月费从 118 元起,订阅用户可以使用 GLM-5.3 模型,实际使用额度取决于积分余额。对个人开发者来说,这个门槛比按 token 计费的 API 更低,适合把编程助手当常用工具的场景。

和谁在竞争

这一轮上新周期里,DeepSeek 推出了 V4 Pro 正式版并开放首款智能体测试,SpaceX AI 发布了 Grok 4.6,各家都在编程和 Agent 场景上压筹码。GLM-5.3 选择在基座不变的前提下重投后训练,说明智谱判断:当前阶段工程和数据比架构更重要。

预训练定上限,后训练定下限——当上限普遍拉高后,差距都体现在谁把后训练做得更狠。