这份成绩单是怎么来的

智谱在 GLM-5.3 的技术说明里给出了一组更完整的数字:与 GLM-5.2 同基座、纯后训练升级,编程内部基准提升 50%;Terminal Bench 3.0 从 4.6 分涨到 28.3 分,为开源第一,超过 Kimi K3 的 17.4 分;DeepSWE v1.1 拿到 66.9 分,接近 Fable 5 的 69.7 分。

这些基准集中在“真实干活”的场景:终端操作、软件工程任务、长链路 Agent 规划。换句话说,GLM-5.3 的提升重点不在刷分题库,而在把任务拆解、工具调用和代码修改串起来的能力。

Terminal Bench 3.0 与 DeepSWE:GLM-5.3 的真实干活能力
Terminal Bench 3.0 与 DeepSWE:GLM-5.3 的真实干活能力

网络安全被单独拎出来讲

  • CyberGym 网络安全基准得分 84.5%,开源模型第一
  • 在 269 个真实代码库中发现 2436 个漏洞,其中 1097 个为中高危
  • 智谱把“找漏洞”能力做成评测项,说明安全已经进入后训练的目标函数

API 与开源节奏

一个值得注意的变化是,GLM-5.3 的 API 强制开启思考模式:thinking.type 只有 enabled 一种,reasoning_effort 提供 low/high/max 三档。这意味着调用方无法关闭思考,只能控制思考强度。模型本身为 7430 亿参数,支持 1M 上下文,最大输出 128K Tokens;完整权重计划在两周后开源。

后训练之争已经从“谁能考高分”变成“谁能把活干完”。