这份成绩单是怎么来的
智谱在 GLM-5.3 的技术说明里给出了一组更完整的数字:与 GLM-5.2 同基座、纯后训练升级,编程内部基准提升 50%;Terminal Bench 3.0 从 4.6 分涨到 28.3 分,为开源第一,超过 Kimi K3 的 17.4 分;DeepSWE v1.1 拿到 66.9 分,接近 Fable 5 的 69.7 分。
这些基准集中在“真实干活”的场景:终端操作、软件工程任务、长链路 Agent 规划。换句话说,GLM-5.3 的提升重点不在刷分题库,而在把任务拆解、工具调用和代码修改串起来的能力。

网络安全被单独拎出来讲
- CyberGym 网络安全基准得分 84.5%,开源模型第一
- 在 269 个真实代码库中发现 2436 个漏洞,其中 1097 个为中高危
- 智谱把“找漏洞”能力做成评测项,说明安全已经进入后训练的目标函数
API 与开源节奏
一个值得注意的变化是,GLM-5.3 的 API 强制开启思考模式:thinking.type 只有 enabled 一种,reasoning_effort 提供 low/high/max 三档。这意味着调用方无法关闭思考,只能控制思考强度。模型本身为 7430 亿参数,支持 1M 上下文,最大输出 128K Tokens;完整权重计划在两周后开源。
后训练之争已经从“谁能考高分”变成“谁能把活干完”。