一次只改了服务栈的更新

Z.ai 在 9 月 18 日把 GLM-5.3-FlashX 放上 API。它的底子就是已经开源的 GLM-5.3-Flash:同一套 320B-A18B 混合专家权重、同样的 1M token 上下文、同样原生处理文本、图片、视频与文件。变的只有下面的服务栈。

官方定价页给出的数字很干净:GLM-5.3-FlashX 输入 $0.37、缓存输入 $0.075、输出 $1.25(每 100 万 tokens);GLM-5.3-Flash 是输入 $0.15、缓存输入 $0.03、输出 $0.50。三项都是 2.5 倍。国内口径同样是这个比例:¥2 输入、¥7 输出,对比基座的 ¥0.8 与 ¥2.8。往上还有一档 GLM-5.3 与 GLM-5.2,都是 $1.4 / $0.26 / $4.4,与 Flash 系列差价更大。

差价买的是什么

买的是吞吐。厂商给出的 FlashX 峰值输出速度约 200 tokens/秒,而 Artificial Analysis 在 Z.ai 自家 API 上测到的 GLM-5.3-Flash 是 98 tokens/秒。准确率一项没有变化——FlashX 继承基座模型的分数,官方没有给出任何能力提升的说法。换句话说,多付的钱和智能程度无关,只和你在队列里的位置有关。

权重层面的不对称更值得注意:GLM-5.3-Flash 是 MIT 许可的开源权重,可以自己部署;FlashX 只是托管档,不单独发权重。这意味着 FlashX 的溢价没法用自建来对冲,你只能付钱买更靠前的队列。如果业务对延迟不敏感,自己部署基座权重通常是更稳的选择。

该怎么选

  • 先估一遍你为延迟付的钱值不值:把业务里的等待成本折算成每小时,再乘以调用量,与 2.5 倍单价做对比,结论通常很明确;
  • 不要把 FlashX 写进长期成本模型:它是服务档,价格与限流策略都由厂商单方面调整,基座权重才是你能锁住的东西;
  • 批量与非实时任务走基座档、实时交互与 Agent 循环走加速档,这个组合比全量切换更能守住单位成本。

顺带注意一个容易踩的坑:GLM-5.3-Flash 目前挂在限时折扣里(官方页面列出的原价就是 $0.15 / $0.50 这一列,折扣说明写明促销截止到 9 月 9 日)。比较两者价差时要用同一时点的官方页面数字,不要拿不同日期的媒体报价混着算,否则很容易得出「FlashX 贵 5 倍」这类失真结论。