一次没开发布会的换代

过去两周,三家头部模型公司先后把下一代模型接进了生产环境,没有一家为此召开发布会。Anthropic 把两个尚未命名的模型接进生产接口;谷歌给下一代旗舰沿用旧版本号投放到第三方盲测平台;OpenAI 在 Astra 之后没有公开发声。多数用户并没有意识到,自己已经在为尚未发布的模型提供测试样本。

一次被开发者抓到的灰度切断

9 月 17 日晚,Anthropic 切断了灰度通道,一批原本被路由到新模型的账号归零,在开发者社区引发集中讨论。一天后通道恢复,覆盖范围从 Claude Code 扩大到 Chat 与 Cowork。有开发者把这段经历称为「午夜惊魂」。

再往前三天,有开发者发现 Claude Code 界面调用的模型标注为 Opus 5,返回结果却来自另一个模型。对接口请求的抓取显示,后端模型标识已指向 5.2。Opus 5 发布于 7 月 24 日,其间没有 5.1,版本号直接跳到 5.2。此后 Fable 5.2 灰测的消息一并传出,一部分原本调用 Fable 5.1 的请求被后台路由到新的检查点。没有模型卡,没有 API 标识,也没有定价表。

谷歌那一路更直白。第三方盲测平台 Arena 上出现了一个代号 gemini-3.8-flash 的模型,抽到的用户很快注意到异常:它绘制的鹈鹕带有完整蹬踏动作,生成一张 PS5 矢量图需要十分钟、输出数千行代码,搭建的体素宝塔可以在浏览器里实时旋转。3.8 Flash 是早已上线的轻量模型,不具备这样的能力,社区随后判断这是下一代旗舰 Gemini 4 Pro,内部代号 Argon。被发现后,该名称又被改为 gemini-3.7-flash。

厂商为什么愿意这么干

收益相当直接:模型在尚未正式命名的阶段就能拿到真实负载下的表现数据,一旦出现问题可以随时回退,不必承担一次公开发布失败的风险。灰度路由的算力投入也远低于全量发布——新模型混进旧模型的流量,被路由的请求比例由厂商控制,可以在观察真实表现的同时逐步提高占比。

成本参照可以看同期的一次正式发布:GPT-6 Astra 动用得州 Stargate 基地超过 10 万张 GPU 完成训练,API 定价为每百万输入 10 美元、每百万输出 50 美元,是上一代 Sol 的 2.5 倍。灰度路由不需要这种级别的资源准备,这也是它更划算的地方。

体验改善了,但归因不到厂商头上

用户调用的是旧名字,拿到的却是新一代检查点,体验改善明显却很难归因。等到开发者社区开始流传某款工具「最近变强了」,传播已经完成,而官方未作任何说明。三家的口径也不一样:Anthropic 采用后端路由、前端仍显示旧名称;谷歌直接在第三方盲测平台沿用旧版本号;OpenAI 选择在 Astra 之后不公开发声。

这段时间的公开议题其实很微妙:就在 Opus 5.2 被发现的两天前,Anthropic 的 CEO 刚发表长文,主张全行业主动放慢前沿模型的迭代速度,理由是模型能力增长过快、安全与对齐工作难以跟上;文章发出后,费城半导体指数在随后一个交易日下挫 5.86%,英伟达下跌 3.36%。一边公开呼吁减速,一边把未发布的模型投进真实流量,这两件事放在一起看才完整。

模型在正式命名之前,先在真实流量里跑完一轮灰度——发布这件事本身正在被拆散。

对使用方的三条实操

  • 别只按模型名做评测基线:把「同一名字下的行为变化」纳入回归测试,工具提供商更换检查点是静默发生的;
  • 价格与条款按最新检查点重新核对:灰度阶段没有模型卡、没有 API 标识、也没有定价表,采购谈判时拿不到可承诺的口径;
  • 给自己留一条退出路径:既然厂商能随时回切检查点,你的评测与门禁就要能独立复现,而不是依赖对方某一时刻的表现。

需要说明的是,本轮对模型身份的判断来自开发者对接口与盲测平台的观察,三家厂商都没有发布说明;把它当成版本号的前置信号可以,当成定论不行。