14 倍速是怎么来的
OpenAI 宣布在 GPT-5.6 Sol 上开启 Ultrafast 模式的有限预览。核心变化不在模型本身——权重还是那个 GPT-5.6 Sol——而在推理硬件:Ultrafast 模式跑在 Cerebras 的晶圆级引擎(Wafer-Scale Engine)上,单颗芯片集成 44GB 片上 SRAM,模型参数基本不需要在显存之间来回搬运,访存瓶颈被直接绕开。官方口径是 14 倍于标准版 GPT-5.6 的推理速度,输出速率约 750 token/秒,长推理任务的体感差距会更明显。

一个直观的对比:78 小时变 11 小时
Cerebras 给出的参照数据是 Humanity's Last Exam:同一套 GPT-5.6 Sol 在标准推理栈上跑完整卷需要 78 小时 27 分,Ultrafast 模式下压到 11 小时 11 分。对做长链路 Agent 的团队来说,这个数量级的提速改变的不只是等待时间——很多此前因为「跑完一轮要一天」而不敢做的密集推理任务(全量代码库分析、批量合同审查、多轮搜索验证)开始变得可行。
谁在用
- Jane Street:量化研究场景的高频推理任务
- Podium:面向中小企业的 AI 客服与销售自动化
- Basis:会计与财务自动化 Agent
- Rogo:金融分析 Agent,对长报告生成速度敏感
对 Cerebras 意味着什么
这次合作对 Cerebras 的分量不小。其 Q2 营收 1.801 亿美元、同比增长 74%,但真正被 OpenAI 列为官方推理通道,等于给晶圆级路线盖了行业背书。此前业界普遍认为 GPU 集群是大规模推理的唯一解,Ultrafast 预览给出了另一个选项:推理专用硬件 + 旗舰闭源模型的组合,可以在不牺牲模型能力的前提下换数量级的速度。
开发者需要关注的三点
- 限量预览需通过 API 申请,优先面向高吞吐 Agent 场景开放
- 计费与标准 API 分离,速度溢价是肯定的,成本敏感任务继续走标准通道更划算
- Agent 设计范式可能受影响:当单轮推理快 14 倍,串行多步验证的成本模型要重新算
推理速度正在变成和模型智力同档位的竞争轴——聪明但慢的 Agent,正在被快而聪明的对手挤掉。