三个价格数字:4、20、0.20
Anthropic 在 9 月 22 日发布 Claude Opus 5.5,它是新的 Claude 5.5 家族第一个模型。官方给的运行成本口径是「比 Opus 5 低约 40%」,拆到单价上是这样(每百万 token):输入 4 美元(Opus 5 是 5 美元)、输出 20 美元(Opus 5 是 25 美元),这两项各低 20%;缓存读 0.20 美元(Opus 5 是 0.50 美元),低 60%;缓存写 5 美元(Opus 5 是 6.25 美元)。官方特意点明,缓存读占了智能体与编码工作成本的大头,所以这一项降幅对「长时间反复读同一份上下文」的用法影响最大。
它强在哪:三个自己主打的榜
官方评测表里,Opus 5.5 领先的方向是编码智能体、计算机使用与知识工作。具体分数:Terminal-Bench 4.0 拿到 66.4%,同一张表里 Fable 5.1 是 55.8、Opus 5 是 52.3、GPT-6 Astra 是 57.9、GPT-5.6 Sol 是 37.3;FrontierCode v1.1 主榜 54.4%,CursorBench 4.0 57.8%,GDPval-AA v2.1 得 1846 分,AutomationBench 40.0%,带工具的 Humanity's Last Exam 67.7%。OSWorld 2.0 的 81.8% 官方标注为「部分完成」口径,和上面这些数字不能直接比。
Anthropic 自己在页面上补了一句提醒:到了这个能力水平,榜单差距已经不太能反映真实使用中的差别——他们内部用下来,Opus 5.5 与 Fable 5.1 的差距比这些分数显示的要小。
速度与 Fast 模式
Opus 5.5 生成输出比 Opus 5 快 30% 以上。此外,Claude Code 与 Claude Platform 提供 Fast 模式,最高 2.5 倍速度,计价是每百万输入 8 美元、输出 40 美元——按速度换钱,适合交互式改代码这类等不起的场景。官方同时上调了 Pro、Max、Team 与按席位计的 Enterprise 计划的五小时用量额度。
发布节奏与安全侧
官方把这次发布描述为他们公开呼吁「为前沿能力评估留出时间」之后的第一个模型,发布前交由外部评测方测试,其中包括 METR。内部自动化行为审计给出的结论是:这一版比近期模型更少采取难以回退的动作、更不容易越出给定边界,也比 Opus 5 更抗提示注入。因为他们评估 Opus 5.5 在生物与网络安全上的能力与此前的 Mythos 5.1 同级,所以沿用了同一档防护措施。Sonnet 5.5 与 Haiku 5.5 将在未来数周跟进。
成本锚点:一个 20 万行代码库的上手案例
官方给的成本对比里有一个比较好用:一位早期测试者用它审计并修复一个 20 万行的代码库,用了不到三小时,同样的工作 Opus 5 花了 20 多个小时。这类「长而琐碎」的任务——代码库级迁移、审计——正是官方说它特别擅长的方向,也是缓存读降价的直接受益场景。
缓存读占智能体与编码成本的大头,这一项砍 60%,比榜单上那 10 个百分点更影响账单。