它是什么,贵在哪、便宜在哪
9 月 22 日发布,是 Claude 5.5 家族的第一个模型。官方定位一句话讲完:多数任务达到 Fable 5.1 的水平,运行成本比 Opus 5 低 40%。模型 id 是 claude-opus-5-5,发布当天在 Claude Platform、Amazon Web Services、Google Cloud 与 Microsoft Azure 上都能调用。
价格:四项一起降
按每百万 token 计:输入 $4(Opus 5 是 $5)、输出 $20($25)、缓存读 $0.20($0.50)、5 分钟缓存写 $5($6.25)。缓存读只有基础输入价的 0.05 倍,最小可缓存前缀是 512 token。另有 1 小时缓存写 $8,Batch API 半价即 $2 / $10,Fast 模式 $8 / $40、最高 2.5 倍速。官方把降价拆成两半来解释:单价更低,加上每个任务消耗的 token 更少,合起来是 40% 的降幅。
跑分:领先项与落后项都列出来
官方给的对照表(Opus 5.5 / Fable 5.1 / Opus 5 / GPT-6 Astra / GPT-5.6 Sol):Terminal-Bench 4.0 为 66.4% / 55.8% / 52.3% / 57.9% / 37.3%;FrontierCode v1.1 主集 54.4% / 50.3% / 48.0% / 53.3% / 47.5%;CursorBench 4.0 为 57.8% / 51.8% / 46.6% / — / 41.7%;知识工作的 GDPval-AA v2.1 为 1846 / 1735 / 1708 / 1542 / 1588;Humanity's Last Exam(带工具)67.7% / 65.6% / 63.6% / 57.2% / —;电脑操作 OSWorld 2.0 为 81.8% 部分完成 / 80.7% / 74.0% / — / —。不是全部第一:Terminal-Bench-Science 0.1 上它是 58.7%,低于 GPT-6 Astra 的 64.6%;AutomationBench 的 40.0% 也低于 Astra 的 41.4%,而且这项是 Zapier 跑的、没配回退模型,安全干预被算作失败。
长任务上的实测数字
官方举了几个可对照的例子:有早期测试者用它把 68 万行代码做迁移,花的时间不到一天;有人用它审计并修复一个 20 万行的代码库,不到 3 小时,而 Opus 5 在同一件事上超过 20 小时且用了 2.5 倍 token;内部测试让它把 HAProxy 从 C 重写为 Rust,两个模型的重写都几乎通过 HAProxy 自身的回归测试,但它用 9.5 小时完成,Fable 5.1 用了 12 小时,成本低 51%。
四个破坏性变更(升级前必读)
第一,thinking 不能关闭:在 Opus 5 上 thinking: {"type": "disabled"} 在 effort 不高于 high 时是被接受的,到 5.5 上这个字段和手动的 budget_tokens 都返回 400,只能省略 thinking 字段或写 adaptive,思考深度交给 effort 参数。第二,强制工具调用没了:tool_choice 的 any 与 tool 会报错,改用 auto 配 strict tool use 或结构化输出。第三,thinking 块与模型和会话绑定。第四,computer_20251124 这个电脑操作工具在 Claude API 与 Google Cloud 上不再被接受,要换成 computer_toolset_20260801;在 Amazon Bedrock 上的既有集成仍然可用。前三条同样适用于 Claude Fable 5.1。
一个不报错、只会让程序变安静的改动
默认的 display 设置下,工具调用之间的文本会以「文本为空」的 thinking 块返回。这件事不会让任何请求失败,但如果你的应用把这段文本当作进度提示流式展示给用户,界面会在两次工具调用之间静默下来。解决办法是显式设置一个会返回文本的 display 值,同时按内容块的 type 字段而不是位置来取内容、在工具循环里原样回传 thinking 块。
默认档位也换了
Opus 5.5 的默认 effort 是 medium,而 Opus 5 是 high。也就是说,一个省略 effort 的请求会在你没改代码的情况下自动降一档。官方建议重新做一次 effort 扫描:质量守得住的地方往下降,最吃力的任务往上加。
规格与安全说明
上下文 1M token,最大输出 128K token,Batch API 配 output-300k-2026-03-24 这个 beta 头可到 300K;可靠知识截止与训练数据截止都是 2026 年 6 月;输入支持文本与图片。发布前由外部机构评测,官方点名了 Frontier Design 与 METR;官方称它在其自动化行为审计上是目前测过表现最强的模型。需要留意的是官方同时说明:为了安全干预,网络安全类任务会由 Opus 4.8 完成、生物与前沿模型开发类任务会由 Opus 5 完成,这会让它在这几项跑分上偏低。
该不该升
已经在用 Opus 5 并且跑的是长任务(代码库级迁移、审计、跨仓库改造)的,升级的收益最直接,而且是单价与 token 消耗同时下降。相反的情况是:调用里深度依赖 tool_choice 的 any/tool、或者靠关闭 thinking 来省 token、又或者把工具调用之间的文本当进度提示展示——这几类项目升级前必须先改代码并重测,否则轻则报错,重则线上静默。官方自己还留了一句诚实的话:在这种能力水平上,跑分边际已经不太能反映真实差距,自家使用中与 Fable 5.1 的落差比分数显示的要小。照着这句话,选型的判断标准应该落在自己的评测集与账单上,而不是这张对照表。