小模型这一层过去一直有个尴尬:便宜是真便宜,但干不了需要「判断」的活,只能用来兜底。Haiku 5.5 想改的就是这个定位——价格往下砸了一档,能干的活往上抬了一档。
先说价格:不是小降,是换了一个数量级
10 万 token 以内的请求,输入 $0.10、输出 $0.50 每百万 token,缓存读取 $0.01。官方口径是平均比 Haiku 4.5 便宜约 75%,最高约九成——换算下来,跑同样一段轻活,成本大约是 Sonnet 5.5(输入 $2 / 输出 $10)的十几分之一。
有一点要留意:它换了新 tokenizer(和 Sonnet 5.5 / Opus 5.5 同一套),完成同一件事会比 Haiku 4.5 多用一些 token,所以「便宜 75%」不能简单按单价乘算,得按实际任务量。
分数涨在哪、哪里还差
- 知识工作 GDPval-AA v2.1:1620(Haiku 4.5 是 735,Sonnet 5.5 是 1840)
- 计算机操作 OSWorld 2.1(离线子集):72.4%(前代 15.7%,Sonnet 5.5 是 83.9%)
- 多学科推理 Humanity''s Last Exam:45.9% 无工具 / 57.4% 带工具(前代 10.2% / 18.7%)
- Agentic 编码 Terminal-Bench 4.0:39.2%(前代 0.0%,Sonnet 5.5 是 70.6%)
涨得最凶的是「会动手」这一类:计算机操作从几乎不能用变成勉强能用,这一步比跑分本身更有意义——它意味着小模型开始能被放进执行的链路里,而不只是做文本处理。
官方给的定位很具体
Anthropic 自己说得很清楚:Haiku 5.5 适合范围明确、但过去因价格被挡在门外的小任务,比如上下文压缩、摘要、把 agent 里大量重复的轻活接过去。复杂 agentic 编码仍建议走 Sonnet 5.5 / Opus 5.5。这其实是在承认:它替代的不是主模型,而是那条「要不要为这点活付贵模型的钱」的犹豫线。
官方提示:Haiku 5.5 是它目前最快的模型(标准速度下),但在 Fast Mode 下 Opus 仍然更快。
顺带的两处变化值得一起算
同日 Anthropic 把 Sonnet 5.5 的缓存读取价从每百万 $0.20 降到 $0.10,官方说这让多数 agentic 任务便宜约 20%——agent 场景里缓存读占大头,这一刀比表面看起来有用。另外还给 Claude Max 与 Team 订阅者加了每月 API 额度。
把这两件事放一起看:小档降价、大档的缓存也降价,中间那档「便宜模型跑不动、贵模型又不划算」的灰区正在被挤掉。对做 agent 的团队来说,值得重新算一遍路由策略,而不是继续沿用去年的换算。