编码模型这周的榜首换人了。但真正值得看的不是名次,是两个数放在一起:综合分从 60 涨到 66,单任务成本从 10.79 美元涨到 13.04 美元。厂商同期还把单价降了两成。
标价降,账单涨。下面把这两个数拆开算一遍,再说清楚什么时候值得多付这笔钱。
结论先行:6 分,和 21%
Opus 5.5 在一份公开的编码 Agent 综合指数上拿到 66 分,比上一代高 6 分,是这份榜单目前测到的最高分。换成钱:一个任务 13.04 美元,上一代是 10.79 美元,涨了 21%。
厂商同期干了另一件事。输入/输出单价从每百万 token 5/25 美元降到 4/20 美元,缓存读从 0.50 降到 0.20。三档全降。
也就是说,这次账单上涨跟定价没关系。单价降了两成,单个任务的支出还是涨了两成。差额全部来自用量。
任何只按价格表选编码 Agent 的做法,在这一轮会直接选反。
66 分是三项等权算出来的
| 评测方向 | 上一代 | 现在 | 变化 |
|---|---|---|---|
| 终端操作类任务 | 54.5% | 63.1% | +8.6 |
| 真实仓库改代码 | 62.5% | 68.4% | +5.9 |
| 代码问答 | 62.1% | 66.4% | +4.3 |
三项等权合成 66 分。
表里最该注意的是第一行。终端操作类任务的涨幅比另两项大一截,而这类任务的特点是没法一次写完:要在终端里反复执行、读报错、改方案,一轮接一轮。
涨分最多的地方,正好是最费 token 的地方。
涨的钱全在输出侧
按用量拆开,两代的差别就两类:
- 单任务总 token:1140 万涨到 1560 万,多 37%
- 单任务输出 token:约 13.7 万涨到 33.3 万,翻了一倍多
缓存输入同时从 1090 万涨到 1460 万,看着也不少,但输出单价是输入的 5 倍。同样一笔涨幅,落在输出上要贵得多。
结论很直接:账单涨的不是单价,是它做的事变多了。写得更长、试得更多轮,钱就出去了。
「想得久」要按输出计费
现在主流做法是把思考过程算进输出 token 一起计费。这条规则决定了一件事:模型的进步如果来自更长的思考链和更多轮工具调用,那么能力上涨会同步推高账单。
这也解释了一个很常见的困惑:换用更强的模型之后,账单涨幅总比按单价估算的猛。你买的不只是「更聪明」,而是「愿意多想几轮」。聪明是结果,多轮是过程,计费按过程算。
所以判断值不值,不能比单价,只能比任务。
分数和成本要成对看
这次的结果在「分数—成本」平面上把可行区域往外推了一点:没有更便宜的模型能打到 66 分。注意这句话的含义。它不是说性价比更高了,而是说想拿这个分数就得掏这个钱。
采购上的正确动作是分层,而不是全换:
- 要反复试错、失败代价高的任务,用贵的这一档
- 一次能说清、改错了也无所谓的小改动,交给便宜的那一档,你付的是它的思考,不是体力
- 卡在中间的任务,先量一遍再定
怎么把这笔账算进预算
按 token 单价预估成本,是目前最容易出错的做法。可行的顺序是:
- 从过去一段时间的真实提交里抽一批任务,记录每个任务的 token 消耗,算出任务级平均值
- 用任务平均消耗乘单价,得出「每个任务多少钱」,只有这个数能进预算
- 把这个数配上通过率再比一次。便宜两成、失败率高一倍的模型,真实成本反而更高
- 多轮任务保持上下文前缀稳定,让缓存读命中。这次 1560 万 token 里有 1460 万是缓存读,命中率一动,账单立刻跟着动
- 要压成本,先调努力档位和工具调用轮数上限,再考虑换模型。少想一点、少试两轮,对账单的影响比换模型更直接
三个容易翻车的地方
榜单口径是「最高努力档」。 分数和成本都是在拉满的档位下测的。你的接入方式不拉满,这两个数就不成立。反过来也别拿自己跑了一两次的体验去推翻它,因为你用的不是同一个档位。
任务成本跟你的代码库强相关。 仓库越大、语言越杂、测试越慢,单任务消耗会明显高于榜单平均值。榜单给的是它自己那套题的平均值,能不能直接套到你的仓库,要先量。
缓存便宜是有条件的。 缓存读单价低,前提是前缀稳定、且在有效期内还能命中。把这部分当成「肯定会便宜」来算预算,很容易超支。
一句话
分数买的是能力上限,任务成本才是你要付的账。
这次两个数一起涨,涨幅都不小:6 分,21%。选模型时先问它能干什么,再问干一次多少钱。单价不是答案,每个任务的钱才是。