Kimi K2.6 在六项正面对比里赢了四项,单价还只有闭源旗舰的五到六分之一。但比这两件事更值得记下来的,是它单次跑了 12 小时没跑偏。
开权重模型和闭源旗舰之间那条线一直在挪,这次挪动的部分不在分数上,在耐力上。
六项对比:赢四项,输的两项差距不到 1 分
六项结果摆在一起是这样:
| 评测方向 | Kimi K2.6 | Claude Opus 4.6 | 结果 |
|---|---|---|---|
| SWE-bench Pro(Agent 编码) | 58.6 | 53.4 | 新模型 +5.2 |
| HLE(带工具,Agent 推理) | 54.0 | 53.0 | 新模型 +1.0 |
| DeepSearchQA(深度检索) | 92.5 | 91.3 | 新模型 +1.2 |
| LiveCodeBench(代码题) | 89.6 | 88.8 | 新模型 +0.8 |
| SWE-bench Multilingual | — | — | 闭源旗舰领先,不到 1 分 |
| BrowseComp | — | — | 闭源旗舰领先,不到 1 分 |
这张表有两种读法。一种是把四项领先直接当成胜负已分;另一种是看差值的分布——赢下的四项里,三项的差距都在 1 分上下,只有 Agent 编码那一项拉开了 5 分多。
分布本身说明了点东西:在「给一道清楚的题、答一次」的题型上,两者已经贴得很近;差距真正显出来的地方,是那种要反复改代码、反复跑测试的题。
另外要提醒的是口径。这六项是发布方自己组织的对比,题目怎么选、跑几次取什么值、工具预算给多少,都不公开。它能说明「这个量级的模型已经到这儿了」,不能说明「换成它,你的任务就一定更好」。
价格表比榜单更直接
单价这一栏没什么解读空间:
- Kimi K2.6:输入每百万 token 0.95 美元,输出 4 美元
- Claude Opus 4.6:输入 5 美元,输出 25 美元
- 命中缓存之后:0.16 美元 对 0.50 美元
前后都是五到六倍的差距,许可是修改版 MIT,权重可以直接部署。
便宜这件事本身不新鲜,开权重模型的定价一直在那一档。真正要问的是:省下的钱够不够填能力上的差距。过去这个问题的答案通常是「填不上」,所以大家宁可多掏钱。
那两次长跑才是分水岭
榜单之外,发布方给了两次实际跑完的长任务,信息量比分数大。
一次是把一个小模型的推理代码在 Zig 里做移植和优化。模型自己跑了 12 小时以上,中间发起四千多次工具调用,最后在同样的硬件上比主流的本地推理方案快约 20%。
另一次是重构一套八年前的金融撮合引擎,跑了 13 小时,峰值吞吐提升 133%。
这两件事的共同点是没法一次写完:读代码、改、跑测试、看报错、再改,一轮接一轮。中间任何一步丢掉上下文,前面几小时的进度就白费。
开权重模型过去和闭源旗舰的差距,主要卡在这儿——不是单题答不对,是撑不住这么长的链路。这次真正的信号是,长链路里最容易被忽略的那部分(状态不漂、目标不丢)补上了一块。
不过这两次都是单次结果,样本量是 1。「跑通过一次」和「每次都能跑通」,是两个结论。
榜单是入场券,不是结论
短回合的榜单和长链路任务之间,落差很实际。
榜单里每道题都是独立的,这题做错不影响下一题。真实任务不是:第 37 步的一次幻觉会把前面 36 步全部作废,而且报错信息看起来跟真正的病因差得很远。
由此有两个推论。
一是回合数一长,失败率不是线性累加的。单步 98% 的成功率,20 步之后还剩三分之二,100 步之后只剩一成多。榜单分数再高,也替代不了「你的任务平均多少步」这个数。
二是看榜单要分清它测的是什么。大致分两类:一类测单步能力,题目给清楚、模型答一次;一类测任务完成度,只给目标、让它自己去试。前者和日常提效的关系有限,后者才接近 Agent 的真实场景。选型时优先看第二类。
换模型前的四步抽测
- 1建回归集从自己的提交记录里抽二三十条真实任务,简单和难的都要有
- 2固定变量工具、提示词、上下文策略全部锁死,只换模型
- 3记两个数每个任务记是否通过、消耗多少 token,算出任务级成本
- 4盯长尾重点看最难的那一成,那里才是差距所在
第三步最容易被跳过。按单价乘单次调用量估出来的成本,和实际账单经常差不止一倍,因为多轮任务的 token 消耗跟轮数、重试次数、上下文长度都相关——而这些恰恰是换模型之后最先变的东西。
三个容易翻车的地方
缓存命中不是默认值。 缓存读的单价便宜有前提:前缀稳定,且在有效期内。多轮任务里如果每轮都重写系统提示、拼接顺序不固定,缓存就命不中,账单一律按全价算。
自托管的成本不在单价里。 权重能下载不等于部署免费。显存、并发、运维、扩缩容,要么换成机器钱,要么换成人的时间。任务量不大的时候,API 单价反而更划算,因为省下的那部分还没覆盖掉固定成本。
官方对比只覆盖它愿意展示的题。 六项任务都是它自己选的。你需要的那件事可能是另一个样子:某个特定框架、某套老代码、某种数据格式。没进对比不代表做不了,但也不代表能做。
一句话
这次值得记的不是「开权重模型赢了」,而是长链路任务开始进入开权重模型的射程。
判断要不要换,可以先问三个数:你的任务平均多少步、最难的那成卡在哪、每完成一个任务实际花多少钱。这三个数比任何榜单都更接近你要的答案。