这一代改了什么:不是加参数,是加 RL 算力
MiMo-V2.6 系列包含 Pro 与 Flash 两个原生全模态模型,官方把这一轮的核心说成「以可验证的复杂任务为基础,规模化扩展强化学习算力」,并把它定位成探索 RSI(递归自我改进)的一步。Pro 在 Artificial Analysis Intelligence Index 上拿到 46 分,官方称超过 Kimi K3 与 Qwen3.8 Max、成为当前最强开源模型;同一段话里也写明,与 Claude Fable 5.1、GPT-6 Astra 相比仍有差距。
训练侧给得出数
- 时长与成本:不到 6 天,Flash 约 85 万美元、Pro 约 262 万美元;
- 步数与轨迹:各 30 步,累计约 75 万条轨迹;
- 任务通过率:平均相对提升 25%(Flash)与 12%(Pro);
- 样本外:DeepSWE v1.1 上 Flash 从 48.8 升到 65.7(约 +17 分)、Pro 从 58.4 升到 72.6(约 +14 分);
- 批次与上下文:单次更新 1,568 个样本,支持 1M 上下文训练,单步训练 token 3.5 到 3.7B。
稳定训练用的是笨办法:冻结路由 + 多道防线
官方提到两件工程上的事。一是随训练规模扩大冻结 MoE Router,用来抑制专家负载漂移;二是建了一条覆盖奖励设计、对抗性评测、异常检测与验证器交叉校验的防线来对付 Reward Hacking。这类细节通常不会写进发布稿,但对想复现的人价值最高——它说明「同样是 RL,能不能稳定跑完」主要差在这些地方。
价格:这次的重点是没涨
按官方价格表(每百万 token,人民币,实时推理,未命中输入 / 输出):mimo-v2.6-pro 为 ¥3.00 / ¥6.00,缓存命中 ¥0.025;mimo-v2.6-flash 为 ¥1.00 / ¥2.00,缓存命中 ¥0.02;mimo-v2.6-pro-ultraspeed 为 ¥30.00 / ¥60.00,缓存命中 ¥0.25。批量推理对半,pro 为 ¥1.50 / ¥3.00、flash 为 ¥0.50 / ¥1.00。美元口径下 pro 是 $0.435 / $0.87、flash 是 $0.14 / $0.28。官方注明缓存写入限时免费;价格表里 mimo-v2.5-pro 与 mimo-v2.5 标注「即将下线」。
缓存价为什么值得单独看
缓存命中价只有未命中价的 1/120(pro:¥0.025 对 ¥3.00)。在 agent 场景里,每轮新增的往往只是很短的动作用加工具返回,前缀被反复复用——命中率高低直接决定账单,而不是模型分数。这也意味着评估这类模型时,把「前缀是否稳定」做好(少改动系统提示、少打乱工具定义顺序)比换模型更省钱。
开源清单
- 权重:MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 在 Hugging Face 开源,许可 MIT;
- 另有 MiMo-V2.6-Distill-Qwen-9B 蒸馏版,社区很快做出了 GGUF 量化,适合本地与端侧;
- 技术报告、训练环境与 RL 代码一并放出;
- 参考热度:发布两天内 Pro-RL 权重约 477 赞、Flash-RL 约 446 赞,社区量化版下载量更高。
该不该换
- 用 API 的:拿最贵的一条长会话链路做 A/B,比「每任务总成本 + 通过率」,同时记录缓存命中率;
- 自托管的:先试 Flash 与 Distill-Qwen-9B 的显存与吞吐,再决定要不要上 Pro;
- 已在用 V2.5 的:把「即将下线」当成工期,提前排迁移窗口;
- 要 UltraSpeed 的:先确认那 10 倍单价确实买到了你需要的东西(对输出速度敏感,而不是对首 token 延迟敏感)。
这一代的判断标准不该是「有没有超过 Kimi K3」,而是「同样一个任务,你的账单降了多少」。