先看三个数字

9 月 21 日,小米 MiMo 团队发布并开源 MiMo-V2.6 系列。系列里有两个原生全模态模型 Pro 与 Flash,另有一个面向速度的 UltraSpeed 版本(调用时的模型名是 mimo-v2.6-pro-ultraspeed)。

第一个数字是分数:Pro 在 Artificial Analysis 智能指数(AA Intelligence Index v4.3)拿到 46 分,官方称已超过 Kimi K3 与 Qwen3.8 Max、成为当前最强开源模型;同一份发布说明也写明,它与最强的闭源模型 Claude Fable 5.1、GPT-6 Astra 相比仍有差距。

第二个数字是训练开销:整轮强化学习跑了 6 天、约 347 万美元,30 个 RL step,产出 75 万条轨迹。第三个数字是价格:开放平台的 API 定价没有跟着分数调整,公开报道的口径是约为海外同性能模型的 1/20 至 1/60,UltraSpeed 的输出速度最高做到 Pro 的 20 倍。

官方把这条路线放在 RSI 上

发布说明的表述是,MiMo-V2.6 是团队探索 RSI(递归自我改进)的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展能力边界。换句话说,「6 天」不是宣传语,它就是方法本身——把能自动判对错的任务做成环境,然后用算力换迭代次数。

开源的不只是权重

  • Pro 与 Flash 的模型权重,以及技术报告;
  • MiMo-V2.6-Distill-Qwen-9B——把这一代能力蒸馏到一个更小模型上,以及配套的 RL 研究资源;
  • 7000 个 RL 任务环境,以及经过验证的训练实践;
  • MiMo Desktop 桌面客户端与会员订阅(订阅可用 Pro/Flash,也可以填自己的 API Key)。

第三项最容易被跳过,但它决定了这个模型能不能被「接着练」:没有环境和奖励设计,开源权重只能在推理侧使用;有环境,才有在自己的数据上继续做 RL 的可能。

榜单第一不等于可以替换旗舰

46 分让它在开源模型里排到第一,但 46 分与最强闭源模型之间的差距,正好落在长任务、工具调用、多轮编排这些真实场景上——这类能力在通用榜单里的权重最低,却最决定生产项目的成败。

更值得看的是任务成本口径

公开报道里有句话比 46 分更实用:这一代第一次把 45 分以上模型的单任务成本压到 0.1 美元量级。注意口径差别——每百万 token 的价格只跟单价有关,单任务成本还要算进重试、工具调用与编排的额外消耗。同样是「降本」,后者才是能进预算表的那个数。

该关注什么

  • 任务成本:在自有评测集上算「每个任务的美元成本 × 通过率」,而不是复述单价倍数;
  • 环境复用:7000 个 RL 任务环境里有多少贴近你的领域,能不能直接跑在你的数据上;
  • UltraSpeed 的代价:20 倍速只在特定档位,用于交互式场景前先测质量回落幅度。
读成「开源追上闭源」是误读;准确的说法是「开源阵营把竞争指标从分数换成了每个任务的成本」。