它要解决的是 agent 的账,而不是通用的账
论文开篇定义的问题很具体:长周期、多轮的 agent 往往只生成很短的动作用,却要处理来自工具和环境的很长观测——一次搜索指令后面跟着一篇长文档,一次代码执行后面跟着大量日志。这些新增内容在下一轮推理前都要重新过一遍,也就是预填充;同时又要在几十万到上百万 token 的历史里找到真正相关的内容。需求因此被归纳成三条:预填充要更省、KV 缓存要更小、长上下文检索要更准。
两级 KV 共享:让预填充只跑一半
- 外层 KV Bridging:借鉴 YOCO 的 self-decoder / cross-decoder 结构,但只桥接全注意力层。cross-decoder 里全注意力层的 KV 缓存,直接由 self-decoder 对应层的隐藏状态经过本层投影生成;
- 内层 KV Reuse:沿用 HySparse 的设计,把全注意力层产生的 KV 缓存与选择索引继续给后续稀疏注意力层复用;
- 结果:cross-decoder 的所有 KV 缓存都能由 self-decoder 的隐藏状态构建,预填充跑完 self-decoder 就可以退出,跳过全部 cross-decoder 层。论文以 49 层模型为例,预填充与解码分离部署时预填充节点只需部署前 25 层,权重接近减半,而且这一阶段只执行一个全注意力层。
两处改动:选择粒度变细,外加一个强制局部窗口
第一,把块级稀疏换成 token 级稀疏:HySparse 一次选取 64 token 的整块,要取出藏在早期某次工具返回里的一个有用 token,就得连带处理周围一整块;token 级可以直接定位到需要的位置。第二,取消稀疏层里单独的 SWA 分支,改成强制把最近的一段窗口选进来——论文配置是固定保留最近 128 个 token,再从更早的上下文里选 1024 个。这样近期信息与远距离信息共用同一份 KV 缓存,省掉了额外投影参数和局部缓存。另外 HySparse2 用 MQA 替代 GQA,缓存更小、稀疏注意力核效率更好。
数字:省的与涨的
在 100 万 token 上下文下,论文给出的对比是:预填充 FLOPs 相对 HySparse 降到 1/2.92、相对 MiMo-V2 系列用的 Hybrid SWA 降到 1/5.02;KV 缓存占用 2.69 GB,HySparse 为 6.72 GB,Hybrid SWA 为 12.09 GB(约 1/4.5)。效果侧,团队训练了一组 80B-A3B MoE 做对照,三组模型用同一份数据与训练计划、只有注意力结构不同:约 5000 亿 token 预训练(32K 上下文)后,再用约 1000 亿 token 做轻量后训练并扩到 256K。后训练后,HySparse2 在 MRCR-v2 与 RULER-v2 上的平均分相对 HySparse 分别提高 11.30 与 19.81 个百分点,相对 Hybrid SWA 分别提高 6.44 与 18.65 个百分点;256K 下 RULER-v2 得分 58.45(HySparse 32.61、Hybrid SWA 35.74),AgentPPL 与 LongPPL 在各上下文长度下都更低。
团队自己给的限定
论文在通用能力部分说得比较克制:三种架构在知识、推理、代码上的整体表现大致相当,不同测试各有高低——HySparse2 在 BBH 与 MMLU-Pro 上更高,HySparse 在 DROP 等项上更好。提升集中在长上下文与 agent 任务上。此外取消独立 SWA 分支是一项架构取舍:省下了额外投影参数与局部 KV 缓存、让预填充可以中途退出,但部分数学推理与 MRCR-v2 成绩会变化。这些都是预印本口径、未经同行评审。
对你的意义
- 自训长上下文模型的:可以照它的对照方法复现——同一数据与计划,只换注意力结构,看 256K 下的真实检索分数;
- 做推理服务的:预填充与解码分离部署时,预填充节点只需装约一半权重,这个结论会直接改变你的集群配比与显存预算;
- 做 agent 产品的:这里省下的正是多轮工具调用里最贵的那部分重复计算,值得盯住它什么时候落到可调用的模型上。
别把它读成「小米架构全面更强」:论文说的是通用能力大致相当,长上下文与 agent 任务明显更好。