先分清哪些参数必须装下、哪些只是慢

大 MoE 在本机跑不动,多数时候不是算力不够,而是内存装不下。Colibrì 这类分层推理框架的思路是把模型切成两半:每个 token 都要用的稠密部分(Attention、Embedding、共享专家)必须常驻内存,路由专家则可以放在 SSD 上按需读取。先接受这条切分线,硬件账才有的算。

  • 常驻部分决定内存下限:GLM-5.2 这部分约 17B 参数,int4 后约 9.9GB——这也是 16GB 内存能勉强起跑、24GB 才开始舒服的原因
  • 路由专家决定硬盘下限:GLM-5.2 全部专家 int4 后约 370GB;2.8T 的 Kimi K3 需要约 1.6TB 存储
  • 显存不决定能不能跑,只决定跑多快:没有 GPU 也能出结果,有 GPU 只是把常用专家留得更近

速度几乎全部来自「少读盘」

冷缓存下每生成一个 token 都要去硬盘翻专家,实测只有 0.05–0.1 token/s,这个速度只能算「证明它能跑」。真正拉开差距的是三件事:LRU 缓存留下刚用过的专家、按调用频次把常客钉在快层、以及利用相邻层路由的相关性提前预取——官方给出的提前一层可预测性是 71.6%。

  1. 第一步看预取命中率:命中低说明你的任务在专家分布上很分散,加内存的收益有限
  2. 第二步看各层命中比例:VRAM / RAM / SSD 的命中分布直接告诉你瓶颈在哪一层
  3. 第三步才轮到选硬件:命中主要卡在 RAM 就加内存;已经能留在高速层,再考虑加显卡
官方给出的参考速度:128GB 内存的纯 CPU 桌面机约 1.8 token/s;6 张 RTX 5090 让专家常驻高速层后约 5.8–6.8 token/s。

什么时候不值得折腾

这套办法的前提是 MoE 的稀疏性——路由每次只激活一小部分专家,才允许你「装不下就先不装」。稠密模型没有这个空间,加多少硬盘都没用。定位也要认清楚:即便配到 6 张 5090,六七 token/s 也只适合离线批处理、数据合成和验证实验,接不了需要即时响应的交互产品。

  • 适合:一次性大批量生成、评测跑分、数据标注、验证某个模型值不值得上云
  • 不适合:多人并发或低延迟的线上服务
  • 加第二块盘摊分读取只在盘本身带宽够用时才有收益,先测再加