MoE:专家团协作

混合专家(Mixture of Experts)把模型拆成大量「专家子网络」,门控机制按输入只激活最合适的少数专家:V3 总参数 6710 亿,处理每个 token 仅激活 370 亿。相当于一个几百人的团队,每次任务只叫最对口的几个人,容量不变、算力大省。

MLA:多头潜在注意力

多头潜在注意力(Multi-head Latent Attention)是注意力机制的升级:把注意力键值压缩到低维潜在空间,长上下文场景下缓存与显存开销大幅下降,推理更省、更快。这是 V3 支持 128K 上下文还跑得动的重要原因。

MTP 与负载均衡

  • 多 Token 预测(MTP):一次预测多个 token,生成速度从 V2 的 20 TPS 提升到 60 TPS
  • 无辅助损失负载均衡:避免 MoE 中部分专家过载、部分闲置,让每个专家的工作量更均匀
  • FP8 混合精度训练:进一步降低显存与训练成本

为什么便宜

MoE 只激活小部分参数 + MLA 压缩注意力开销 + MTP 提升吞吐 + FP8 降显存,四项叠加让 V3 以约 557 万美元完成训练(对比 Meta Llama 3.1 约 5 亿美元),推理定价也远低于同档闭源模型。

V3 的启示:堆参数不是唯一路线,把每个参数用对地方,才是「降本增效」的真正答案。