它是什么
Liquid AI 开源了 LFM2.5-VL-3B-DSpark:在一个 3B 视觉语言模型(LFM2.5-VL-3B)上套用自家的 DSpark 投机解码(speculative decoding)。做法是配一个很小的草稿模型先猜、由主模型批量校验,从而在一次前向里产出多个 token。这个草稿模型只有 2.8 亿参数,整套下来总参数只增加 8.9%。
关键工程点
DSpark 原本是为纯文本模型做的,这次能直接复用到视觉模型上,原因在于草稿模型只吃「主模型转换出的多维数组」,与输入模态无关——图像信息在进入草稿模型之前已经被主模型编码掉了。这个解耦让视觉模型不必重新设计一套投机解码方案。
实测数字
- MacBook Pro(M5 Max)跑 MMMU-Pro:解码提速 2.93 倍、端到端 2.62 倍。
- H100:解码提速 2.43 倍、端到端 1.97 倍。
- 已支持 llama.cpp、MLX-VLM 与 SGLang,权重以开源形式放出。
代价与适用场景
代价是内存占用上升——多出来的那份草稿模型要常驻。所以在显存或内存紧张、并发不高的部署里,收益会被抵消一部分。判断标准很简单:如果你的视觉模型推理是延迟敏感、批量较大,值得先量一下自己的草稿接受率;如果瓶颈在显存而不是解码速度,这套方案帮不上忙。
投机解码在视觉模型上同样成立,而且草稿模型只需要 2.8 亿参数。