vLLM 是面向生产环境的 LLM 推理框架,核心解决「慢」和「贵」:通过 PagedAttention(分页注意力)管理 KV Cache,加上 Continuous Batching(连续批处理),吞吐量可达传统方案的数倍。
核心概念
- KV Cache:推理时缓存已计算过的注意力键值,避免重复计算,但占用显存
- PagedAttention:像操作系统分页一样管理 KV Cache,减少显存碎片
- Continuous Batching:请求动态进出批次,而不是等整批结束
- Prefix Caching:相同前缀(如系统提示词)的推理结果复用
快速上手
pip install vllm
vllm serve Qwen/Qwen2.5-7B-Instruct --gpu-memory-utilization 0.9适用场景
vLLM 适合高并发的生产服务(API 网关、Agent 后端)。个人单机实验用 Ollama 更省事;两者都兼容 OpenAI 格式接口,可无缝切换。
注意
量化与投机解码(Speculative Decoding)等加速手段可进一步提效,但会增加部署复杂度;建议先跑通基线再逐项优化。