本地部署大模型的核心瓶颈是显存(VRAM)。模型权重占用的显存 ≈ 参数量 × 每参数字节数,量化可以显著降低占用。
显存参考(量化后推理)
- 7B~8B 模型(Q4 量化):约需 6~8GB 显存,普通游戏卡(RTX 3060 12G/4060)即可流畅运行
- 14B~32B 模型(Q4 量化):约需 10~20GB 显存,建议 RTX 4070/4080/4090 或大显存显卡
- 70B 模型(Q4 量化):约需 40GB+ 显存,通常需要双卡或 48GB 专业卡
- 纯 CPU 也能跑小模型:速度慢(每秒几 Token),适合实验
量化是什么
量化(Quantization)把模型权重从 FP16/BF16 压缩到 INT8/INT4,显存需求下降、速度提升,质量略有损失。Q4/Q5 档是「显存与质量」的常见平衡点。
部署工具
个人用户推荐 Ollama(一条命令下载并运行模型,自带 API);服务端高并发用 vLLM、SGLang 等推理框架,配合 GPU 集群做吞吐优化。