本地部署的目的是数据不出本机、成本可控、可定制。但 7B、14B、27B、70B……参数与显存的关系先搞清楚,才不会买错机器。

第一步:按需求选模型

  • 办公问答/摘要:7B-14B 级足够(如 Qwen3-14B)
  • 代码与推理:27B-32B 级更稳(如 Qwen3.8-27B 4bit 约 17GB)
  • 长文档/复杂推理:70B+ 需要多卡或云上算力
  • 中文场景:优先 Qwen、DeepSeek 系

第二步:算硬件

  • 显存决定能装多大模型:4bit 量化约等于「参数量 × 0.5~0.7GB」
  • 16GB 内存 Mac:跑 7B-14B 可行,27B 会慢
  • 24GB 显卡(3090/4090):27B 4bit 舒适
  • 服务器:多卡 + vLLM 做并发

第三步:跑通最小闭环

  1. 装 Ollama 或 LM Studio
  2. 拉一个 7B 模型试跑
  3. 接 OpenAI 兼容接口到你的应用
  4. 再按需升级模型或加 RAG
本地部署的决策顺序:先定任务 → 再定参数 → 再定显存 → 最后才选工具。