Ollama 把「下载模型 + 推理服务 + 命令行交互」打包成一条命令,是目前本地部署门槛最低的工具。

基本用法

ollama pull qwen2.5:7b   # 下载模型
ollama run qwen2.5:7b      # 命令行对话
ollama list                 # 查看本地模型

API 调用

Ollama 默认监听 11434 端口,提供 REST API,且兼容 OpenAI 格式,很多应用可直接把 base_url 指向它:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'

常见问题

  • 模型库搜索:Ollama 官网 Library 可按标签筛选中文、代码、多模态模型
  • 显存不足:改用更小模型或更低量化档(如 :7b-q4_K_M)
  • 局域网访问:默认只监听本机,修改 OLLAMA_HOST=0.0.0.0 并注意安全
  • 嵌入模型:ollama pull nomic-embed-text 可配合本地 RAG 使用