Ollama 把「下载模型 + 推理服务 + 命令行交互」打包成一条命令,是目前本地部署门槛最低的工具。
基本用法
ollama pull qwen2.5:7b # 下载模型
ollama run qwen2.5:7b # 命令行对话
ollama list # 查看本地模型API 调用
Ollama 默认监听 11434 端口,提供 REST API,且兼容 OpenAI 格式,很多应用可直接把 base_url 指向它:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b","messages":[{"role":"user","content":"你好"}]}'常见问题
- 模型库搜索:Ollama 官网 Library 可按标签筛选中文、代码、多模态模型
- 显存不足:改用更小模型或更低量化档(如 :7b-q4_K_M)
- 局域网访问:默认只监听本机,修改 OLLAMA_HOST=0.0.0.0 并注意安全
- 嵌入模型:ollama pull nomic-embed-text 可配合本地 RAG 使用