如果你担心把公司数据或个人隐私发给 OpenAI/Claude 的云端 API,Ollama 是解决方案——它在你的电脑本地运行开源大模型,所有数据不离开你的机器。完全免费、完全隐私、完全离线可用。
硬件要求
- 最低:8GB 内存 + 4GB 显存,可跑 7B 参数模型(如 Llama 3.1 8B)
- 推荐:16GB 内存 + 8GB 显存,可跑 14B 参数模型(如 Qwen 2.5 14B)
- 高端:32GB+ 内存,可跑 32B+ 模型
- 纯 CPU 也能跑,但速度慢(7B 模型约 5-10 tokens/s)
第一步:安装 Ollama
访问 ollama.com,下载对应平台的安装包。Windows/Mac 都有一键安装程序。
安装后打开终端验证:
ollama --versionOllama 的设计哲学是极简——一行命令下载并运行模型,不需要配置环境、不需要安装依赖。
第二步:下载和运行第一个模型
推荐从中文能力最强的 Qwen 2.5 开始:
ollama run qwen2.5:7b首次运行会自动下载模型(约 4.7GB),下载完毕后直接进入对话模式。你就可以像和 ChatGPT 聊天一样使用它了。
其他推荐模型:
- ollama run llama3.1:8b — Meta 的最新开源模型,英文能力强
- ollama run deepseek-r1:7b — DeepSeek 推理模型,数学和代码强
- ollama run qwen2.5:14b — 更强的中文模型(需要 16GB+ 内存)
- ollama run nomic-embed-text — 文本向量模型,用于 RAG 知识库
第三步:通过 API 调用
Ollama 启动后会在 localhost:11434 暴露一个 OpenAI 兼容的 API。你可以用任何语言的 HTTP 客户端调用:
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5:7b",
"messages": [
{"role": "user", "content": "你好,介绍一下你自己"}
]
}'这意味着你可以在自己的应用中嵌入 AI 功能,完全不需要外部 API。
第四步:搭建本地知识库(RAG)
结合 Ollama 和向量数据库,可以搭建私有 AI 知识库:
- 用 Ollama 运行 nomic-embed-text 模型生成文档向量
- 把向量存入 ChromaDB 或 Qdrant 等向量数据库
- 用 Ollama 运行 Qwen 2.5 作为生成模型
- 使用 LangChain 或 LlamaIndex 编写 RAG 管道
- 用户提问 → 检索相关文档 → AI 基于文档内容生成回答
这样你的公司文档、个人笔记、研究资料就可以被 AI 检索和问答,数据完全不出本地。
第五步:配合 Open WebAI 前端
纯命令行聊天体验不好。推荐安装 Open WebUI(原 Ollama WebUI)获得类似 ChatGPT 的网页界面:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main访问 http://localhost:3000 即可使用,支持多模型切换、对话历史、文档上传等功能。
Ollama vs 云端 API
- Ollama:免费、隐私、离线可用,但模型质量和速度不如云端大模型
- 云端 API(GPT-4/Claude):模型最强、速度最快,但收费且数据经过第三方
- 建议:敏感数据用 Ollama 处理,创意和复杂推理用云端 API,两者互补