
Ollama 让本地运行大模型像装普通软件一样简单,普通笔记本 8GB 内存起步即可跑 7B 级别模型。
第一步到官网下载安装包,macOS 挂到菜单栏,Windows 安装后可在 PowerShell 调用。第二步执行 ollama run llama3,程序自动拉取权重并进入对话;想换更小版本可用 ollama run qwen2:7b。
第三步验证接口:另开终端访问 http://localhost:11434 即可看到 REST 输出。内存吃紧时设置环境变量 OLLAMA_NUM_PARALLEL=1并优先 4bit 量化版本,核显机型也能流畅推理。
装好只是第一步,跑通一个小例子才算真的会用。