Ollama 不止能聊天:pull / run / Modelfile / 本地 API 一网打尽

不止 ollama run

Ollama 不只是一个聊天窗口。它背后是一套本地模型管理服务:负责下载模型、在本地起推理、用 Modelfile 改系统提示和参数,还顺手提供了一个 OpenAI 兼容的 API。

最常用的几条命令

ollama pull llama3.1        # 下载模型
ollama run llama3.1 "用一句话解释量子纠缠"  # 直接提问
ollama list                 # 看已装模型
ollama rm llama3.1          # 删除
ollama serve                # 起本地服务(默认 11434)

Modelfile:把人设和参数固化

想让模型固定某种风格(比如严谨、中文、低温度),不用每次在 prompt 里写。写个 Modelfile 构建成自己的模型。

FROM llama3.1
SYSTEM 你是一个严谨的中文技术助手,回答先给结论再展开。
PARAMETER temperature 0.3
PARAMETER num_ctx 8192

保存为 Modelfile 后执行:ollama create mybot -f Modelfile,之后 ollama run mybot 就是定制好的模型。

最关键的一招:本地 API

ollama serve 起的服务在 11434 端口,提供 /v1 接口,和 OpenAI 格式一致。任何支持 OpenAI 的代码,只要把 base_url 改成 http://localhost:11434/v1,就能零改动切到本地模型——前面几篇文章的脚本都是这么连的。

pull模型run对话Modelfile定制serve /v1API
下载 → 对话 → 定制 → 服务

几个坑

  • 端口被占:ollama serve 默认 11434,改不了就先停掉占用进程。
  • 想换模型后端:Ollama 也能跑嵌入模型(nomic-embed-text),RAG 直接用。
  • 远程访问:默认只监听本机,要对外需反向代理或改环境变量。