用 LocalAI 在笔记本跑 OpenAI 兼容接口:没显卡也能调 Agent

为什么不直接用 Ollama 的 API

Ollama 好用,但它的接口和 OpenAI 不是一套。如果你的代码、Agent 框架是按 OpenAI 的 /v1 协议写的,LocalAI 能让你在本地获得一个「长得一模一样」的服务端,改个 base_url 就能从云端切到本机,调试 Agent、RAG 流程不用烧钱。

最快的起法:Docker 一条命令

docker run -p 8080:8080 -v $PWD/models:/models localai/localai

服务起来后默认在 8080 端口。把你的 GGUF 模型(比如 qwen2.5 的 gguf)丢进 models 目录,再写一个 models 配置指明文件路径,重启就能在 /v1/models 里看到它。想换模型就是换文件,不改代码。

拉镜像起服务放 GGUF模型调 /v1API
Docker 起服务 → 兼容 OpenAI

接你的代码只改一行

from openai import OpenAI
client = OpenAI(base_url="http://localhost:8080/v1", api_key="sk-not-needed")
r = client.chat.completions.create(
    model="qwen2.5-7b-instruct-gguf",
    messages=[{"role": "user", "content": "用一句话解释什么是向量数据库"}]
)
print(r.choices[0].message.content)
  • 模型选 GGUF 量化版,8GB 内存的笔记本也能跑 7B。
  • CPU 模式慢但能跑,有核显/N 卡会自动走 GPU。
  • 适合先在本地把 Agent 流程跑通,再决定要不要上云。
省事做法:本地用 LocalAI 调通 Agent 逻辑,上线时把 base_url 换回云端 key,代码一行不用改。