NVIDIA Personal AI Router(PAIR)是一个开源的本地推理路由器:它负责发现同一局域网里装了 PAIR 的电脑,统一管理每台机器上的 Ollama / LM Studio 引擎,再向应用暴露 OpenAI 兼容的代理端点。简单说,请求从任何一台机器进来,PAIR 会把它交给当前负载最合适、且装有对应模型的机器去跑。适合你手头有几台闲置电脑、想跑多 Agent 并发,或单纯不想给每台机器单独配一套 API 的情况。
第一步:确认设备与预期
PAIR 支持 Windows 11、Linux 与 macOS(x64 和 arm64 均可;Windows on ARM 为实验支持),三套系统可以互相配对。需要先摆正预期:PAIR 只路由“完整请求”,不做显存池化,也不会把一个模型拆分到多台机器上跑——想跑超过单机显存的大模型,它帮不上忙。它能做的是把不同请求分散到不同的空闲机器,并让 prompt 与响应默认留在本地网络。
第二步:下载并安装
到 GitHub 仓库 NVIDIA/Personal-AI-Router 的 Releases 页下载对应安装包(签名安装包会自动配好后台上服务,Windows 还会自动加好防火墙规则):
- Windows:下载 .exe,双击后按安装向导操作即可。
- macOS:下载 .dmg,把 NVIDIA Personal AI Router 拖入 Applications 文件夹。
- Linux(Debian/Ubuntu):在下载目录执行 sudo apt install ./NVPAIR-Setup-*.deb。
第三步:装引擎并拉模型
像打开普通应用一样启动 PAIR,等 Overview 显示本机后:在节点卡片上打开 Engine settings,点 Install 安装 Ollama 或 LM Studio(不需要你预先装好,PAIR 会自己下载配置);装好后在同一张卡片点 Add model 拉取模型,官方示例用的是 qwen4:12b,可以替换成你平时用的模型。
第四步:先在本机发一条请求试试
两种方式都行:在 Settings → Service 里点 Test,PAIR 会自己发一分钟推理流量,你可以在 Overview/Jobs 里观察请求落到哪台机器;或者直接对它的 Ollama 兼容端点发请求:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen4:12b","messages":[{"role":"user","content":"用一句话说明路由器是做什么的"}]}'返回是标准 OpenAI 风格 JSON。如果你改过端口、或引擎用的是 LM Studio,去 Endpoints → API endpoints 里复制实际地址,不要照抄上面 11434 端口。
第五步:把第二台电脑配对进来
在“主节点”的 Settings → Cluster 里发起邀请,界面会给出一个六位 PIN;第二台机器装好 PAIR 后,在它的 Settings → Cluster 输入这串 PIN 完成配对(两台机器需在同一局域网)。配对成功后给第二台也装上引擎、拉好模型,之后请求会按“哪台机器有对应模型 + 当前负载”自动路由。在 Overview 里能看到每台节点上报的实时 GPU 与内存占用,以及任务到底跑在哪台机器上。
把独立请求路由给空闲机器,而不是把一台大模型拆开——这是 PAIR 与“显存池化”方案最本质的区别。
更多内容(Getting Started 图文版、引擎生命周期、无桌面环境的终端模式、故障排查)都在仓库 docs/ 目录;如果某台机器一直停在 Loading,优先看 Settings → Service 的状态与 Troubleshooting 文档。