返回博客
·AI工具

把家里的 RTX 显卡组建成私有 AI 集群:NVIDIA PAIR 尝鲜体验

NVIDIA 推出 PAIR 工具,将局域网内的 RTX 显卡和 Mac 组建成私有 AI 推理集群,让本地大模型跑得更快、隐私更安全。

#NVIDIA#PAIR#本地AI#AI集群#开源大模型#Ollama#LM Studio

# 把家里的 RTX 显卡组建成私有 AI 集群:NVIDIA PAIR 尝鲜体验

**分类:AI工具 | 标签:NVIDIA,PAIR,本地AI,AI集群,开源大模型, Ollama, LM Studio**


前言

2026 年 9 月,NVIDIA 悄悄上线了一个免费公测工具 **PAIR**(Private AI Infrastructure Routing)。它的目标听起来很直接:把你的 RTX 台式机、笔记本、Mac,甚至 DGX Spark 小型服务器,通过本地网络组建成一个**私有 AI 计算集群**,让本地模型推理跑得更快、更稳,不依赖任何云服务。

这对于想本地跑大模型、但单卡性能不够、又不想把数据送上云的人来说,是个相当有意思的思路。


PAIR 是什么

PAIR 本质上是一个**智能路由层**。它会自动扫描局域网内所有运行 Ollama 或 LM Studio 的机器,然后根据每台机器的 GPU 负载和显存大小,把推理请求分配到最合适的节点上。

简单来说:

  • 你有 RTX 4090 台式机 + M3 Max MacBook Pro,过去两台机器各跑各的;
  • 现在 PAIR 把它们识别为同一个推理池,Mac 跑小模型,台式机跑大模型,统一入口,自动分流。

  • 怎么用

    PAIR 目前支持 Windows、Linux 和 macOS,官方教程分三步:

  • **下载安装**:去 NVIDIA 官网下载 PAIR beta,安装后运行,它会自动扫描局域网内的 Ollama / LM Studio 实例;
  • 2. **配置后端**:在 PAIR 控制台里确认每台机器的地址、GPU 型号、可用显存;

    3. **开始推理**:把原本发给 Ollama 的请求地址换成 PAIR 的本地端点,一切照旧,后台自动路由。

    NVIDIA 官方还提供了 docker-compose 一键部署配置,熟练用户 5 分钟能跑起来。


    实测效果

    目前社区已经有第一批测试结果。以 Llama 3.3 70B 为例:

  • 单卡 RTX 4090(24GB):跑不动,必须量化到 Q4_K_M,推理速度约 8 tokens/s;
  • RTX 4090 + Mac M3 Pro 组队:Mac 跑量化层,4090 跑主力层,速度提升至 18 tokens/s,提升 2.25 倍;
  • 多卡路由模式(3 台机器):自动均衡负载,整体吞吐量接近单卡极限的 2.8 倍。
  • PAIR 还在持续优化路由算法,后续版本计划支持 GPU 温度感知降频和动态批处理。


    为什么这件事值得关注

    **隐私优先的场景终于有了靠谱方案。** 过去本地跑 AI 模型,要么单卡硬撑(速度慢),要么手动配置分布式(门槛高)。PAIR 把这个过程做到了「一键路由」,普通人配好 Ollama 就能用。

    **对开发者的意义更大。** 如果你在开发 AI 应用,需要一个可复现的本地推理环境,PAIR 提供了一个标准化接口。配合 LM Studio 的 API 兼容层,理论上可以无缝替换 OpenAI API 调用路径。


    结语

    AI 推理的基础设施正在从「云端集中」向「边缘分布」演进。PAIR 不是第一个尝试这个方向的工具,但它背靠 NVIDIA 的硬件生态,门槛最低,潜力最大。如果你手边有多台设备,不妨试试——把自己的设备变成一台私有 AI 超算,这个感觉还挺酷的。


    *PAIR 目前为免费公测,可前往 NVIDIA 官网获取下载地址。*