据科技媒体MarkTechPost 9月5日报道,NVIDIA本周发布开源虚拟推理路由器PAIR(Personal AI Router),用于在家庭网络中发现兼容节点,并把本地AI推理请求分发到RTX、DGX Spark和Mac节点。该工具以公开测试版(v0.1.1)发布,旨在缓解多代理工作流下本地推理请求排队导致的瓶颈。
报道称,多代理工作流中,一个主代理将任务拆解给多个子代理,一个用户请求往往变成几十个独立模型调用。若这些调用集中在同一台本地推理引擎上,会争用同一执行槽,而同一网络中的其他设备可能闲置。PAIR不是新的推理引擎,模型仍由Ollama或LM Studio在选定的节点上执行,PAIR只负责把请求调度到合适机器。
PAIR的代码托管在GitHub,采用Apache 2.0许可证,提供Windows、macOS和Linux签名安装程序。整个工具只在本地网络运行,只有下载模型时需要联网。
PAIR没有引入新的集群API,而是代理现有的Ollama兼容、LM Studio兼容接口,并提供OpenAI兼容代理端点。因此,已接入这些接口的智能体框架无需改动;请求仍由智能体决定,PAIR只决定请求在哪台节点执行。
设备发现通过mDNS自动完成,也可按IP添加节点。配对采用六位PIN码,配对成功后节点间使用mTLS加密通信。PAIR还能在配对节点上安装推理引擎并启动模型下载,减少跨机器的部署步骤。
调度时,节点只有开启了相应引擎且本机存在所请求的模型,才有资格处理请求;不同节点可保存不同模型。PAIR综合节点在线状态、引擎是否启用、模型是否齐全、当前任务负载和GPU利用率五项信号,把每个请求分配给一个合格节点,并在请求生命周期内不再迁移。该工具不汇集显存、不跨节点合并GPU,也不把单个请求分片。
NVIDIA的演示将PAIR与Hermes Desktop配合,创建了包含五个子代理的合成家庭收件箱工作负载,Ollama在所选节点上运行Qwen 3.6 35B A3B模型。单台RTX Spark笔记本平均耗时18分钟;由RTX Spark笔记本、DGX Spark和RTX 5090组成的三设备PAIR集群平均耗时8分48秒。
PAIR支持GeForce RTX 20系列及更新的GPU、Turing架构及之后推出的RTX PRO工作站GPU、DGX Spark和Apple M4或更新的芯片。Windows、Linux、macOS节点可在x64与arm64架构间混合配对,Windows on ARM仍为实验性支持。最低已验证配置为8GB内存,建议预留20GB磁盘空间。