NVIDIA PAIR:把多台本地电脑变成 Agent 的分布式 inference 网络

NVIDIA 推出 Personal AI Router(PAIR)beta,让本地 Agent 把独立 inference 工作分派到同一网络内的多台电脑,支持 Ollama、LM Studio、RTX、DGX Spark 及 Apple Silicon。

NVIDIA 在 2026 年 9 月 3 日公布 Personal AI Router(PAIR),把本地 Agent 的瓶颈由「一台电脑够不够快」改成「几台现有电脑能否一起处理独立工作」。PAIR 是免费的 open-source software,会把兼容设备连成一个本地 inference 入口,再按节点状态、模型和引擎,把每个独立请求分派到合适的机器。

它针对的是多 Agent 或多 subtask 工作。当一个 Agent 把研究、文件整理、代码检查或个人管理拆成多个独立任务时,所有请求如果都挤在同一个 GPU,并行反而会变成等待。PAIR 不会把多张 GPU 合并成一张更大的虚拟 GPU,也不会把同一个 request 切开;它是把不同 job 路由到不同节点,让已有的模型和硬件可以并行工作。

NVIDIA 表示,PAIR 可以和 Ollama 及 LM Studio 一起使用,不要求 Agent harness 重新设计;应用仍指向本地 endpoint,由路由器决定实际服务请求的节点。官方技术文章还展示五个 subagent 的比较:三台设备的 PAIR cluster 完成示范工作的时间为 8 分 48 秒,单一 RTX Spark laptop 则为 18 分钟。这是 NVIDIA 的示范数据,不能直接推论到所有模型、网络和任务。

PAIR beta 支持 Windows、macOS 和 Linux,硬件范围包括 GeForce RTX 20 系列或更新、RTX PRO workstation、DGX Spark,以及 Apple M4 或更新的 Apple Silicon。这个组合很有意思:本地 Agent 的计算层不再一定由同一品牌或同一操作系统组成,而是由家庭或办公室现有的不同节点提供并行容量。

隐私是本地 inference 的主要卖点。NVIDIA 表示 prompts、files 和 agent context 可以留在本地网络;官方文件则说节点通过配对建立信任、以 mutual TLS 保护节点之间的路由,并提醒方便配对用的 PIN 不是强身份验证。换句话说,本地不等于自动安全:网络分段、节点清单、模型来源、操作系统权限和谁可以加入 cluster 都要有清晰规则。

对于企业或小型团队来说,PAIR 最实际的价值不一定是追求 benchmark,而是提高本地工作流的可用性。低敏感度的文件整理、代码草稿、数据分类和搜索可以先在内网并行;高敏感度数据则要确定每个节点的磁盘、日志、模型和更新状态都符合相同政策。还要记录路由到哪一台机器,方便查错、成本估算和重现输出。

NVIDIA PAIR 的讯号,是个人和企业的 local AI 正从「在一台 PC 上跑一个模型」走向「把多台现有设备编排成一个小型 inference fleet」。它降低了使用闲置硬件的门槛,但同时把 distributed systems 的问题带到 Agent 身上:节点是否可信、模型是否一致、工作是否可恢复,以及数据是否真的只留在应有的边界。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。