
NVIDIA 在 2026 年 9 月 3 日公布 Personal AI Router(PAIR),把本地 Agent 的瓶颈由「一台电脑够不够快」改成「几台现有电脑能否一起处理独立工作」。PAIR 是免费的 open-source software,会把兼容设备连成一个本地 inference 入口,再按节点状态、模型和引擎,把每个独立请求分派到合适的机器。
它针对的是多 Agent 或多 subtask 工作。当一个 Agent 把研究、文件整理、代码检查或个人管理拆成多个独立任务时,所有请求如果都挤在同一个 GPU,并行反而会变成等待。PAIR 不会把多张 GPU 合并成一张更大的虚拟 GPU,也不会把同一个 request 切开;它是把不同 job 路由到不同节点,让已有的模型和硬件可以并行工作。
NVIDIA 表示,PAIR 可以和 Ollama 及 LM Studio 一起使用,不要求 Agent harness 重新设计;应用仍指向本地 endpoint,由路由器决定实际服务请求的节点。官方技术文章还展示五个 subagent 的比较:三台设备的 PAIR cluster 完成示范工作的时间为 8 分 48 秒,单一 RTX Spark laptop 则为 18 分钟。这是 NVIDIA 的示范数据,不能直接推论到所有模型、网络和任务。
PAIR beta 支持 Windows、macOS 和 Linux,硬件范围包括 GeForce RTX 20 系列或更新、RTX PRO workstation、DGX Spark,以及 Apple M4 或更新的 Apple Silicon。这个组合很有意思:本地 Agent 的计算层不再一定由同一品牌或同一操作系统组成,而是由家庭或办公室现有的不同节点提供并行容量。
隐私是本地 inference 的主要卖点。NVIDIA 表示 prompts、files 和 agent context 可以留在本地网络;官方文件则说节点通过配对建立信任、以 mutual TLS 保护节点之间的路由,并提醒方便配对用的 PIN 不是强身份验证。换句话说,本地不等于自动安全:网络分段、节点清单、模型来源、操作系统权限和谁可以加入 cluster 都要有清晰规则。
对于企业或小型团队来说,PAIR 最实际的价值不一定是追求 benchmark,而是提高本地工作流的可用性。低敏感度的文件整理、代码草稿、数据分类和搜索可以先在内网并行;高敏感度数据则要确定每个节点的磁盘、日志、模型和更新状态都符合相同政策。还要记录路由到哪一台机器,方便查错、成本估算和重现输出。
NVIDIA PAIR 的讯号,是个人和企业的 local AI 正从「在一台 PC 上跑一个模型」走向「把多台现有设备编排成一个小型 inference fleet」。它降低了使用闲置硬件的门槛,但同时把 distributed systems 的问题带到 Agent 身上:节点是否可信、模型是否一致、工作是否可恢复,以及数据是否真的只留在应有的边界。



