
NVIDIA 在 2026 年 9 月 3 日公布 Personal AI Router(PAIR),把本地 Agent 的瓶頸由「一部電腦夠不夠快」改成「幾部現有電腦能否一起處理獨立工作」。PAIR 是免費的 open-source software,會把兼容裝置連成一個本地 inference 入口,再按節點狀態、模型和引擎,把每個獨立請求分派到合適的機器。
它針對的是多 Agent 或多 subtask 工作。當一個 Agent 把研究、文件整理、程式檢查或個人管理拆成多個獨立任務時,所有請求若都擠在同一個 GPU,並行反而會變成等待。PAIR 不會把多張 GPU 合併成一張更大的虛擬 GPU,也不會把同一個 request 切開;它是把不同 job 路由到不同節點,讓已有的模型和硬件可以平行工作。
NVIDIA 表示,PAIR 可以和 Ollama 及 LM Studio 一起使用,不要求 Agent harness 重新設計;應用仍指向本地 endpoint,由路由器決定實際服務請求的節點。官方技術文章還展示五個 subagent 的比較:三部裝置的 PAIR cluster 完成示範工作的時間為 8 分 48 秒,單一 RTX Spark laptop 則為 18 分鐘。這是 NVIDIA 的示範數據,不能直接推論到所有模型、網絡和任務。
PAIR beta 支援 Windows、macOS 和 Linux,硬件範圍包括 GeForce RTX 20 系列或更新、RTX PRO workstation、DGX Spark,以及 Apple M4 或更新的 Apple Silicon。這個組合很有意思:本地 Agent 的計算層不再一定由同一品牌或同一作業系統組成,而是由家庭或辦公室現有的不同節點提供平行容量。
私隱是本地 inference 的主要賣點。NVIDIA 表示 prompts、files 和 agent context 可以留在本地網絡;官方文件則說節點透過配對建立信任、以 mutual TLS 保護節點之間的路由,並提醒方便配對用的 PIN 不是強身份驗證。換句話說,本地不等於自動安全:網絡分段、節點清單、模型來源、作業系統權限和誰可以加入 cluster 都要有清晰規則。
對企業或小型團隊而言,PAIR 最實際的價值不一定是追求 benchmark,而是提高本地工作流的可用性。低敏感度的文件整理、程式草稿、資料分類和搜尋可以先在內網並行;高敏感度資料則要確定每個節點的磁碟、日誌、模型和更新狀態都符合相同政策。還要記錄路由到哪一部機器,方便查錯、成本估算和重現輸出。
NVIDIA PAIR 的訊號,是個人和企業的 local AI 正從「在一部 PC 上跑一個模型」走向「把多部現有設備編排成一個小型 inference fleet」。它降低了使用閒置硬件的門檻,但同時把 distributed systems 的問題帶到 Agent 身上:節點是否可信、模型是否一致、工作是否可恢復,以及資料是否真的只留在應有的邊界。



