
NVIDIA 在 2026 年 8 月 11 日公布 Nemotron 3.5 Lightning 及 NeMo Switchyard,將焦點放在多智能體系統中兩個相互關聯的問題:如何用較小、較快的模型處理大量重複工作,以及如何在不重寫應用程式的情況下為每一個請求選擇合適的模型。
Nemotron 3.5 Lightning 是一個 30B 參數的 mixture-of-experts 模型。NVIDIA 將它定位為大型多智能體系統內負責專門任務的模型,例如持續運行的工具呼叫、資料整理或其他高數量 agent 工作。官方表示,在 PinchBench 的比較中,Lightning 的輸出速度最高可達同級模型的 4 倍,agent 任務完成速度最高快 30%。這些是 NVIDIA 公布的 benchmark 結果,採用前仍要用自己的工具鏈和任務集重測。
模型可以用 NVIDIA NeMo 以領域資料、工具和工作流程作 post-training。NVIDIA 亦表示會按授權條件公開訓練資料和方法,並發布 Nemotron-RL-Agentic-Terminal-Pivot 資料集,用於 coding agent 的後訓練。這種可調整性對企業有吸引力,但同時代表團隊要負責資料品質、權限邊界和模型更新的維護成本。
NeMo Switchyard 則是開源的 smart model routing library,面向常用的 agent 工具。它可以把請求路由到開放模型、專有模型或 NVIDIA 模型,並按品質、延遲和成本調節路由策略。若路由層與應用程式解耦,團隊便可以逐步加入較快的專門模型,而不必為每次模型切換改寫整個 agent workflow。
NVIDIA 自己的 benchmark 表示,Switchyard 在維持接近 frontier-level accuracy 的同時,把任務完成成本降至單獨使用 Opus 4.8 的接近三分之一。這是供應商的內部測試說法,不能直接視為跨環境的成本保證。路由效果會受 prompt、工具失敗率、上下文長度、快取、fallback 規則和每個模型的計費方式影響。
這次發布的實際訊號,是 agent 架構開始把「模型選擇」當作 runtime control plane,而不是一次性的 provider 設定。簡單分類或高量任務可以交給較快模型,只有需要複雜推理的步驟才升級到較昂貴模型。要令這種分工可管理,系統仍然需要記錄每次路由原因、模型版本、工具結果、成本和失敗後的 fallback。
NVIDIA 表示 Nemotron 3.5 Lightning 可以部署在 RTX PC、DGX Spark、DGX Station、Jetson、RTX PRO、資料中心和雲端等環境。這給本地、邊緣和雲端混合部署更多選擇,但不會自動解決硬件驅動、量化、模型安全掃描、提示注入或資料外洩問題。把小模型放在較接近資料的位置,仍要配合最小權限和可審計的工具介面。
如果團隊考慮採用,較穩妥的起點是先把任務按成功率、延遲、成本和敏感度分組,再對每一組設置可回退的 routing policy。供應商 benchmark 可以用作候選訊號,但 production gate 應由自己的 trace、固定回歸集和人工抽查決定。



