
NVIDIA 於 2026 年 7 月 17 日發布文章,將 Agentic AI 的後訓練描述為一個持續運行的循環,而不是模型完成預訓練後的一次性收尾工作。原因是 Agent 會在不同 codebase、政策、工具和生產環境中運作,新的 edge case 會不斷出現,模型也要因應這些經驗更新。
文章把 Agentic AI 和一般問答模型作對比:Agent 要接受一個目標,再規劃步驟、使用工具和處理中途錯誤。後訓練因此需要大量 rollout environment,讓模型嘗試、接受 reward 評分,再更新權重。NVIDIA 形容,這個循環的計算量增加,不一定是因為每次訓練更大,而是因為生產問題會不斷回到訓練流程。
NVIDIA 同時介紹 NeMo Gym 和 NeMo RL。前者提供訓練環境,後者支援分散式 post-training,目標是把以往為單一研究項目寫的流程,變成可以重複運行的基礎設施。這裡的難點不只是 GPU 數量,而是要同時協調數千個 environment、驗證 reward,以及把更新後的權重有效率地送回推理系統。
在指標方面,NVIDIA 把 cost per token 和 intelligence per dollar 分開。前者量度服務一百萬個 token 的總成本,後者則問:建立一個值得部署、而且能夠隨環境變化持續保持能力的模型,需要投入多少成本。兩者並不互相取代;較低的 token 成本可以令更多後訓練循環變得可行,而更好的模型能力亦會提高每個 token 的價值。
文章稱,Vera Rubin 平台可以用 Blackwell 世代四分之一的 GPU 訓練最大的模型,並舉出 Nemotron 3 Ultra 的 71.7% SWE-bench Verified 結果,以及 Prime Intellect 在 Vera CPU 上平均高 30% 的 throughput。這些是 NVIDIA 在自家文章和合作方案例中公布的數字,應先視為供應商和合作方聲稱,實際選型仍需要按相同 workload、能源、軟件棧和總成本重新比較。
對企業 Agent 系統而言,值得借鑑的不是某一個硬件數字,而是把後訓練、推理、評估和生產監控看成同一條閉環。若只看一次 benchmark 或一次 inference cost,可能會忽略 Agent 在長時間運行後的失誤、工具變更和回歸問題。能夠記錄 rollout、驗證結果和更新理由,才有可能知道每一次能力提升是否值得它的計算成本。



