
NVIDIA 于 2026 年 7 月 17 日发布文章,将 Agentic AI 的后训练描述为一个持续运行的循环,而不是模型完成预训练后的一次性收尾工作。原因是 Agent 会在不同 codebase、政策、工具和生产环境中运行,新的 edge case 会不断出现,模型也要根据这些经验更新。
文章把 Agentic AI 和一般问答模型作对比:Agent 要接受一个目标,再规划步骤、使用工具和处理途中错误。后训练因此需要大量 rollout environment,让模型尝试、接受 reward 评分,再更新权重。NVIDIA 形容,这个循环的计算量增加,不一定是因为每次训练更大,而是因为生产问题会不断回到训练流程。
NVIDIA 同时介绍 NeMo Gym 和 NeMo RL。前者提供训练环境,后者支持分布式 post-training,目标是把过去为单个研究项目编写的流程,变成可以重复运行的基础设施。这里的难点不只是 GPU 数量,而是要同时协调数千个 environment、验证 reward,以及把更新后的权重高效地送回推理系统。
在指标方面,NVIDIA 把 cost per token 和 intelligence per dollar 分开。前者衡量服务一百万个 token 的总成本,后者则问:建立一个值得部署、而且能够随环境变化持续保持能力的模型,需要投入多少成本。两者并不互相取代;更低的 token 成本可以让更多后训练循环变得可行,而更好的模型能力也会提高每个 token 的价值。
文章称,Vera Rubin 平台可以用 Blackwell 世代四分之一的 GPU 训练最大的模型,并举出 Nemotron 3 Ultra 的 71.7% SWE-bench Verified 结果,以及 Prime Intellect 在 Vera CPU 上平均高 30% 的 throughput。这些是 NVIDIA 在自家文章和合作方案例中公布的数字,应先视为供应商和合作方声称,实际选型仍需要按照相同 workload、能源、软件栈和总成本重新比较。
对于企业 Agent 系统来说,值得借鉴的不是某一个硬件数字,而是把后训练、推理、评估和生产监控看成同一条闭环。如果只看一次 benchmark 或一次 inference cost,可能会忽略 Agent 长时间运行后的失误、工具变更和回归问题。能够记录 rollout、验证结果和更新理由,才有可能知道每次能力提升是否值得它的计算成本。



