
AI research agent 可以提出、实现和评估 machine learning 实验,但真正的瓶颈往往不是写出候选方案,而是跑完每个方案需要数小时甚至数日的 GPU 时间。8 月 14 日提交的 arXiv 论文 AI Research Preference Models,将问题定义成一个执行预算分配问题:在多个候选研究方向中,Agent 应先做哪一个?
研究团队提出 AI Research Preference Models,简称 RPM。RPM 不直接修改 model weights,而是预测哪些候选 solution 最值得执行,避免把所有候选都完整跑一次。论文测试两个版本:inference-only RPM 读取候选计划、代码和过往已执行方案;agentic RPM 则会先做小规模 pilot experiment,再决定是否投入更大预算。
作者把两个版本接入 AIRA-dojo search agent,并以 AIRS-Bench 评估 machine learning research tasks。论文报告平均 normalized score 由未使用 RPM 的 0.684 提升至 0.711 和 0.729;两个 RPM 版本大约用 15 小时便达到 unguided agent 24 小时的表现,使用少于三分之二的 execution budget。作者也表示最佳 RPM 在两个 AIRS-Bench 任务上取得新的 state-of-the-art。这些是单篇预印本的 benchmark 结果,并非通用研究能力证明。
这个方向的重要性在于,它把 Agent 的效率重新放在「选择做什么」而不是「每一步想得多快」。如果一个研究 Agent 可以快速生成大量看似合理的实验,却没有办法预测哪个方案值得真正训练,更多推理只会把等待时间和 GPU 成本推高。RPM 让候选排序、pilot、完整训练和结果评估成为一个可观测的 workflow。
不过,preference model 也会引入新的偏差。它可能偏好容易预测但没有突破性的方案,或因为过往数据分布而错过少见方向;小规模 pilot 的结果也未必代表 full-scale training。研究 Agent 应保留探索配额、随机或多样性抽样、held-out evaluation 和人工研究判断,避免把所有资源只放在模型最有信心的候选。
对于企业内部 AI research workflow,类似设计可以用在数据科学、A/B test 或模型调参:先把候选方案、预期收益、评估成本和失败风险写入 queue,再由 router 决定 pilot、完整执行或暂缓。每个决策都要保存输入、预测、实际结果和后续更新,才可以知道节省的 GPU 时间是否换来更好的研究产出,而不只是少跑几个实验。
AI Research Preference Models 的讯号是,长程 Agent 的下一个竞争层可能是 execution economics。当模型能提出的方案多于系统可以验证的方案时,研究 Agent 需要一个可校准、可反驳和可保留探索的资源分配层。这不是单纯提高模型智力,而是把有限时间、算力和验证机会变成可管理的 workflow。



