
一篇于 2026 年 8 月 18 日上传至 arXiv 的研究,发布 Agent Lightning v1.0,并把 Agent harness 放到 agentic reinforcement learning 的核心位置。现代 Agent 的 harness 负责管理 tools、context 和 control flow;研究团队认为,如果训练阶段忽略这一层,模型在实际 workflow 里怎样与环境互动,就未必能在 post-training 中被正确学习。
Agent Lightning 的原始方向,是通过 LLM endpoint proxy,把不同 Agent 接到 RL training。v1.0 把这类方法称为 harnessed agentic RL:deploy-time harness 拥有 environment interaction loop,trainer 只观察一连串 LLM request-response pairs。这与传统由 training engine 控制环境互动的 agentic RL 不同,也把真实的工具调用、上下文注入和控制流程带回训练问题。
这种架构带来几个实现难题,包括 retokenization、sample merging、advantage calculation、loss normalization 和 backend scheduling。它们未必会出现在普通聊天模型训练里,但对 search agent、coding agent 或多工具 workflow 会直接影响训练稳定性和效果。换句话说,Agent 的学习单位不只是 prompt 和 answer,也包括 harness 如何安排与环境的互动。
研究把 Agent Lightning v1.0 描述为一个约 3,500 行的轻量 framework,支持 arbitrary agent harnesses,并提供 instruction-following、search 和 coding agents 的评估。作者也发布完整的 coding-agent RL workflow 和 training scripts,目标是让其他研究者可以复现这类以 harness 为中心的训练实验。
摘要报告,在只使用 6K training examples 和 modest compute 的条件下,RL 将 Qwen3.5-9B 在 SWE-bench Verified 的结果由 41.8% 提升至 56.4%,即绝对提升 14.6 个百分点。这是论文作者在指定 pipeline、数据和 benchmark 上的结果;它不表示相同幅度会在其他模型、harness 或 coding tasks 重现,也需要进一步检查完整实验和独立 replication。
这项工作对企业 workflow 的启示,是部署和训练不应完全分离。如果生产 Agent 的 harness 会改写 context、安排 tools、切换 subagent 或处理失败,那么这些控制行为就是学习环境的一部分。团队应保存可复现的 trajectory、工具结果和版本信息,否则即使模型分数上升,也很难知道提升来自模型能力、prompt 改写、工具选择还是 harness 调度。
Agent Lightning v1.0 仍然是 arXiv preprint,不能直接当成成熟生产方案。不过,它把一个常被忽略的问题说得很清楚:Agent 的效果由模型和 harness 一起决定。当企业要训练或评估长流程 Agent 时,真正需要版本化和测试的,不只是 model checkpoint,还有整个执行环境。



