
一篇於 2026 年 8 月 18 日上載至 arXiv 的研究,發布 Agent Lightning v1.0,並把 Agent harness 放到 agentic reinforcement learning 的核心位置。現代 Agent 的 harness 負責管理 tools、context 和 control flow;研究團隊認為,如果訓練階段忽略這一層,模型在實際 workflow 裏怎樣與環境互動,就未必能在 post-training 中被正確學習。
Agent Lightning 的原始方向,是透過 LLM endpoint proxy,把不同 Agent 接到 RL training。v1.0 把這類方法稱為 harnessed agentic RL:deploy-time harness 擁有 environment interaction loop,trainer 只觀察一連串 LLM request-response pairs。這與傳統由 training engine 控制環境互動的 agentic RL 不同,亦把真正的工具調用、上下文注入和控制流程帶回訓練問題。
這種架構帶來幾個實作難題,包括 retokenization、sample merging、advantage calculation、loss normalization 和 backend scheduling。它們未必會出現在普通聊天模型訓練裏,但對 search agent、coding agent 或多工具 workflow 會直接影響訓練穩定性和效果。換句話說,Agent 的學習單位不只是 prompt 和 answer,也包括 harness 如何安排與環境的互動。
研究把 Agent Lightning v1.0 描述為一個約 3,500 行的輕量 framework,支援 arbitrary agent harnesses,並提供 instruction-following、search 和 coding agents 的評估。作者也發布完整的 coding-agent RL workflow 和 training scripts,目標是讓其他研究者可以重現這類以 harness 為中心的訓練實驗。
摘要報告,在只使用 6K training examples 和 modest compute 的條件下,RL 將 Qwen3.5-9B 在 SWE-bench Verified 的結果由 41.8% 提升至 56.4%,即絕對提升 14.6 個百分點。這是論文作者在指定 pipeline、資料和 benchmark 上的結果;它不表示相同幅度會在其他模型、harness 或 coding tasks 重現,也需要進一步檢查完整實驗和獨立 replication。
這項工作對企業 workflow 的啟示,是部署和訓練不應完全分離。若生產 Agent 的 harness 會改寫 context、安排 tools、切換 subagent 或處理失敗,那些控制行為就是學習環境的一部分。團隊應保存可重現的 trajectory、工具結果和版本資訊,否則即使模型分數上升,也很難知道提升來自模型能力、prompt 改寫、工具選擇還是 harness 調度。
Agent Lightning v1.0 仍然是 arXiv preprint,不能直接當成成熟生產方案。不過,它把一個常被忽略的問題說得很清楚:Agent 的效果由模型和 harness 一起決定。當企業要訓練或評估長流程 Agent 時,真正需要版本化和測試的,不只是 model checkpoint,還有整個執行環境。



