微软研究院发布 Agent Lightning v1.0:约 3500 行代码的轻量级智能体强化学习框架
微软研究院发布 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署中使用的 agent harness 直接参与强化学习训练,无需在训练框架内重新实现 agent。
推荐理由:把部署侧 agent harness 直接接入 RL 训练,并用 Qwen3.5-9B 给出可复现的 SWE-bench Verified 提升结果,适合评估智能体训练链路复用方式。