ARTICLE · 人工智能
ICML 2026 | 一步错不再全盘输,浙大 BEACON 让长程 Agent 成功率近翻倍
一语总结浙大与百度提出 BEACON 框架,通过里程碑引导的信用分配解决长程 Agent 强化学习中信用误分配与样本利用率低的问题,ALFWorld 长程任务成功率从 53.5% 提升至 92.9%。
本文解读 ICML 2026 论文《Milestone-Guided Policy Learning for Long-Horizon Language Agents》,介绍浙江大学与百度联合提出的 BEACON 框架。文章首先指出长程 Agent 训练中 GRPO 等主流方法面临的两个核心问题:信用误分配(前 20 步正确、第 25 步出错导致整条轨迹被判负)和样本利用率低(失败轨迹优势函数归零)。BEACON 的核心思路是利用任务本身的组合结构,在里程碑处切分轨迹,通过段内时间衰减奖励和双尺度优势估计(轨迹级 + 段级)实现更精细的信用分配。实验显示,在 ALFWorld 长程任务上成功率从 53.5% 提升至 92.9%,有效样本利用率从 23.7% 提升至 82.0%,且领先幅度随任务长度单调扩大。消融实验排除了里程碑模仿的嫌疑,收益明确来自策略优化本身。
- 长程 Agent 训练中 GRPO 的稀疏终局奖励导致信用误分配和样本浪费。
前 20 步正确、第 25 步出错时,整条轨迹共享同一负优势值,正确动作也被惩罚;全部失败的 rollout 组内奖励方差为零,优势函数归零,样本完全浪费。
- BEACON 利用任务组合结构,在里程碑处切分轨迹并施加段内时间衰减奖励。
里程碑由环境指示函数判定,无需额外训练模型;段内动作按距里程碑的距离获得递减的正向信用,部分成功不再被浪费。
- 双尺度优势估计将全局任务表现与局部动作质量分离。
轨迹级优势沿用 GRPO 把握全局,段级优势仅在到达同一里程碑的轨迹间比较,避免后续段落波动干扰前面动作评估,两者线性组合。
- 消融实验证明收益来自策略优化而非里程碑模仿。
直接用 oracle 轨迹做 SFT 仅达 43%,而 BEACON 达 91.4%;信用集中度最低但性能最好,说明渐进式梯度信用比激进奖励更有效。
ICML 2026 | 一步错不再全盘输,浙大 BEACON 让长程 Agent 成功率近翻倍
本文解读 ICML 2026 论文《Milestone-Guided Policy Learning for Long-Horizon Language Agents》,介绍浙江大学与百度联合提出的 BEACON 框架。文章首先指出长程 Agent 训练中 GRPO 等主流方法面临的两个核心问题:信用误分配(前 20 步正确、第 25 步出错导致整条轨迹被判负)和样本利用率低(失败轨迹优势函数归零)。BEACON 的核心思路是利用任务本身的组合结构,在里程碑处切分轨迹,通过段内时间衰减奖励和双尺度优势估计(轨迹级 + 段级)实现更精细的信用分配。实验显示,在 ALFWorld 长程任务上成功率从 53.5% 提升至 92.9%,有效样本利用率从 23.7% 提升至 82.0%,且领先幅度随任务长度单调扩大。消融实验排除了里程碑模仿的嫌疑,收益明确来自策略优化本身。
文章金句
"模型最需要学习信号的地方,恰恰是信号最少的地方。
"任务有结构,信用分配就应该利用这个结构。
"保留渐进式的梯度信用,比激进地只奖励里程碑动作更有效。