如何让交互式 Agent 能像人类一样学会“事后复盘”,更好地处理长程任务?
如今,强化学习(RL)已经成为重要的后训练范式。然而,在长程 Agentic 学习中,基于结果的 RL 仍存在监督缺口:
失败轨迹可能包含有用行为,一条成功轨迹也可能包含可复用策略,但基于结果的强化学习只能判断任务成败,难以指出哪些中间观察、动作或工具调用应该被强化。
针对这个问题,清华大学清华大学自动化系常聘教授陶建华团队及其合作者提出了“自进化同策略框架”(SElf-Evolving On-Policy Distillation,SEED),将已完成的同策略轨迹转化为训练时的事后(hindsight)技能,并将这些技能的行为效果蒸馏回策略模型中。
论文链接:https://arxiv.org/abs/2607.14777
结果显示,基于文本和基于视觉的智能体任务上的大量实验表明,SEED 能够持续提升性能和样本效率,并展现出对未见场景的鲁棒泛化能力。
图|整体性能概览。
研究团队表示,SEED 只使用已学习到的策略,在推理时无需外部记忆或额外提示,也能保留可复用的行为经验。
SEED:自进化同策略框架
SEED 是一个自进化 OPD 框架,它会把当前策略完成的任务轨迹总结为后见技能,并将这些 skills 的行为指导蒸馏回策略模型。由此形成的训练信号有三个特点:它来自当前策略的轨迹,能够细化到单个决策词token,并会随着策略更新一起进化。
具体而言,SEED 有两个训练阶段:
1.后见技能监督微调(hindsight skillSFT):研究团队先收集基础策略的交互轨迹,再由外部分析器将完整轨迹总结为后见技能。成功轨迹对应可复用策略或工作流,失败轨迹对应纠正或规避规则。随后,这些轨迹-技能对被用于微调模型,使其具备轨迹分析能力,并初始化后续的 RL actor 和轨迹分析器。
2.自进化同策略蒸馏(self-evolving on-policy distillation):在强化学习过程中,当前的策略模型既采样任务轨迹,也作为分析器从这些轨迹中提取可复用的后见技能。随后,SEED 会比较模型在有无后见技能时,对同一批动作的判断变化,并把这种变化转化为 OPD 训练信号,与 GRPO 一起优化。通过反复执行“收集轨迹、分析技能、重新评分、蒸馏更新”的循环,SEED 会在多轮训练中将这些后见技能蒸馏回策略。
图|SEED 概览。
更高性能、更强泛化
研究团队在具身交互、网页导航和搜索问答三类长程任务上评估了 SEED。整体来看,SEED在所有基准上的表现均显著优于基于结果的强化学习和静态蒸馏方法,并展现出了更高的样本效率和更强的泛化能力。具体结果如下:
1. 基准测试表现
SEED 通过密集监督优于仅基于结果的 RL,并在长程 Agent 任务上表现出更强性能。相比 GRPO,SEED在三个基准上均稳定提升,ALFWorld 上可提升 45.9 个百分点。密集的 token 级后见监督可以改进仅依赖终端奖励的强化学习。
内化技能优于比上下文提示。相比于 Skill-Prompt,SEED 在推理时无需额外技能提示,也能取得更好表现。
自进化后见蒸馏优于静态自蒸馏。相比 OPSD、Skill-SD 等方法,SEED 整体表现更强,尤其在 ALFWorld 上优势明显。这说明,动态更新后的后见监督更有效,也更能适应训练中出现的轨迹和失败模式。
图|在 ALFWorld、Search-based QA 和 WebShop代表性长程基准上的性能比较。
2. 训练动态与样本效率
SEED 在训练动态和样本效率上都优于 GRPO。以 ALFWorld 为例,训练早期 SEED 的成功率就明显领先,平均回合长度也下降更快,体现出更高的任务执行效率。
图|ALFWorld 上的训练动态。
SEED 能从完成轨迹中提取更有信息量的监督。在数据使用上,SEED 只使用 60% 训练数据,表现就超过了使用完整数据训练的 GRPO。
图|ALFWorld 上的训练动态。
3.跨领域泛化能力与多模态扩展
SEED 在未见任务环境中展现出较强泛化能力。在 ALFWorld 未见任务集上,研究团队使用 Qwen2.5-3B-Instruct 训练得到的模型版本进行评估。结果显示,SEED 将宏平均成功率从 70.9% 提高到 86.2%,并在大多数任务族上超过 GRPO。研究团队让 Agent 执行加热物体、查看物体和拾取物体等任务时,SEED 的提升最明显。
图|ALFWorld Unseen 上的跨领域泛化能力。
SEED 的能力也适用于纯文本交互之外的视觉任务。研究团队在 Sokoban 和 EZPoints 两个视觉 Agent 基准上评估 Qwen2.5-VL-3B-Instruct。结果显示,SEED 在两个任务上都优于GRPO,平均成功率从 77.0% 提高到 91.0%。SEED 可以将多模态轨迹转化为有效的后见监督,且评估时不需要额外 skill 提示。
图|基于视觉的智能体基准上的结果。
4. 消融分析
SEED 的性能提升依赖初始轨迹分析能力、训练中的持续蒸馏,以及来自当前策略轨迹。为了验证各组件作用,研究团队在 ALFWorld 上进行消融实验。结果显示,去掉后见技能 SFT 或自进化 OPD 都会降低性能;其中使用静态技能库替代策略自身生成的技能时,性能退化最明显。
图|消融实验结果。
不足和未来发展
研究团队指出,尽管 SEED 在具身交互、网页导航和搜索问答等任务中表现较为稳定,但它仍然存在不足。
研究团队指出,SEED 在更复杂任务中的表现仍有待验证。DeepPlanning、OdysseyArena 等基准包含更长的工作流,最终成功信号也更为稀疏。因此,未来还需要在这类环境中进一步测试其在长上下文和复杂任务中的有效性。
同时,自进化机制也有一定风险。行动器和分析器使用的是同一套策略,因此如果模型在执行时犯错,可能会把无效做法总结成可复用经验,并在更新中继续强化。未来的改进方向包括将技能更新更多建立在可验证的状态变化之上,或引入不确定性感知机制,以筛选出更可靠的指导信息。
此外,研究团队指出,训练成本也可能随任务复杂度上升而增加。SEED 虽然不会带来额外的部署开销,但在训练阶段仍需要分析轨迹,并进行成对评分,可以在未来的工作中通过只分析关键轨迹、批量完成评分等方式,进一步降低训练成本。
更多技术细节,详见原论文。
