如何让交互式 Agent 能像人类一样学会“事后复盘”,更好地处理长程任务?

如今,强化学习(RL)已经成为重要的后训练范式。然而,在长程 Agentic 学习中,基于结果的 RL 仍存在监督缺口

失败轨迹可能包含有用行为,一条成功轨迹也可能包含可复用策略,但基于结果的强化学习只能判断任务成败,难以指出哪些中间观察、动作或工具调用应该被强化。

针对这个问题,清华大学清华大学自动化系常聘教授陶建华团队及其合作者提出了“自进化同策略框架”(SElf-Evolving On-Policy Distillation,SEED),将已完成的同策略轨迹转化为训练时的事后(hindsight)技能,并将这些技能的行为效果蒸馏回策略模型中。

论文链接:https://arxiv.org/abs/2607.14777

结果显示,基于文本和基于视觉的智能体任务上的大量实验表明,SEED 能够持续提升性能和样本效率,并展现出对未见场景的鲁棒泛化能力

图|整体性能概览。

研究团队表示,SEED 只使用已学习到的策略,在推理时无需外部记忆或额外提示,也能保留可复用的行为经验。

SEED:自进化同策略框架

SEED 是一个自进化 OPD 框架,它会把当前策略完成的任务轨迹总结为后见技能,并将这些 skills 的行为指导蒸馏回策略模型。由此形成的训练信号有三个特点:它来自当前策略的轨迹,能够细化到单个决策词token,并会随着策略更新一起进化。

具体而言,SEED 有两个训练阶段

1.后见技能监督微调(hindsight skillSFT):研究团队先收集基础策略的交互轨迹,再由外部分析器将完整轨迹总结为后见技能。成功轨迹对应可复用策略或工作流,失败轨迹对应纠正或规避规则。随后,这些轨迹-技能对被用于微调模型,使其具备轨迹分析能力,并初始化后续的 RL actor 和轨迹分析器。

2.自进化同策略蒸馏(self-evolving on-policy distillation):在强化学习过程中,当前的策略模型既采样任务轨迹,也作为分析器从这些轨迹中提取可复用的后见技能。随后,SEED 会比较模型在有无后见技能时,对同一批动作的判断变化,并把这种变化转化为 OPD 训练信号,与 GRPO 一起优化。通过反复执行“收集轨迹、分析技能、重新评分、蒸馏更新”的循环,SEED 会在多轮训练中将这些后见技能蒸馏回策略。

图|SEED 概览。

更高性能、更强泛化

研究团队在具身交互、网页导航和搜索问答三类长程任务上评估了 SEED。整体来看,SEED在所有基准上的表现均显著优于基于结果的强化学习和静态蒸馏方法,并展现出了更高的样本效率和更强的泛化能力。具体结果如下:

1. 基准测试表现

SEED 通过密集监督优于仅基于结果的 RL,并在长程 Agent 任务上表现出更强性能。相比 GRPO,SEED在三个基准上均稳定提升,ALFWorld 上可提升 45.9 个百分点。密集的 token 级后见监督可以改进仅依赖终端奖励的强化学习。

内化技能优于比上下文提示。相比于 Skill-Prompt,SEED 在推理时无需额外技能提示,也能取得更好表现。

自进化后见蒸馏优于静态自蒸馏。相比 OPSD、Skill-SD 等方法,SEED 整体表现更强,尤其在 ALFWorld 上优势明显。这说明,动态更新后的后见监督更有效,也更能适应训练中出现的轨迹和失败模式。

图|在 ALFWorld、Search-based QA 和 WebShop代表性长程基准上的性能比较。

2. 训练动态与样本效率

SEED 在训练动态和样本效率上都优于 GRPO。以 ALFWorld 为例,训练早期 SEED 的成功率就明显领先,平均回合长度也下降更快,体现出更高的任务执行效率。

图|ALFWorld 上的训练动态。

SEED 能从完成轨迹中提取更有信息量的监督。在数据使用上,SEED 只使用 60% 训练数据,表现就超过了使用完整数据训练的 GRPO。

图|ALFWorld 上的训练动态。

3.跨领域泛化能力与多模态扩展

SEED 在未见任务环境中展现出较强泛化能力。在 ALFWorld 未见任务集上,研究团队使用 Qwen2.5-3B-Instruct 训练得到的模型版本进行评估。结果显示,SEED 将宏平均成功率从 70.9% 提高到 86.2%,并在大多数任务族上超过 GRPO。研究团队让 Agent 执行加热物体、查看物体和拾取物体等任务时,SEED 的提升最明显。

图|ALFWorld Unseen 上的跨领域泛化能力。

SEED 的能力也适用于纯文本交互之外的视觉任务。研究团队在 Sokoban 和 EZPoints 两个视觉 Agent 基准上评估 Qwen2.5-VL-3B-Instruct。结果显示,SEED 在两个任务上都优于GRPO,平均成功率从 77.0% 提高到 91.0%。SEED 可以将多模态轨迹转化为有效的后见监督,且评估时不需要额外 skill 提示。

图|基于视觉的智能体基准上的结果。

4. 消融分析

SEED 的性能提升依赖初始轨迹分析能力、训练中的持续蒸馏,以及来自当前策略轨迹。为了验证各组件作用,研究团队在 ALFWorld 上进行消融实验。结果显示,去掉后见技能 SFT 或自进化 OPD 都会降低性能;其中使用静态技能库替代策略自身生成的技能时,性能退化最明显。

图|消融实验结果。

不足和未来发展

研究团队指出,尽管 SEED 在具身交互、网页导航和搜索问答等任务中表现较为稳定,但它仍然存在不足。

研究团队指出,SEED 在更复杂任务中的表现仍有待验证。DeepPlanning、OdysseyArena 等基准包含更长的工作流,最终成功信号也更为稀疏。因此,未来还需要在这类环境中进一步测试其在长上下文和复杂任务中的有效性。

同时,自进化机制也有一定风险。行动器和分析器使用的是同一套策略,因此如果模型在执行时犯错,可能会把无效做法总结成可复用经验,并在更新中继续强化。未来的改进方向包括将技能更新更多建立在可验证的状态变化之上,或引入不确定性感知机制,以筛选出更可靠的指导信息。

此外,研究团队指出,训练成本也可能随任务复杂度上升而增加。SEED 虽然不会带来额外的部署开销,但在训练阶段仍需要分析轨迹,并进行成对评分,可以在未来的工作中通过只分析关键轨迹、批量完成评分等方式,进一步降低训练成本。

更多技术细节,详见原论文。

最新快讯

2026年09月21日

20:41
鼓狮财经9月21日电,一份证券交易所文件显示,印度石油公司已批准投资约245亿卢比(2.56亿美元)建设一条天然气管道。作为该项目的一部分,该公司将负责建设并运营这条从科钦至图图库迪的天然气管道。该管道系统输气能力为每日684万标准立方米。
20:41
《科创板日报》9月21日讯(记者 黄心怡)近日,中国移动与高通成功完成了全球首个符合3GPP定义的U6G频段6G原型基站与终端原型的对接测试,标志着6G关键技术从研究迈入系统化验证的新阶段。 政策层面,中国工信部在9月印发的《信息通信行业发展“十五五”规划》中,明确将“研制6G智能手机”列为增强产业链韧性的具体任务,并要求基于开源鸿蒙等系统,研发支持智能体通...
20:40
鼓狮财经9月21日讯国际机器人联合会(IFR)统计指出,去年全球共销售约7000台人形机器人,用于工业和专业服务领域,但许多人形机器人并未从事生产性工作。 IFR表示,人形机器人要么被送往研究机构,要么被送往一些公司,用于生成数据以训练人工智能模型。其中,汽车制造商作为早期采用者,正在其工厂中开展小规模的机器人试点项目,机器人数量通常只有个位数或者两位数。 ...
20:33
硅谷巨头集体呼吁给AI踩刹车,不少人第 一反应be like:这不纯纯营销手段,信你我就输了(毕竟谁家好人一边喊停一边狂卷更强模型)。但有没有一种可能:他们真的看到了最前沿AI的超 强破坏力,只是没有公开?华为轮值董事长徐直军最近公开说的一句话,也提供了一个耐人寻味的视角:美国头部AI公司拥有巨量算力,可能只有它们自己知道模型能力究竟发展到...
20:33
OpenAI最有钱的人,不是奥特曼。本周,Forbes公布2026年Forbes 400美国富豪榜。OpenAI联创兼总裁Greg Brockman首次上榜,身家约255亿美元,排名全美第45。他是今年身家最高的新人。排在他前面的,是耐克联合创始人Phil Knight;排在他身后的,是传媒大亨默多克。而他的老板,OpenAI的CEO奥特曼...
20:33
AI产业链上的公司,正在为关键人才开出越来越高的价码。智谱2025年营收7.24亿元,归母净利润亏损46.98亿元,但董事长刘德兵的年度酬金合计1.57亿元,其中股份支付高达1.56亿元。寒武纪2026年限制性股票激励计划草案显示,公司向945名员工授予500万股限制性股票,以2025年末公司1107名员工总数计算,覆盖比例达85.37%。...
20:33
刚刚,「ChatGPT 知道你在别的网站买了什么」这事,被人坐实了。就在昨天,独立研究者 Buchodi 放出一份第 一手调查,在 Hacker News 直接冲上 573 分、308 条评论。他拿自己的安卓手机做实验,把手机跟各个网站之间悄悄传来传去的数据全截了下来,还换了一种方法再截一遍,两边对上了。而且不是看了一两天。Buchodi ...
20:33
Claude 这回直接发布Opus 5.5!不光跳过5.1,连刚有影的5.2也跳过了。GPT-6给的压力有这么大吗?最新爆料:能力上,胜过GPT-6-Sol,所以配得上版本号+0.5。价格上,打8折。发布时间,就在周二。这是有灰测权限的人发出来的新版Opus自制小动画,一次成功。注意了,它表面上是一个93秒的视频,实际背后100%...
20:33
前段时间,我刷到一篇文章说,在AI的冲击下,字幕组要死透了。文章里写了版权、官方字幕和AI给字幕组的生存空间带来的挤压,读完之后我开始好奇一个问题。当观众打开视频,一键AI就能直接配好中文字幕,打开漫画,AI也能直接翻译图片,那些做汉化的字幕组、漫画组,会怎么看待这件事?于是,我陆陆续续找了一些做汉化的朋友聊了聊,做字幕和漫画汉化的都有。我...
20:33
黄仁勋对“AI减速”的反对,比先前放出的采访片段更加尖锐。前几天,CBS提前释出的专访片段已经亮明了他的态度。面对是否应该放慢AI发展的提问,黄仁勋回答:“不管别人怎么做,我们都应该尽可能快地前进。”这句话,直接回应了近期硅谷不断升温的减速呼声。这轮争论中,提出减速的,恰恰是站在AI研发最前沿的人。Anthropic CEO达里奥·阿莫迪本...
20:33
让人担心的事情,还是发生了。随着我们越来越习惯把问题交给 AI,聊天记录、工作内容、兴趣偏好,甚至一些原本只属于自己的细节,也在不断进入模型的视野。但更坏的是,开发者已经实锤,OpenAI 还可能通过一些不那么显眼的方式,获取你在其他网站上的浏览行为。也就是说,即使你没有在 ChatGPT 里说出口,你在网页上的一些动作,也在成为它了解你的...
20:33
最近大火的 Jev 模型正式公开可用了,还送起步额度。一大早,Jev 公司 TypeSafe AI 发布官方公告,Jev 现已向所有人开放,无需候补名单。他们还补充说:所有用户初始都有 5 美元额度,大约相当于 1.2 亿 token。体验链接:https://console.typesafe.ai/login过去几天,Jev 在社交平台引...