多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
这正是多轮语言智能体强化学习中的时间信用分配难题:终点奖励告诉模型“这条轨迹最后对不对”,却没有告诉它“中间哪一步值得被强化”。
当前的主流方案是让同一个模型在训练时阅读任务相关的程序性技能,再回头给无技能轨迹中的token打分。但教师的高置信度并不等于这一步真的对任务有帮助:它可能只是更偏好某种句式、格式或语言表达。
针对这个问题,来自中国科学技术大学与阿里巴巴集团的研究团队提出ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping),把训练期的特权技能转化为与回报相关的token级信用,并直接接入原生的reward-to-advantage-to-policy路径。
问题:终点奖励为什么不够
在ALFWorld中,智能体要先找到正确房间,再拿起物体、改变状态并完成放置;在WebShop中,它要搜索商品、检查属性、保留用户约束并完成购买。只看最后的成功标签,无法区分一条轨迹里的关键动作和无关的语言填充。
ADRS把挑战拆成三点:教师分数不能直接跨交互步骤比较,不同步骤的上下文长度和模型不确定性使原始log概率的偏移与尺度都在变化;教师置信度不一定是有用的置信度,一个token被高度偏好可能只是因为语言上常见;独立的蒸馏损失可能绕开GRPO/GiGPO正在构造的组相对advantage。
ADRS如何工作:三层信用构造
ADRS是位于轨迹采样和actor更新之间的信用构造层,不改变底层RL算法,也不把技能文本带到推理阶段。每轮训练分三步:无技能采样——行为策略在不读取技能的情况下生成多轮轨迹;训练期重评分——固定同一策略快照,对已生成token分别用普通上下文和带任务匹配技能的上下文重评分,技能只在训练期出现,rollout与推理都保持skill-free;构造并注入信用——教师信号经校准和可靠性门控后加到基础token reward上,交给原有的advantage算子更新策略。
具体分三层:
*层在每个交互步骤内对教师分数做中心化和尺度归一化,保留“当前步骤里哪些token相对更受教师支持”的相对证据,而不是相信跨步骤的原始*值。
第二层是TVA(Teacher Value Advantage)门控,根据同一比较组内“教师置信度—实际回报”的关联调节信号强度:教师更偏好的token确实出现在更高回报的轨迹中,指导才会被放行;关联弱时,教师信号不会默认成为任务信用。
第三层不再另开一条独立的蒸馏反向传播支路,而是把门控后的token信号在advantage构造之前注入,与环境奖励共同进入策略更新。
△ADRS完整框架,三个模块分别回答“教师偏好什么”“何时与回报相关”“如何进入策略更新”。
主结果:关键决策得到更强信用
论文在ALFWorld、WebShop和搜索式QA三类环境上评估,覆盖Qwen2.5-3B/7B和Qwen3-1.7B。150-step共同预算下,3B模型的ALFWorld成功率达到94.5%,较最强基线提升10.1个百分点;WebShop的Score/Success为87.5/76.6;7B上ALFWorld达到96.1%。重要的是,rollout和推理都不读取技能,提升全部来自训练期对token信用的重新构造。
△ADRS与SDAR在ALFWorld上的300-step训练动态。
消融上,GiGPO82.8%→ADRS(无TVA)87.5%→ADRS+TVA89.8%,TVA在token级特权信用之外再带来2.3个百分点,说明“教师偏好”与“教师偏好是否和回报相关”并不是同一个问题。token诊断显示,训练到150步时action与style token的更新幅度比达到95.3——ADRS不是平均地强化整段回答,而是把更新对准真正决定执行结果的动作和对象。数据效率上,使用60%训练数据即超过全量GRPO;在未见任务上平均高出11.9个百分点;*交互步数增至50时,成功率为94.5%对84.4%,交互链路越长优势越明显。
△GiGPO、ADRS(无TVA)和ADRS-TVA的成功率对比。
方法的边界同样清楚:TVA使用的是batch内的统计关联而非因果归因;效果依赖底层advantage算子是否保留token级差异;重评分也带来训练期的额外前向计算。但方向已经清晰:当多轮智能体面对的不是一步到位的答案,而是一连串会产生延迟后果的决策时,真正重要的不是“这条轨迹最后成功了”,而是——成功之前,究竟是哪一个token做对了关键选择。
论文标题:Agentic Reinforcement Learning with Self-Distilled Reward Shaping
作者:Ranxu Zhang、Guinan Chen、Shaodong Chen、Jinghao Lin、Xiaozhou Xu、Zhe Sun、Yanyong Zhang、Chao Wang等
论文链接:https://arxiv.org/abs/2608.03223
