检索过往经验是增强 LLM Agent 决策能力的常见手段。面对新任务时,Agent 往往会直接调用历史记忆辅助判断。然而,历史经验只有在适配当前上下文时才具备实用价值。多数现有记忆增强 Agent 将检索到的经验视为静态记录直接注入上下文,很少判断其是否适合当前情境。如果“旧”经验与当前状态不匹配,反而会干扰决策,导致负迁移。相比之下,人类调用记忆更为灵活,通常会结合当前情境重新评估过往经验。受此启发,上海 AI Lab 团队及其合作者提出了“LLM Agent 经验重构”框架 MemHarness。该框架在检索与动作之间引入显式的记忆重构环节,通过 GRPO 端到端学习这一能力,无需人工标注。
MemHarness 的设计理念是模拟人类的“检索、评估和重构”过程。它通过在检索和动作之间插入“批判”与“重构”步骤,将静态记忆转化为具有上下文敏感性的指导信息。具体流程分为三步:首先是检索,根据最近几步的观测和动作判断是否需要历史经验;其次是重构,模型结合任务描述、当前状态、检索记忆及来源状态,比较过去与现在的差异,决定保留、改写或丢弃;最后是动作生成,模型基于重构后的指导生成动作。由于没有现成标注,整个流程依赖任务奖励,通过 GRPO 端到端优化。
在训练阶段,MemHarness 采用 GRPO 进行端到端优化,信号源自任务奖励和格式约束。GRPO 比较同一任务下多条轨迹的表现,使得思考、重构和动作生成能够同步训练,无需单独的价值网络。
研究团队在 ALFWorld 和 WebShop 两个交互式决策基准上评估了 MemHarness。结果显示,其性能持续优于纯强化学习基线和静态记忆增强方法。消融实验证实,自适应重构是性能提升的主要驱动力。相比直接叠加外部记忆,MemHarness 通过记忆重构取得了更佳的整体表现。即便是 7B 规模的模型,其表现也超过了更大规模的闭源模型。此外,在分布外场景中,当环境布局或物品位置发生变化时,直接套用旧经验容易导致错误决策,而 MemHarness 能够先判断记忆适用性,改写或舍弃不匹配内容,展现出强大的鲁棒性。
实验还发现,Agent 是否采纳重构内容,取决于来源状态与当前状态是否匹配。当来源状态被替换为明显不匹配的随机状态时,模型拒绝率上升;若删除原始状态信息,任务成功率反而下降。这表明状态匹配度是决定重构有效性的关键因素。
当然,目前的研究也存在局限。MemHarness 目前主要在 ALFWorld 和 WebShop 两个基准上验证,尚未覆盖更多样化的真实环境。此外,冷启动模型本身的任务表现有限,真正的重建和决策能力仍需依赖后续的任务级强化学习。
