检索过往经验是增强 LLM Agent 决策能力的常见手段。面对新任务时,Agent 往往会直接调用历史记忆辅助判断。然而,历史经验只有在适配当前上下文时才具备实用价值。多数现有记忆增强 Agent 将检索到的经验视为静态记录直接注入上下文,很少判断其是否适合当前情境。如果“旧”经验与当前状态不匹配,反而会干扰决策,导致负迁移。相比之下,人类调用记忆更为灵活,通常会结合当前情境重新评估过往经验。受此启发,上海 AI Lab 团队及其合作者提出了“LLM Agent 经验重构”框架 MemHarness。该框架在检索与动作之间引入显式的记忆重构环节,通过 GRPO 端到端学习这一能力,无需人工标注。

MemHarness 的设计理念是模拟人类的“检索、评估和重构”过程。它通过在检索和动作之间插入“批判”与“重构”步骤,将静态记忆转化为具有上下文敏感性的指导信息。具体流程分为三步:首先是检索,根据最近几步的观测和动作判断是否需要历史经验;其次是重构,模型结合任务描述、当前状态、检索记忆及来源状态,比较过去与现在的差异,决定保留、改写或丢弃;最后是动作生成,模型基于重构后的指导生成动作。由于没有现成标注,整个流程依赖任务奖励,通过 GRPO 端到端优化。

在训练阶段,MemHarness 采用 GRPO 进行端到端优化,信号源自任务奖励和格式约束。GRPO 比较同一任务下多条轨迹的表现,使得思考、重构和动作生成能够同步训练,无需单独的价值网络。

研究团队在 ALFWorld 和 WebShop 两个交互式决策基准上评估了 MemHarness。结果显示,其性能持续优于纯强化学习基线和静态记忆增强方法。消融实验证实,自适应重构是性能提升的主要驱动力。相比直接叠加外部记忆,MemHarness 通过记忆重构取得了更佳的整体表现。即便是 7B 规模的模型,其表现也超过了更大规模的闭源模型。此外,在分布外场景中,当环境布局或物品位置发生变化时,直接套用旧经验容易导致错误决策,而 MemHarness 能够先判断记忆适用性,改写或舍弃不匹配内容,展现出强大的鲁棒性。

实验还发现,Agent 是否采纳重构内容,取决于来源状态与当前状态是否匹配。当来源状态被替换为明显不匹配的随机状态时,模型拒绝率上升;若删除原始状态信息,任务成功率反而下降。这表明状态匹配度是决定重构有效性的关键因素。

当然,目前的研究也存在局限。MemHarness 目前主要在 ALFWorld 和 WebShop 两个基准上验证,尚未覆盖更多样化的真实环境。此外,冷启动模型本身的任务表现有限,真正的重建和决策能力仍需依赖后续的任务级强化学习。

最新快讯

2026年08月03日

18:42
鼓狮财经8月3日电,宏景科技(301396.SZ)公告称,公司董事会审议通过回购股份方案,拟以自有资金通过集中竞价方式回购股份,资金总额不低于3000万元且不超过5000万元,回购价格不超过260元/股,用于未来实施员工持股计划或股权激励。
18:42
鼓狮财经8月3日电,胜蓝股份(300843.SZ)公告称,公司拟使用自有资金及自筹资金以集中竞价方式回购公司股份,回购资金总额不低于1亿元且不超过2亿元,回购价格不超过195.18元/股。回购股份将用于股权激励或员工持股计划、可转债转股。
18:42
鼓狮财经8月3日电,豫光金铅(600531.SH)公告称,公司收到控股股东豫光集团转发的济源产城融合示范区国资局批复,原则同意公司向特定对象发行股票预案,发行数量不超过3.63亿股,募集资金总额不超过18.39亿元,并同意豫光集团以现金参与认购。该事项尚需公司股东会审议、上交所审核及证监会同意注册。
18:42
据鼓狮财经8月3日报道,当地时间8月3日,以色列议会外交和国防委员会投票通过了政府提交的延期申请,决定将军队紧急动员令延长两个月,有效期至今年9月30日。根据该决议,以色列国防军获准最多可征召24万名预备役军人。据悉,自2023年新一轮巴以冲突爆发以来,此类延长紧急动员期限的申请已多次获得批准。
18:10
究竟还有没有便宜又好用的模型?就在刚刚,阿里巴巴突袭发布了新一代基座大模型 Qwen3.8-Max。用四个字概括就是「能打」、「便宜」。总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接跃升了一个档次。 在今天最新放榜的权威第三方榜单 Arena 中,Qwen3.8-Max 一路冲到全球大模型第一梯队,表现直逼 Anthrop...
18:05
导语:绿的谐波的业绩与马斯克能否兑现承诺紧密相连。加州弗里蒙特与江苏苏州,直线距离超过一万公里。但在即将到来的具身智能时代,这两地极有可能因一款产品而产生紧密联动。目前,特斯拉弗里蒙特工厂已拆除了原有的汽车生产线,转而开始组装人形机器人Optimus。市场普遍认为,作为总部位于杭州的机器人供应商龙头,绿的谐波将因此受益。这家企业在国内谐波减速器市场占据20%...
18:05
投资界传来重磅消息,全栈开源双足人形机器人项目RoboParty(萝博派对)近期已连续完成近5亿元的天使++轮和Pre-A轮融资。其中,Pre-A轮由宁德时代独家领投。这在业内并不多见,因为宁德时代通常通过其投资部门进行投资,而此次是直接以集团战略投资主体的身份下注,信号意义不言而喻。 这位备受瞩目的创始人是22岁的黄一,一位几乎满足了VC所有想象的“天才少...
18:05
两百多年前,英国纺织工人拿起锤子砸向机器。两百多年后,类似的情绪又出现在了韩国的一座汽车工厂里。今年 7 月,现代汽车韩国工会连续发动部分罢工。表面看,这仍然是一场熟悉的劳资谈判:加薪、绩效奖金、退休年龄都在工会诉求之中。但今年多出来了一项颇具时代感的内容——AI 与机器人时代的就业保障。早在 6 月的罢工投票阶段,现代汽车工会便提出,希望获得针对先进机器人...
18:05
6月下旬以来,全球AI板块经历了一轮显著的回调。这究竟是短暂的技术性调整,还是周期见顶的信号?这是一个极具价值的问题。摩根士丹利于7月27日发布了一份长达120页的深度报告《Playing the AI Infrastructure Dip》,对此进行了深入探讨。报告给出了明确的判断:此次回调的主要驱动力在于技术面因素,包括仓位拥挤度的消化、保证金融资的去杠...
18:05
长久以来,硅谷厂商主导着全球大模型的定价权。DeepSeek 凭借性能与价格的双重优势,在海外开发者市场形成了显著的挤压效应。这几天,社交媒体上一张 AI 漫画图广为流传,虽然人物是梁文锋,但经过漫画化处理后,其形象酷似超人,被海外网友戏称为“海外开发者眼中的梁文锋”。这幅漫画所表达的深意在于,就在上周末,DeepSeek V4 Flash 正式上线,以极致...
18:05
**瑞·达利欧深度访谈:AI 泡沫的生成机制、投资策略及未来展望** **编者按:** 桥水基金创始人瑞·达利欧近期接受了知名商业播客节目 The Diary Of A CEO 的深度专访,深入探讨了 AI 泡沫、80 年周期迭代以及比特币等议题。在访谈中,达利欧揭示了 AI 泡沫的生成机制,列举了泡沫破裂的三大征兆,并分析了 AI 变革中资本家与普通人的命...
18:05
过去两年,几乎所有AI公司都在讲述同一个故事:把重复劳动交给AI,人类就能腾出时间去从事更有创造性的工作。这套理论听起来无懈可击。让AI整理资料、处理表格或撰写会议纪要,人则专注于战略和创意,仿佛是一次完美的社会分工。然而,它掩盖了一个前提:重复劳动与创造性工作并非泾渭分明。历史给出的答案并不干脆。许多真正的创造并非发生在重复劳动之后,恰恰发生在重复、失败和...