**Scaling Experience:Aether AI 如何通过 RSIAgent 让 AI 智能体实现自主进化**
过去几年,大模型能力的飞跃几乎都围绕着一个关键词:扩展。随着模型越来越强,AI 智能体也从单纯的“会聊天”逐渐走向“能干活”。然而,当这些智能体真正部署并进入从未见过的软件、工具或企业系统时,挑战才刚刚开始。陌生的交互逻辑、新的调用方式,以及环境中的隐含约束、异常状态和失败模式,都是巨大的阻碍。即便底层模型已经足够聪明,它也未必能真正理解环境中的因果结构:什么操作会带来什么结果?哪些条件会触发失败?改变哪些关键因素才能真正完成任务?
过去解决这个问题的最直接办法,是遇到新环境就重新收集一批交互数据,通过微调或强化学习重新训练。但这很难无限走下去。一方面,数据采集、标注和训练成本高昂;另一方面,在企业内部或私人环境中,很多数据既不适合公开,也不适合频繁重新训练。
于是问题变成了:如果不更新模型参数,一个智能体能不能像人一样,通过自己探索新环境、发现其中的因果规律、总结经验,并持续提升能力?
专注于因果智能的 Aether AI 提出了 RSIAgent。通过这一方案,他们试图探索另一种扩展路径:不继续扩展模型参数,而是扩展经验。也就是说,让智能体自己进入环境探索、试错、验证,再将得到的经验不断积累下来。RSIAgent 提供了一套面向数字智能体的递归自我提升框架,让智能体自主决定学什么、进入环境获取经验、验证结果,并将稳定的“动作—条件—结果”因果关系沉淀进记忆中,供后续任务直接复用。
**核心框架:从被动学习到主动探索**
RSIAgent 的核心,是将智能体与环境的交互过程本身变成一种持续学习过程。系统围绕一个不断演化的记忆库,构建了一个由课程智能体、执行智能体和验证智能体组成的多智能体递归闭环。课程智能体决定下一步应该探索什么方向,执行智能体进入环境执行任务并积累经验,验证智能体根据真实反馈判断结果是否可靠,最终将有效知识持续写入记忆。这样,智能体不再只是被动完成任务,而是能够自主选择学习方向、获取经验并扩展环境知识。
在此基础上,RSIAgent 进一步采用了“由广入深”的两阶段自探索策略,类似于大模型训练中的“预训练”到“后训练”的过程。
第一阶段:广泛递归自探索
这一阶段类似于预训练,重点是从“单点解决任务”转向“快速建立对环境的广泛认知”。课程智能体会在每一轮同时生成多个不同方向的探索任务,例如尝试不同的工具、交互方式和输入条件。随后,多组执行智能体和验证智能体并行执行与验证,再将有效经验汇总进共享记忆。基于当前已获得的知识,课程智能体会继续生成下一批更有价值、覆盖新方向的任务。整个过程形成一个并行递归链:多方向任务、并行执行、并行验证、汇总更新记忆、新一轮多方向任务。通过不断扩展探索方向,这一阶段能够快速覆盖环境中的常见规则、操作流程和失败模式,让系统先形成一张较完整的“环境知识地图”。
第二阶段:深度递归自探索
这一阶段更接近后训练,重点从“覆盖更多知识”转向“攻克关键难点”,主动寻找那些难、隐蔽、容易出错、只有在复杂情况下才会暴露的问题。课程智能体会首先生成一个相对困难的任务,刻意让系统进入可能出现异常、隐藏约束或边界情况的场景。执行智能体使用当前记忆完成任务;验证智能体检查结果;然后课程智能体根据暴露出的失败、未知问题和脆弱环节,再继续设计一个更难的任务。整个过程变成一个顺序递归链:困难任务、执行、验证、更新记忆、更困难任务。每一轮都建立在上一轮刚刚获得的知识之上。因此,这一阶段更像是一种自动化的“极限测试”,不断把智能体推向知识边界,让它真正知道“这个环境在哪些地方最容易出问题”。
最终,两阶段探索得到的记忆会被冻结,并直接用于后续任务执行,使智能体在不更新模型参数的情况下获得可复用的新环境能力。
**实验表现:超越闭源模型**
实验结果显示,这种“靠经验继续变强”的路线表现出了相当直接的效果。在不更新模型参数的情况下,RSIAgent 能够持续提升 Kimi-K3 和 GLM-5.3 等开源模型的能力,并在 OSWorld 2.0 与 Agents’ Last Exam 上超过了 GPT-6 Astra 等闭源模型。
在 OSWorld 2.0(0808 offline)上,RSIAgent 取得了 78.98% 的部分得分;在 Agents’ Last Exam(近期)上达到 84.82%,大幅领先于 GPT-6 Astra 的 72.60% 和 82.26%。
**能力验证与持续进化**
除了在数字环境中的表现,RSIAgent 也展现出了良好的泛化能力。团队将其应用于 GameCraft-Bench 的自主游戏开发任务,结果显示 RSIAgent 在机制、深度、视觉效果、艺术风格和整体质量上都能带来提升,证明其“主动探索—自我进化”机制能够迁移到不同类型的交互环境。
消融实验验证了广泛递归自探索和深度递归自探索的重要性:Broad 阶段负责快速建立环境知识覆盖,Deep 阶段进一步聚焦难点、隐藏约束和边界条件,移除任何一方均会大幅影响探索的广度或深度。此外,随着递归自我提升轮次增加,Agent 的表现呈现持续“自我进化”的趋势。不同难度的任务收敛速度不同,但最终得分可达到 100%,体现出类似人类探索与学习范式的递归进化过程。
**迈向通用因果智能:Scaling Experience 的未来**
过去几年,AI 能力的提升主要依赖于 Scaling Model,但这种范式本质上仍是“先训练、再部署”。模型进入新软件、新工具和新环境后,往往仍需要重新收集数据并额外训练,缺乏在部署过程中自主形成新知识的能力。
Aether AI 的因果驱动智能体路线关注的核心问题之一正是此:AI 能否不只从历史数据中学习相关性,而是在与环境持续交互的过程中,主动识别真正影响结果的变量、理解行动与结果之间的因果结构。围绕这一目标,团队已经从因果分析、环境探索、长期记忆到长程决策展开了一系列研究,旨在让 AI 从“记录发生了什么”进一步走向“理解什么真正导致了结果”。
RSIAgent 可以看作这条因果驱动智能体路线在数字环境中的一次具体实践。它试图推动智能体从被动训练走向主动因果发现与学习,并进一步迈向真正的自我进化。面对新环境,智能体不只是被动记录轨迹,而是主动决定“接下来该探索什么”,通过持续交互、试探和验证,对环境施加不同干预,并观察其结果。由此,智能体可以逐步发现动作、条件与结果之间的因果关系,并将这些规律转化为长期可复用的能力。
这构成了另一条 Scaling 路径:Scaling Experience。在模型参数保持不变的情况下,RSIAgent 通过一轮轮递归自我提升,持续扩展探索范围,从成功、失败和边界案例中发现新的因果规律与环境机制,并将其沉淀到可演化的记忆中。实验中,一些初始成功率仅为 0% 到 40% 的任务,随着轮次增加最终可以提升至 100%。这意味着,未来智能体的能力上限不仅取决于“底层模型有多强”,更取决于它能否通过主动干预环境,持续完成因果发现、因果验证与因果知识积累。
从 Aether AI 更大的技术路线来看,RSIAgent 所处理的数字环境,只是通用因果智能的一种载体。无论是数字智能体在软件中调用工具,还是机器人在物理世界中抓取、推动和操作物体,本质上都涉及同一个问题:一次行动如何改变环境,而这些变化又由哪些真正的因果机制决定。Aether AI 希望沿着这条路线继续推进,让 AI 不只记住“发生了什么”,也不只预测“接下来可能发生什么”,而是进一步理解“为什么会发生,以及怎样改变原因,才能改变结果”。
