**Scaling Experience:Aether AI 如何通过 RSIAgent 让 AI 智能体实现自主进化**

过去几年,大模型能力的飞跃几乎都围绕着一个关键词:扩展。随着模型越来越强,AI 智能体也从单纯的“会聊天”逐渐走向“能干活”。然而,当这些智能体真正部署并进入从未见过的软件、工具或企业系统时,挑战才刚刚开始。陌生的交互逻辑、新的调用方式,以及环境中的隐含约束、异常状态和失败模式,都是巨大的阻碍。即便底层模型已经足够聪明,它也未必能真正理解环境中的因果结构:什么操作会带来什么结果?哪些条件会触发失败?改变哪些关键因素才能真正完成任务?

过去解决这个问题的最直接办法,是遇到新环境就重新收集一批交互数据,通过微调或强化学习重新训练。但这很难无限走下去。一方面,数据采集、标注和训练成本高昂;另一方面,在企业内部或私人环境中,很多数据既不适合公开,也不适合频繁重新训练。

于是问题变成了:如果不更新模型参数,一个智能体能不能像人一样,通过自己探索新环境、发现其中的因果规律、总结经验,并持续提升能力?

专注于因果智能的 Aether AI 提出了 RSIAgent。通过这一方案,他们试图探索另一种扩展路径:不继续扩展模型参数,而是扩展经验。也就是说,让智能体自己进入环境探索、试错、验证,再将得到的经验不断积累下来。RSIAgent 提供了一套面向数字智能体的递归自我提升框架,让智能体自主决定学什么、进入环境获取经验、验证结果,并将稳定的“动作—条件—结果”因果关系沉淀进记忆中,供后续任务直接复用。

**核心框架:从被动学习到主动探索**

RSIAgent 的核心,是将智能体与环境的交互过程本身变成一种持续学习过程。系统围绕一个不断演化的记忆库,构建了一个由课程智能体、执行智能体和验证智能体组成的多智能体递归闭环。课程智能体决定下一步应该探索什么方向,执行智能体进入环境执行任务并积累经验,验证智能体根据真实反馈判断结果是否可靠,最终将有效知识持续写入记忆。这样,智能体不再只是被动完成任务,而是能够自主选择学习方向、获取经验并扩展环境知识。

在此基础上,RSIAgent 进一步采用了“由广入深”的两阶段自探索策略,类似于大模型训练中的“预训练”到“后训练”的过程。

第一阶段:广泛递归自探索
这一阶段类似于预训练,重点是从“单点解决任务”转向“快速建立对环境的广泛认知”。课程智能体会在每一轮同时生成多个不同方向的探索任务,例如尝试不同的工具、交互方式和输入条件。随后,多组执行智能体和验证智能体并行执行与验证,再将有效经验汇总进共享记忆。基于当前已获得的知识,课程智能体会继续生成下一批更有价值、覆盖新方向的任务。整个过程形成一个并行递归链:多方向任务、并行执行、并行验证、汇总更新记忆、新一轮多方向任务。通过不断扩展探索方向,这一阶段能够快速覆盖环境中的常见规则、操作流程和失败模式,让系统先形成一张较完整的“环境知识地图”。

第二阶段:深度递归自探索
这一阶段更接近后训练,重点从“覆盖更多知识”转向“攻克关键难点”,主动寻找那些难、隐蔽、容易出错、只有在复杂情况下才会暴露的问题。课程智能体会首先生成一个相对困难的任务,刻意让系统进入可能出现异常、隐藏约束或边界情况的场景。执行智能体使用当前记忆完成任务;验证智能体检查结果;然后课程智能体根据暴露出的失败、未知问题和脆弱环节,再继续设计一个更难的任务。整个过程变成一个顺序递归链:困难任务、执行、验证、更新记忆、更困难任务。每一轮都建立在上一轮刚刚获得的知识之上。因此,这一阶段更像是一种自动化的“极限测试”,不断把智能体推向知识边界,让它真正知道“这个环境在哪些地方最容易出问题”。

最终,两阶段探索得到的记忆会被冻结,并直接用于后续任务执行,使智能体在不更新模型参数的情况下获得可复用的新环境能力。

**实验表现:超越闭源模型**

实验结果显示,这种“靠经验继续变强”的路线表现出了相当直接的效果。在不更新模型参数的情况下,RSIAgent 能够持续提升 Kimi-K3 和 GLM-5.3 等开源模型的能力,并在 OSWorld 2.0 与 Agents’ Last Exam 上超过了 GPT-6 Astra 等闭源模型。

在 OSWorld 2.0(0808 offline)上,RSIAgent 取得了 78.98% 的部分得分;在 Agents’ Last Exam(近期)上达到 84.82%,大幅领先于 GPT-6 Astra 的 72.60% 和 82.26%。

**能力验证与持续进化**

除了在数字环境中的表现,RSIAgent 也展现出了良好的泛化能力。团队将其应用于 GameCraft-Bench 的自主游戏开发任务,结果显示 RSIAgent 在机制、深度、视觉效果、艺术风格和整体质量上都能带来提升,证明其“主动探索—自我进化”机制能够迁移到不同类型的交互环境。

消融实验验证了广泛递归自探索和深度递归自探索的重要性:Broad 阶段负责快速建立环境知识覆盖,Deep 阶段进一步聚焦难点、隐藏约束和边界条件,移除任何一方均会大幅影响探索的广度或深度。此外,随着递归自我提升轮次增加,Agent 的表现呈现持续“自我进化”的趋势。不同难度的任务收敛速度不同,但最终得分可达到 100%,体现出类似人类探索与学习范式的递归进化过程。

**迈向通用因果智能:Scaling Experience 的未来**

过去几年,AI 能力的提升主要依赖于 Scaling Model,但这种范式本质上仍是“先训练、再部署”。模型进入新软件、新工具和新环境后,往往仍需要重新收集数据并额外训练,缺乏在部署过程中自主形成新知识的能力。

Aether AI 的因果驱动智能体路线关注的核心问题之一正是此:AI 能否不只从历史数据中学习相关性,而是在与环境持续交互的过程中,主动识别真正影响结果的变量、理解行动与结果之间的因果结构。围绕这一目标,团队已经从因果分析、环境探索、长期记忆到长程决策展开了一系列研究,旨在让 AI 从“记录发生了什么”进一步走向“理解什么真正导致了结果”。

RSIAgent 可以看作这条因果驱动智能体路线在数字环境中的一次具体实践。它试图推动智能体从被动训练走向主动因果发现与学习,并进一步迈向真正的自我进化。面对新环境,智能体不只是被动记录轨迹,而是主动决定“接下来该探索什么”,通过持续交互、试探和验证,对环境施加不同干预,并观察其结果。由此,智能体可以逐步发现动作、条件与结果之间的因果关系,并将这些规律转化为长期可复用的能力。

这构成了另一条 Scaling 路径:Scaling Experience。在模型参数保持不变的情况下,RSIAgent 通过一轮轮递归自我提升,持续扩展探索范围,从成功、失败和边界案例中发现新的因果规律与环境机制,并将其沉淀到可演化的记忆中。实验中,一些初始成功率仅为 0% 到 40% 的任务,随着轮次增加最终可以提升至 100%。这意味着,未来智能体的能力上限不仅取决于“底层模型有多强”,更取决于它能否通过主动干预环境,持续完成因果发现、因果验证与因果知识积累。

从 Aether AI 更大的技术路线来看,RSIAgent 所处理的数字环境,只是通用因果智能的一种载体。无论是数字智能体在软件中调用工具,还是机器人在物理世界中抓取、推动和操作物体,本质上都涉及同一个问题:一次行动如何改变环境,而这些变化又由哪些真正的因果机制决定。Aether AI 希望沿着这条路线继续推进,让 AI 不只记住“发生了什么”,也不只预测“接下来可能发生什么”,而是进一步理解“为什么会发生,以及怎样改变原因,才能改变结果”。

最新快讯

2026年09月16日

19:42
本文作者 | 哥吉拉数据支持 | 鼓狮大数据(www.gushiio.com)今晚深夜,美联储将公布9月议息决议。这是美联储近三年来第一次真正意义上把"加息"重新摆上桌面的会议,而不是在"降息25个基点还是50个基点"之间做选择题。与此同时,关于AI产业的多空言论火拼,整个AI板块也正处在市值集中度的历史高位,任何贴现率的边际变化,都很可能会被资本...
19:42
鼓狮财经9月16日讯,ST应急(300527.SZ)发布公告称,公司董事会已审议通过《关于申请撤销其他风险警示的议案》,拟向深交所申请撤销股票交易其他风险警示。此前,公司于2025年7月30日收到证监会湖北监管局下发的《行政处罚事先告知书》,该股票自2025年8月1日起已被实施其他风险警示。针对此次行政处罚所涉事项,公司已对相应年度财报进行了追溯重述。目前,...
19:42
鼓狮财经9月16日电,力源科技(688565.SH)公告称,公司与中国电力工程顾问集团东北电力设计院有限公司签署威海热电2×66万千瓦热电联产项目化学水处理系统设备买卖合同,合同金额6815.60万元(含税)。本次交易将巩固公司在火电市场的领先地位,提升持续盈利能力和核心竞争力,对公司业务发展及经营业绩将产生积极的影响。
19:03
9月16日,南下资金净买入港股20.99亿港元。资金重点布局了智谱、中芯国际、MiniMax、建滔积层板及腾讯,净买入额分别达31.22亿、6亿、4.99亿、3.75亿及3.49亿港元;与此同时,资金亦有减仓操作,其中净卖出盈富基金6.04亿、长飞光纤光缆3.9亿、金斯瑞生物科技3.02亿以及剑桥科技2.31亿。 值得关注的是,智谱已连续4日获资金青睐,累计...
19:03
近期,中国科技股终于迎来了一波久违的反弹。科创50指数在上周五一度跌破关键年线,最低触及1516点,这是自2024年9月30日以来的首次跌破。相比7月初2255点的历史高点,指数回撤幅度已达31%。然而,跌破年线后市场迅速企稳,午后上演深V反转,成功收复失地。周一指数虽震荡微跌,但守住了前期低点;周二试探上攻至1578点后虽有回落,但收盘仍收涨1.55%。今...
19:03
本文作者 | 远舟数据支持 | 鼓狮大数据(www.gushiio.com)执业编号 | A20260413000375本周一开始,亚太市场经历了一场过山车行情。受AI巨头呼吁"放缓研发"的消息冲击,AI相关板块集体承压。主要股指在情绪化宣泄之后有企稳迹象,展现一定的韧性,但剧烈的走势本身,印证了当前AI科技板块的高波动特征。与此同时,宏观环境同样...
19:02
在某电商平台上,搭载豆包手机助手的第二代努比亚 NaviX Ultra 目前预约量已达38.7万台。考虑到努比亚并非智能手机出货量前五的品牌,这一数据确实令人瞩目。得益于第一代产品的铺垫,市场对第二代产品的关注度自然更高。 早在2023年下半年,华为、小米、vivo、荣耀等厂商便宣称推出端侧大模型,2024年“AI手机”概念迅速升温,OPPO甚至在内部分析中...
18:58
据巴勒斯坦方面9月16日消息,加沙地带加沙城一座在战火中受损严重的居民楼于当天发生倒塌。此次事故已造成至少20人死亡、25人受伤,另有约100人下落不明。 当地消息人士称,倒塌建筑位于加沙城西南部,事发时间为16日凌晨2时15分许。尽管该建筑已被判定为危楼,但仍有6户家庭居住其中,且周边还设有数个难民帐篷。事故发生时,大多数居民正在熟睡,导致现场情况十分危急...
18:58
鼓狮财经9月16日讯,俄罗斯总统新闻秘书佩斯科夫今日回应了日本使馆关于恢复本国公民前往南千岛群岛(日方称“北方四岛”)探亲及安葬亲属免签制度的请求。佩斯科夫指出,日本对俄奉行极不友好的立场,并参与了所有针对俄罗斯的制裁,已被俄方列为不友好国家。因此,在当前形势下,指望在免签等问题上相互放宽是不现实的。此外,佩斯科夫强调,缩减双边关系并非俄方意愿。(来源:CC...
18:58
鼓狮财经9月16日讯,据美国方面15日披露的消息,美国前国务卿布林肯在接受采访时指出,美国在中东的盟友对美国保障其安全的能力已感到失望。布林肯分析认为,伊朗持续袭击美国在中东的军事基地,向盟友传递了一个警示信号:一旦自身面临危机,未必能指望美国的援助。受此影响,该地区国家目前都在积极寻求与伊朗展开对话。