**Scaling Experience:Aether AI 如何通过 RSIAgent 让 AI 智能体实现自主进化**

过去几年,大模型能力的飞跃几乎都围绕着一个关键词:扩展。随着模型越来越强,AI 智能体也从单纯的“会聊天”逐渐走向“能干活”。然而,当这些智能体真正部署并进入从未见过的软件、工具或企业系统时,挑战才刚刚开始。陌生的交互逻辑、新的调用方式,以及环境中的隐含约束、异常状态和失败模式,都是巨大的阻碍。即便底层模型已经足够聪明,它也未必能真正理解环境中的因果结构:什么操作会带来什么结果?哪些条件会触发失败?改变哪些关键因素才能真正完成任务?

过去解决这个问题的最直接办法,是遇到新环境就重新收集一批交互数据,通过微调或强化学习重新训练。但这很难无限走下去。一方面,数据采集、标注和训练成本高昂;另一方面,在企业内部或私人环境中,很多数据既不适合公开,也不适合频繁重新训练。

于是问题变成了:如果不更新模型参数,一个智能体能不能像人一样,通过自己探索新环境、发现其中的因果规律、总结经验,并持续提升能力?

专注于因果智能的 Aether AI 提出了 RSIAgent。通过这一方案,他们试图探索另一种扩展路径:不继续扩展模型参数,而是扩展经验。也就是说,让智能体自己进入环境探索、试错、验证,再将得到的经验不断积累下来。RSIAgent 提供了一套面向数字智能体的递归自我提升框架,让智能体自主决定学什么、进入环境获取经验、验证结果,并将稳定的“动作—条件—结果”因果关系沉淀进记忆中,供后续任务直接复用。

**核心框架:从被动学习到主动探索**

RSIAgent 的核心,是将智能体与环境的交互过程本身变成一种持续学习过程。系统围绕一个不断演化的记忆库,构建了一个由课程智能体、执行智能体和验证智能体组成的多智能体递归闭环。课程智能体决定下一步应该探索什么方向,执行智能体进入环境执行任务并积累经验,验证智能体根据真实反馈判断结果是否可靠,最终将有效知识持续写入记忆。这样,智能体不再只是被动完成任务,而是能够自主选择学习方向、获取经验并扩展环境知识。

在此基础上,RSIAgent 进一步采用了“由广入深”的两阶段自探索策略,类似于大模型训练中的“预训练”到“后训练”的过程。

第一阶段:广泛递归自探索
这一阶段类似于预训练,重点是从“单点解决任务”转向“快速建立对环境的广泛认知”。课程智能体会在每一轮同时生成多个不同方向的探索任务,例如尝试不同的工具、交互方式和输入条件。随后,多组执行智能体和验证智能体并行执行与验证,再将有效经验汇总进共享记忆。基于当前已获得的知识,课程智能体会继续生成下一批更有价值、覆盖新方向的任务。整个过程形成一个并行递归链:多方向任务、并行执行、并行验证、汇总更新记忆、新一轮多方向任务。通过不断扩展探索方向,这一阶段能够快速覆盖环境中的常见规则、操作流程和失败模式,让系统先形成一张较完整的“环境知识地图”。

第二阶段:深度递归自探索
这一阶段更接近后训练,重点从“覆盖更多知识”转向“攻克关键难点”,主动寻找那些难、隐蔽、容易出错、只有在复杂情况下才会暴露的问题。课程智能体会首先生成一个相对困难的任务,刻意让系统进入可能出现异常、隐藏约束或边界情况的场景。执行智能体使用当前记忆完成任务;验证智能体检查结果;然后课程智能体根据暴露出的失败、未知问题和脆弱环节,再继续设计一个更难的任务。整个过程变成一个顺序递归链:困难任务、执行、验证、更新记忆、更困难任务。每一轮都建立在上一轮刚刚获得的知识之上。因此,这一阶段更像是一种自动化的“极限测试”,不断把智能体推向知识边界,让它真正知道“这个环境在哪些地方最容易出问题”。

最终,两阶段探索得到的记忆会被冻结,并直接用于后续任务执行,使智能体在不更新模型参数的情况下获得可复用的新环境能力。

**实验表现:超越闭源模型**

实验结果显示,这种“靠经验继续变强”的路线表现出了相当直接的效果。在不更新模型参数的情况下,RSIAgent 能够持续提升 Kimi-K3 和 GLM-5.3 等开源模型的能力,并在 OSWorld 2.0 与 Agents’ Last Exam 上超过了 GPT-6 Astra 等闭源模型。

在 OSWorld 2.0(0808 offline)上,RSIAgent 取得了 78.98% 的部分得分;在 Agents’ Last Exam(近期)上达到 84.82%,大幅领先于 GPT-6 Astra 的 72.60% 和 82.26%。

**能力验证与持续进化**

除了在数字环境中的表现,RSIAgent 也展现出了良好的泛化能力。团队将其应用于 GameCraft-Bench 的自主游戏开发任务,结果显示 RSIAgent 在机制、深度、视觉效果、艺术风格和整体质量上都能带来提升,证明其“主动探索—自我进化”机制能够迁移到不同类型的交互环境。

消融实验验证了广泛递归自探索和深度递归自探索的重要性:Broad 阶段负责快速建立环境知识覆盖,Deep 阶段进一步聚焦难点、隐藏约束和边界条件,移除任何一方均会大幅影响探索的广度或深度。此外,随着递归自我提升轮次增加,Agent 的表现呈现持续“自我进化”的趋势。不同难度的任务收敛速度不同,但最终得分可达到 100%,体现出类似人类探索与学习范式的递归进化过程。

**迈向通用因果智能:Scaling Experience 的未来**

过去几年,AI 能力的提升主要依赖于 Scaling Model,但这种范式本质上仍是“先训练、再部署”。模型进入新软件、新工具和新环境后,往往仍需要重新收集数据并额外训练,缺乏在部署过程中自主形成新知识的能力。

Aether AI 的因果驱动智能体路线关注的核心问题之一正是此:AI 能否不只从历史数据中学习相关性,而是在与环境持续交互的过程中,主动识别真正影响结果的变量、理解行动与结果之间的因果结构。围绕这一目标,团队已经从因果分析、环境探索、长期记忆到长程决策展开了一系列研究,旨在让 AI 从“记录发生了什么”进一步走向“理解什么真正导致了结果”。

RSIAgent 可以看作这条因果驱动智能体路线在数字环境中的一次具体实践。它试图推动智能体从被动训练走向主动因果发现与学习,并进一步迈向真正的自我进化。面对新环境,智能体不只是被动记录轨迹,而是主动决定“接下来该探索什么”,通过持续交互、试探和验证,对环境施加不同干预,并观察其结果。由此,智能体可以逐步发现动作、条件与结果之间的因果关系,并将这些规律转化为长期可复用的能力。

这构成了另一条 Scaling 路径:Scaling Experience。在模型参数保持不变的情况下,RSIAgent 通过一轮轮递归自我提升,持续扩展探索范围,从成功、失败和边界案例中发现新的因果规律与环境机制,并将其沉淀到可演化的记忆中。实验中,一些初始成功率仅为 0% 到 40% 的任务,随着轮次增加最终可以提升至 100%。这意味着,未来智能体的能力上限不仅取决于“底层模型有多强”,更取决于它能否通过主动干预环境,持续完成因果发现、因果验证与因果知识积累。

从 Aether AI 更大的技术路线来看,RSIAgent 所处理的数字环境,只是通用因果智能的一种载体。无论是数字智能体在软件中调用工具,还是机器人在物理世界中抓取、推动和操作物体,本质上都涉及同一个问题:一次行动如何改变环境,而这些变化又由哪些真正的因果机制决定。Aether AI 希望沿着这条路线继续推进,让 AI 不只记住“发生了什么”,也不只预测“接下来可能发生什么”,而是进一步理解“为什么会发生,以及怎样改变原因,才能改变结果”。

最新快讯

2026年09月15日

17:19
日元本轮猛烈涨势,正命系于日本央行接下来的行动。若日央行延续保守的加息节奏,或是不及市场乐观预期,日元大概率迎来大幅回调。甚至可能重蹈7月触及四十年汇率低点的覆辙。关键考验本月初,日元再度大幅走强。这主要得益于日本央行释放偏鹰派措辞,叠加美国财长贝森特呼吁日央行 “做出正确抉择”,一举推动日元汇率短期暴涨。而自7月底美日联手干预以来,美元/日元目前已累计跌逾...
16:49
8月25日,OpenAI正式发布了其首款自研AI加速芯片“Jalapeño”。该芯片具备高达13.4 petaflops的4位计算能力,可接入232GB的先进内存,并拥有15.4 TB/s的连接速度。基准测试显示,与OpenAI当前使用的Nvidia GB300芯片相比,Jalapeño能将端到端延迟降低多达3.6倍,同时功耗也更低。 虽然这些性能指标令人瞩...
16:48
9月15日,2026飞书未来无限大会在北京隆重举行。字节跳动CEO梁汝波在会上明确释放了战略信号:字节跳动将全面整合豆包、飞书及火山引擎的力量,集中资源打造优质的工作与生产力产品,并将在企业市场加大投入力度。 这一战略布局,源于梁汝波对AI落地节奏的深刻判断。随着大模型Agent(智能体)能力在去年底进入可用阶段,AI在生产力场景的落地明显提速。梁汝波指出,...
16:48
2026年9月15日,美国10年期国债收益率急剧攀升,一度触及5.041%的高位。这一涨幅不仅突破了2023年10月23日创下的5.024%高点,更刷新了自金融危机以来的纪录。资本市场为何对长债收益率给予如此巨大的关注?这主要源于“金融条件指数”中长债占据了近半的权重。长债拥有极高的“久期”,犹如一把锋利的双刃剑。 通常情况下,金融机构将美国长债视为稳健的生...
16:48
9月15日,受美债收益率突破5%及加息预期逼近九成的影响,市场情绪保持谨慎。港股午后跌幅扩大,恒生科技指数早盘一度涨超1%,但最终收跌0.62%,恒生指数和国企指数分别收跌1%及0.96%。 盘面上,大型科网股涨跌不一,网易涨近3%,腾讯涨1.9%,阿里巴巴涨1.23%,而小米跌2.43%,百度、美团飘绿。游戏软件股表现强势,网龙涨超4%,网易涨超2%。内银...
16:48
9月15日,市场监管总局会同文化和旅游部联合召开了在线酒店预订平台服务行业行政指导会。会议旨在指导业内平台企业切实落实合规主体责任,有效防范化解行业竞争风险,从而维护健康有序的旅游市场环境。 会议强调,公平竞争是市场经济的法治基石,合规经营是企业发展的生命线。近年来,我国在线酒店预订行业发展迅猛,在便利群众生活、促进旅游消费等方面功不可没,但伴随行业扩张,竞...
15:57
2026年7月,美国专利律师Bryan McWhorter碰到了一件很适合交给AI、也很适合拿来理解AI的工作。他是Knobbe Martens的合伙人。一次专利尽调中,他拿到一个由56件相关专利组成的专利族。每一件专利的审查档案都超过1300页。客户要他找出:围绕一个特定术语,这几十件专利漫长的审查历史里,有没有出现过可能限制权利范围的陈...
15:57
鼓狮财经9月15日报道,尽管今日港股大盘整体走势疲软,但半导体板块却逆势上扬,率先展现出强劲的反弹态势。截至发稿,多只半导体个股表现亮眼,其中傅里叶涨幅接近20%,天域半导体涨幅逾7%,澜起科技等多只个股跟涨超过3%。 行业消息面传来积极信号,台积电、英伟达等产业链头部企业持续释放景气度回暖的利好。据媒体报道,台积电在3纳米、2纳米先进制程及CoWoS先进封...
15:57
随着7月基本面数据的阶段性回落,8月正式步入宏观政策的密集部署期。客观而言,政策传导至数据体现并非一蹴而就,9月才是政策效能真正的“实物验证期”。从实际呈现来看,8月部分宏观指标放缓的斜率已开始改善,企稳的能见度逐步显现。这印证了近期落地的政策已初步发挥了缓冲效用,在底部为基本面构筑了初步的“支点”。这种“斜率修复而总量承压”的格局,本质上是政策传导时滞的客...
15:57
今日A股市场低开低走,截至收盘,上证指数下跌0.54%,报3864.28点;深证成指下跌0.72%;创业板指下跌1.15%。相比之下,北证50指数上涨0.65%,科创50指数上涨1.55%。全市场成交额为16253亿元,较前一交易日减少177亿元,持平年内新低,且超4300只个股下跌。 盘面上,风电设备板块因海外产能紧张而爆发,大金重工、吉鑫科技、天顺风能等...
15:57
大模型行业的竞争格局正经历深刻变革。随着Agent(智能体)深度融入企业业务流程,模型调用频率呈现指数级增长,算力成本与投入产出比成为核心竞争力。全球头部厂商纷纷采取类似策略:谷歌持续迭代Gemini Flash系列,将3.8 Flash打造为兼顾性能、速度与成本的主力模型。云知声、智谱以及DeepSeek也做出了相同的技术抉择,U2-Flash、GLM 5...