随着 GPT-6 的问世,通用人工智能的发展速度远超预期。其强大的基础通用模型能力有目共睹,大模型的 RSI 指数更是惊人。行业呈现出几家欢喜几家愁的局面。在此之前,谁也没想到这个基础模型能在具身智能领域掀起如此巨浪。GPT-6 Astra 发布次日,Robocurve 便将其接入机器人执行任务,结果令人惊叹。GPT-6 Astra 在控制机器人方面强悍至极,Token 消耗也低得惊人。在机器人控制任务中,其成功率达到 95%,远高于 Fable 5.1 的 40%;同时,输出 Token 用量仅为后者的约 1/6.2,成本约为后者的 1/2.3。于是,用 GPT-6 基模控制机器人执行复杂操作的案例如雨后春笋般涌现。

然而,这既带来了机遇,也引发了焦虑。通用人工智能模型接管具身智能领域的讨论日益增多,甚至出现了“GPT-6 横扫具身”,具身智能将成为通用模型子领域的趋势。有知名具身智能企业创始人表示,当前具身智能尚未建立真正的护城河,通用模型公司在人才、算力和资金上占优,“未来一两年将是关键窗口”。Robocurve 预测,如果这一趋势持续,大语言模型最早可能在今年年底、最晚在 2029 年实现对机械臂的实时控制。

不过,亮眼的成绩并不代表基模已能在真实环境中安全、稳定地控制机器人。RoboDojo 团队在官方评测中指出,Astra 在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏。出于安全考虑,团队提前终止了测试,导致 Astra 未能完成原定包含 18 项任务的 RoboDojo-Real 评测。这提醒我们,基模能力的突破只是起点。如何约束动作、处理失败,让机器人安全、稳定地持续工作,仍是系统层面必须解决的问题。

基模在变强,但通用是一把双刃剑。正如打造智能体需要在基模之上构建 Harness,具身智能目前缺少的,是一套让经验积累、让能力持续生长的系统。近日,穹彻智能发布了 RoboRSI,一个面向真实复杂场景的机器人多智能体自进化框架,旨在回答这个问题:当基础模型具备强大理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。

单次成功和长期稳定运行之间,隔着一整套系统级的能力。两个核心难题是:第一,谁来处理执行过程中的各种异常?机器人报错停止、抓取失败、位置偏移之后,需要结果检查、异常恢复、进行安全决策。过去这些工作全靠工程师手动跟进。大模型可以理解任务目标,但它不能负责现场恢复,也不判断执行是否成功,更无法决定下一步从哪个节点继续。第二,历史经验如何真正实现沉淀复用?如果每次都让 Agent 参考过去的完整执行记录,Token 消耗会持续增长,导致模型难以聚焦。如果每次碰到局部失败就重写整套流程,系统也很难收敛。

Context 管理是新时代的代码管理。过去,机器人系统的核心挑战是写出正确的控制代码。在 Agent 时代,代码可以由模型生成和迭代,真正的瓶颈转移到了如何管理 Agent 在持续运行中产生的海量上下文:轨迹、日志、视频、代码版本、失败记录。管理不当,系统就会在迭代中走向混乱。穹彻智能的设计哲学可以概括为一句话:给人和 Agent 各自提供合适的接口。对人,提供“高层引导”:无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体。对 Agent,提供“清晰结构”:通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开。

所以,不管基模能力再强大,也需要一个系统级的 Harness 框架,使其能够适应具身智能的需求。RoboRSI 正是围绕这两个问题构建的具身智能版的 Harness。具身的上下文管理需要多智能体协作。RoboRSI 将规划、执行、诊断和修订拆分到不同的上下文中,采用 Manager、Planner、Engineer、Reviewer 四类智能体协作的架构。Manager 是整个系统的调度中枢,负责任务队列管理、并发 worker 调度、断点恢复和技能版本管理,将用户输入的高层目标分解成可执行的任务序列。Planner 根据当前环境观察和已有技能库,生成具体的执行计划,即“我看到了什么、手里有什么工具、所以这一步应该怎么做”。Engineer 是真正动手的角色,调用机器人的底层工具(感知、导航、抓取、放置等),执行动作并生成候选能力。Reviewer 在执行完成后登场,根据执行结果(日志、视频、轨迹)复盘问题、定位失败原因,并把修订建议返回给 Manager,推动下一轮迭代。这四个角色围绕同一个任务和同一份执行证据接力运行,形成一个完整的“执行→诊断→修订→再执行”闭环。关键在于,人类仍然保留着对目标、价值判断和安全边界的控制权。在真机上,人负责安全监管和方向调整;在仿真中,系统可以自动完成更多的复位和判定。工程师的角色因此发生了根本转变:从逐行编写任务代码、跟进每一次底层执行,转向设定目标、审核结果和提供方向性指导。

让机器人持续迭代,并不只是让 Agent 一遍遍尝试。最重要的是把尝试后的结果与经验沉淀下来。穹彻智能为此提出了 TSR(Top-down Skill Refinement,自顶向下技能细化)机制。它用一棵四层的技能树来组织机器人的全部能力:任务族,定义总体目标与约束,比如“家庭地面清理”;复合技能,组合多步能力,比如“搜索目标→移动→抓取→放置”;原子任务,边界明确、结果可验证的最小任务单元,比如“抓取地面上的黄色包装袋”;基础技能,与机器人直接交互的底层能力,包括视觉感知、移动控制、抓取、放置等。这棵技能树的作用是为 Coding Agent 提供结构性约束。每次修改都被限制在清晰的技能边界内,Agent 可以专注于局部实现和修订,但不会因为连续调试而偏离全局任务目标。历史经验由此从对话记录和日志,变成了下一轮真正可调用的能力。

在早期探索阶段,Agent 需要逐步观察环境、选择工具、执行动作,每一步都需要模型推理。但当某条执行路径被反复验证为稳定后,继续让 Agent 逐步调用每一个工具就成了浪费。穹彻智能设计了一个三阶段的演进机制:从成功的调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,然后将可复用流程固化为代码技能。当类似任务再次出现时,Agent 只需选择、监控和必要时修订整条技能,重复的工具调用步骤则由代码承担。在 LIBERO 基准测试的实验中,启用代码固化相比未启用版本,回合通过率从 21.5% 提升到 29.0%,中位 Token 消耗下降 29.4%,中位 VLM 调用次数下降 27.2%,中位执行时间下降 17.0%。Agent 的推理资源,只留给真正变化和不确定的部分。

在仿真环境中,穹彻智能进行了更系统的定量验证。零样本任务适配方面,在没有现成任务代码的情况下,系统从基础技能开始迭代。经过约一天的并行执行,LIBERO 基准上的累计任务通过率从 32/120 提升至 95/120;RoboTwin 从初始的 9/50 提升至 36/50。与仅使用 Engineer 单角色的基线相比,完整的多智能体配置在 RoboTwin 上将通过率提升了 4 倍。代码固化效果方面,在 LIBERO 的 120 个任务、5 组初始布局、共 600 个 episode 实验中,启用代码固化相比未启用版本:回合通过率从 21.5% 提升到 29.0%;中位 Token 消耗下降 29.4%;中位 VLM 调用次数下降 27.2%;中位执行时间下降 17.0%。扰动鲁棒性方面,在 LIBERO-Plus 的 840 个扰动实例中,涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度,RoboRSI 通过自适应修订将通过率从 31.1% 提升至 47.4%,额外恢复了 137 个原本失败的实例。

让我们回到文章开头的真机演示视频。以同类任务为参照,2024 年完成一个类似的家庭地面清理 Demo,需要两名工程师连续投入约一个月,编写约 2000 至 3000 行任务代码。而在 RoboRSI 的框架下,同样级别的能力构建在一天内就走完了一个完整闭环。显而易见,在优秀的基模上,配合运行良好的系统框架,新场景的适配成本会被大幅压缩。穹彻智能用 RoboRSI 给了我们一个解法。系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,那么适配一个新场景的核心成本就从“工程师驻场数周”变成了“设定目标 + 系统自主迭代 + 人工审核和安全把关”。这种变化也为家庭等高度个性化的场景打开了新的商业空间。每个家庭的户型、家具布局和物品摆放都不同,如果每次部署都需要工程师驻场数周,服务成本就很难支撑大规模推广。RoboRSI 提供了一种可能:在通用能力的基础上,通过现场反馈自主迭代,逐步学会适合这个家庭的清理路径和操作技能。家具移动、物品更换后,也有机会沿用同一套机制完成适配,减少重新开发的工作。类似的需求也存在于布局各异的门店、办公室和小型仓储空间。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。当然,一次实验中的“一天迭代”还不等于任意场景都能一天部署,但能够率先把新场景的适配周期和人力成本大幅压缩,其商业价值将不可估量。

GPT-6 之后,具身智能公司该何去何从?行业里有一种观点,我们深以为然。仅在语义基座上做微调改造得到的具身模型,容易遭遇 GPT-6 的降维冲击。GPT-6 Astra 告诉我们,当模型的通用能力足够强,许多看似需要专门设计的功能会被“涌现”出来。基模解决了“理解”的问题,但从理解到持续稳定地执行,中间还有一层系统级的能力需要构建。我们认为,这正是具身智能公司不可替代的价值之一。第一,经验的结构化管理与复用。GPT-6 可以理解一个任务,但它不管理这个任务在多轮执行中积累的经验。第二,行为边界与安全约束。机器人在物理世界中操作,错误的代价远高于软件世界。本质上,我们需要一个 Agent 的行为约束框架,让自进化在可控的范围内发生。第三,部署后的持续迭代能力。真实世界的场景永远在变。新物体、新布局、新的失败模式会不断出现。能够在部署之后继续从真实执行中学习、积累、改进的系统,才是长期竞争力的来源。而穹彻证明了,一套设计得当的自进化框架,可以让机器人在部署之后持续沉淀经验,持续进化。当模型层的 RSI 和系统层的 RSI 最终合流,具身智能有望进入一个新的阶段:机器人不仅能完成人类教给它的任务,还能从每一次真实执行中发现人类尚未构建的解决方案。对具身智能公司而言,下一阶段的机会,是把不断增长的模型能力,变成用户在真实世界中用得起来、用得长久的机器人能力。在这一方面,穹彻智能还将探索 RoboRSI 和不久前发布的 Noe-0 世界动作模型协同,突破机器人能力边界、走向真实应用。强大的基础模型已经到来,具身智能行业改变与破局的关键节点也已迫在眉睫。

最新快讯

2026年09月22日

16:54
9月22日,港股三大指数集体收涨,实现连续第三个交易日上涨。恒生指数涨0.18%,国企指数涨0.28%,恒生科技指数涨0.34%。盘面上,大型科网股涨跌不一,腾讯大幅上涨5%表现最强,阿里巴巴张近2%,快手、京东涨超1%,美团、小米跌超1%;受隔夜纳指创新高及Meta引爆AI交易情绪带动,存储概念、半导体板块强势,澜起科技、天数智芯等涨幅居前,海致科技集团涨...
16:54
截至发稿,南向资金今日净买入港股金额已突破100亿港元大关。这已是南向资金连续第12个交易日净流入港股市场,显示出内资对港股配置价值的持续认可。这意味着什么?先看看历史数据,南向资金单日破百亿,往往对应港股阶段性底部区域,后续常伴随修复行情。目前在估值方面,AH溢价指数为124.01点,处于历史中低位分位,港股相对A股仍具价格吸引力。恒生指数PE-TTM约1...
16:54
财政部发布数据,8月份,全国共销售彩票639.85亿元,同比增加105.84亿元,增长19.8%,主要是足球世界杯对竞猜型彩票销量拉动作用仍在持续。其中,福利彩票机构销售158.09亿元,同比减少14.65亿元,下降8.5%;体育彩票机构销售481.76亿元,同比增加120.49亿元,增长33.4%。1-8月累计,全国共销售彩票4784.31亿元,同比增加5...
16:54
9月22日,在2026年云栖大会上,千问正式宣布将加速打造Personal Agent。千问产品负责人郑嗣寿表示,自上线以来,让每个人拥有专属的AI助理始终是千问的核心目标。依托Qwen 3.8系列模型强大的Agentic能力,千问正在构建全新的Personal Agent形态,致力于为3亿用户提供持续、个性化的智能服务。 当日,千问公布了Personal ...
16:15
鼓狮财经9月22日讯,加拿大外交部长阿妮塔·阿南德当地时间21日透露,加拿大正考虑利用太平洋沿岸的液化天然气资源,与法国开展能源合作。阿南德在联合国大会期间接受采访时指出,利用西海岸的液化天然气与欧洲国家合作是“完全可行的”,其中“法国尤为合适”。此前,加法两国领导人于20日举行了会晤,期间重点讨论了能源合作等相关议题。
16:14
持续的地区冲突与外部军事压力正严重冲击伊朗经济。伊朗统计中心9月20日公布的数据显示,波斯历第一季度(2026年3月21日至6月20日)伊朗国内生产总值(GDP)同比大幅下滑10.1%。这一衰退正值伊朗与美国和以色列交战之际,作为经济支柱的石油和天然气行业遭受重创。具体来看,油气行业同比暴跌26.4%,跌幅最为显著;工业与采矿业萎缩14.7%,服务业下降4....
16:14
9月22日,A股市场主要指数呈现涨跌互现的态势。截至收盘,上证指数微涨0.06%,报3952.13点;深证成指微跌0.05%;创业板指上涨0.01%;科创50指数表现较好,涨幅达0.46%;北证50指数下跌1.07%。全市场成交额达到2.15万亿元,较前一交易日放量1055亿元,但个股普跌,超过3000只个股收跌。 盘面上,科技与医药板块表现活跃。半导体板块...
16:14
你见过会撒娇、能卖萌、还擅长社交的毛绒玩偶吗?最近,小红书上,一个名为 Fuzozo(芙崽) 的毛绒玩具火了,它不是泡泡玛特的盲盒,也不是传统的玩偶,而是一个会聊天、有性格、能“长大”的 AI 玩具。数据显示,Fuzozo 非常受欢迎,上线仅一年多时间售出 30 万件,销售额超 1.2 亿元。有人称它“AI版Labubu”,因为它...
16:14
过去半个月,月之暗面接连落子:先是传出与微软、亚马逊、谷歌谈判分成,开启开源模型的海外“收租”模式;紧接着又以FDE模式(前线部署工程师)启动企业合作伙伴计划,由合作的IT服务商和集成商前往客户现场,协助企业将AI部署至核心业务。上周,月之暗面又推出一套金融行业解决方案,整合面向金融行业的产品能力,以及机构级的数据建模和报告交付能力。 单看每一箭,都不算新鲜...
16:14
仅仅一个月,人工智能就给数学界带来了巨大的震撼。9月22日,OpenAI宣布成立专门的数学家顾问小组,旨在应对AI在数学领域的惊人进化速度。公告指出,此前曾解决过“千禧年难题”的内部模型,在短短22个工作日内,横跨数学大多数领域解决了100多个长期开放问题。回顾9月初,该模型通过启用约1万个并发Agent,仅用88小时就攻克了七大千禧年难题之一的“纳维–斯托...
16:14
刚刚,马斯克旗下的xAI正式发布了全新主力模型Grok 4.7。其核心卖点主打“同样的价格和速度,提供超强性能”。马斯克第一时间宣称,Grok 4.7让xAI在智能体编程领域跃居第三,仅次于Anthropic和OpenAI。凭借速度快、价格低,Grok 4.7成为了个人进行生产力工作的首选。官方将其定位为“史上最强Grok”,专为编程和知识工作而生。在编程和...