AGIBOT WORLD 2026 作为首个覆盖具身智能全域研究的开源数据集,依托丰富的真实场景,围绕五大具身领域构建,每个主题均配备了专属采集方法与精细化标注体系,旨在精准满足不同细分领域研究者的需求。继前两期模仿学习与多样交互数据集之后,本期重点面向强化学习领域,开放了机器人从专家示教、真实部署到人工纠正过程中产生的多类真实交互经验数据。
过去几年,大规模专家示教数据推动了机器人模仿学习的快速发展,使机器人学会了“面对任务应如何操作”。然而,进入真实环境后,机器人采集的数据并不总是标准答案:既有成功也有失败,既有偏差也有恢复,既有自主执行也有人类接管。这些真实交互记录了模型的能力边界、失败状态、有效行为及纠正过程,是单纯的专家示教无法提供的宝贵经验。因此,机器人不仅要学习他人如何成功完成任务,更要学会利用自身与真实世界交互产生的经验进行优化。
为此,智元正式发布 AGIBOT WORLD 2026 第三期开源强化学习数据集。该数据集完整覆盖了从示教到部署的各个阶段:专家示教提供任务的标准示范;人类在环纠正轨迹记录了模型执行出错时人类的接管与纠正;部署推理轨迹则记录了模型真实部署执行产生的成功与失败结果。在此基础上,数据集进一步标注了进度、错误、成功与干扰等关键信息,研究者可据此训练不同维度的奖励模型,将轨迹级的成败细化为过程反馈,为真机强化学习的研究提供可复用的数据基础。
本期首批开源数据包含 11,430 条轨迹,其中 1,024 条为成功 Rollout 轨迹,1,369 条为失败 Rollout 轨迹,并提供了丰富的细粒度标注。我们旨在降低真机强化学习中积累执行反馈的成本,让不同团队能够在同一批真实轨迹上复现实验、比较方法,并将分散在各场景中的经验沉淀为公共资产。
本期首批数据聚焦工业与家居等真实场景,设计了网线插接、钥匙开门等 14 类交互任务,覆盖精细操作、复杂长程和强接触等不同类型。数据采集贯穿示教、部署与纠正三个阶段:专家示教轨迹由人类操作员完成标准执行;部署推理轨迹由模型执行并记录结果,成功展示能力,失败暴露边界;人类在环纠正轨迹则记录模型自主推理执行后,人类在策略偏差时进行的接管与纠正,并保留了接管前的行为、时机及纠正动作。这三类轨迹共同构成一条完整的数据链路,从标准示范、纠错记录到独立验证,全方位记录机器人的实战表现。
强化学习需要的不是“机器人做了什么”的笼统记录,而是“这一步做得怎么样”、“任务推进到哪一步”的精细反馈。本期数据集围绕真实执行过程,对成功、错误、接管、干扰等关键状态进行了细粒度标注,用户可据此识别风险与错误恢复过程。成功帧提供明确的任务达成信号,错误、干扰和风险区间帮助模型识别异常,接管区间记录人工介入时机,错误恢复区间则提供从错误到恢复的真实过程。
基于首批开放的近万条轨迹,本期数据集共包含 98,159 个子任务区间标注,每个子任务均带有完成状态标注;同时标注了 26,493 段干扰片段、5,795 段错误状态,以及 10,684 段人工接管。这些细粒度标注可进一步转化为强化学习所需的反馈信号,用于训练奖励模型、价值模型,支持任务进度预测、成功检测、错误识别、风险预警、接管提示以及错误恢复等研究。
对于具身智能而言,真正的技能并非复刻标准化动作,而是在动态真实环境中感知反馈、自主纠错、持续优化。模仿学习让模型从专家示教中学习任务,而强化学习则提供了另一条优化路径:利用真实执行反馈,判断哪些行为推动了任务、哪些状态存在风险,并将这些判断转化为可供训练的奖励信号。AGIBOT WORLD 2026 第三期真机强化学习数据集完整留存了每一次物理接触、每一处执行偏差、每一轮人工修正,让真机强化学习拥有高质量、可复用、闭环式训练底座,助力机器人不仅学会“怎么做”,更要学会“如何做得更好”,加速行业从“实验室演示”走向规模化产业部署,迈进具身智能生产力新时代。
AGIBOT WORLD 2026 第三期:真机强化学习项目主页:agibot-world.com
开源地址:huggingface.co/datasets/agibot-world/AgiBotWorld2026
