9月21日,亮源新创正式发布了全身智能基础模型Light-O1。该模型通过学习互联网视频中的海量人类动作,并融合语言与视觉信息,成功将人类动作知识迁移至机器人,从而显著提升了机器人全身协调与任务执行的能力。这是亮源新创继规模化对齐与规模化部署之后,在Physical AI三段范式中的“规模化预训练”方向取得的重要进展。此外,Light-O1首次揭示了人类全身动作预训练的跨本体迁移扩展规律:预训练所用的人类动作数据规模越大,模型在适配不同机器人本体及视角后,动作预测的准确度就越高,这为利用大规模人类数据提升机器人通用能力提供了科学依据。
机器人预训练正从有限采集迈向海量人类行为。当前,机器人动作模型主要依赖遥操作或UMI等专用方式采集训练数据。然而,这种采集方式成本高昂、耗时漫长,且覆盖不同任务往往需要定制采集流程、组织培训人员,同时还要受制于设备成本与操作便捷性的限制。随着任务场景的增多,人员管理与采集组织的复杂性也随之上升。这些约束导致数据规模与行为多样性难以同步扩展,已成为制约机器人基础模型规模化发展的关键瓶颈。
针对这一瓶颈,亮源新创的Light-O1模型将数据来源拓展至互联网视频中已有的海量人类行为。这些视频记录了人类在不同环境中移动、操作物体、使用工具以及社交互动的全过程,在规模和多样性上有效补充了专项采集数据的不足,使预训练数据的扩展不再完全依赖人工组织的专项采集。
在技术路径上,Light-O1构建了涵盖数据构建、自回归预训练与机器人适配的完整体系。其核心在于从丰富的人类行为中提炼可复用的动作知识,并将其迁移至身体结构、观察视角及控制方式各异的机器人身上。具体实施步骤包括:首先将视频中的行为整理为统一的多模态动作数据,再通过大规模预训练形成关于“在何种情境下、如何行动”的先验知识,最后利用目标机器人的数据进行适配,从而将人类的行为经验转化为机器人的实际行动能力。
沿着这一路径,亮源新创进一步验证了人类全身动作预训练的跨本体迁移扩展规律。研究团队使用不同规模的基于视频构建的人类动作数据进行预训练,随后分别适配至第一视角人类采集数据、公开的人形机器人数据以及亮源自有机器人的全身移动操作数据,评估了预训练规模对动作预测能力的影响。结果显示,随着预训练数据规模的扩大,模型在目标领域适配后的动作预测更加精准:动作预测损失呈幂律下降趋势,离线开环评估中的全身姿态误差也随之降低。这充分证明,人类动作预训练带来的收益能够跨越本体差异,迁移至机器人的动作预测中。这一规律为未来进一步扩大人类动作数据规模、提升机器人通用动作能力奠定了基础。
基于规模化人类动作预训练与后续适配,Light-O1成功将指令理解、环境感知和全身行动连接起来,从真实场景中的全身协同操作以及面向用户意图的理解与行动两个层面,展现了通用全身智能的能力。在真实环境中,机器人能够协调全身持续完成任务。搭载该模型的自研小型人形机器人LightBot,能够自主完成递送毛巾、整理鞋柜归置拖鞋、捡拾垃圾等任务,将行动决策、移动导航和全身操作无缝衔接为连续的执行过程。面对执行失败、外界干扰以及物品类型和位置的变化,机器人能根据环境反馈与执行情况动态调整行动,必要时自主重试,体现了强大的抗干扰能力和对不同物品与空间的泛化能力。
在理解自然语言指令方面,Light-O1能够结合指令描述的情境,深入理解用户需求与隐含意图,推理出完成目标所需的身体姿态、动作顺序及约束条件,进而生成相应的全身动作。亮源新创同步在官网开源了通用动作生成模型Light-O1-Preview,用户只需表达目标,模型即可推导身体应如何行动,并展示相应的推理过程,让用户直观体验从“理解需求”到“生成行动”的完整链条。
围绕“规模化预训练—规模化对齐—规模化部署”的三段范式,亮源新创已相继取得成果,此次发布的Light-O1则进一步确立了规模化预训练方向的核心技术路径。至此,亮源新创在三段范式上的核心技术成果已全部落位,形成了从基础模型预训练、能力对齐到真实世界部署的完整技术链路。更重要的是,这套技术体系的价值在于建立了一条可持续扩展的Physical AI能力增长路径:基础能力通过规模化预训练不断积累,进入物理世界的能力通过规模化对齐持续增强,真实部署又进一步将模型带入更多任务、环境和机器人本体。三者相互衔接,使Physical AI不再依赖单点能力突破,而是具备从数据、训练到真实世界应用持续迭代的系统性技术路径。
