7月28日,通用具身基础模型公司智在无界正式发布了Being-H0.8,这是一款全球首个隐式触觉世界动作模型。Being-H0.8首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作及未来状态变化统一映射到同一隐空间中。这使得机器人不仅能理解“看到了什么、做了什么、接触到了什么”,还能进一步理解“世界因此发生了怎样的变化”,从而具备对物理交互过程更完整的认知与预测能力。智在无界是业内率先提出利用大规模人类视频数据训练通用具身基础模型的团队。经过从Being-H0到Being-H0.8的持续迭代,该团队已积累了超过50万小时的第一人称视频原始数据,并与数十家数据合作伙伴建立了合作关系。然而,数据规模仅是起点。真正决定模型能力的,是数据能否准确、有效地描述动作、接触与交互。为此,智在无界已构建起从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施体系。这套体系能够推动规模化数据持续沉淀、模型能力持续进化,并让机器人不断走向开放、复杂的真实物理世界。
基于此,智在无界构建了高质量人类交互数据库UniHand 3.0。该数据库涵盖了自然物体交互、长时程任务、丰富手部动作及多样化场景,为具身基础模型提供了规模化、高质量的人类交互经验。UniHand 3.0不仅是目前国内规模最大的人类视频数据集,也标志着全球范围内首个针对如此大规模人类视频数据应用并系统分享数据来源等关键信息的团队。这为人类视频数据在具身智能领域的规模化使用提供了极具参考价值的实践路径。
智在无界创始人卢宗青表示:“Being-H0.8代表着一个重要节点,它不仅是模型能力从视觉到触觉、从观察世界到理解交互的进化,更预示着一个集视觉理解、触觉交互、动作生成、世界预测及跨本体泛化能力于一身的具身基础模型即将诞生。我们正迈向全新的1.0时代。接下来,智在无界将以前所未有的训练范式,加速通用具身基础模型的到来。”
**创新点一:在预训练阶段即引入触觉信息的具身基础模型**
相较于前代Being-H0.7,Being-H0.8的核心突破在于首次将触觉模态系统性地引入隐式世界模型架构,这也是首个结合大规模人类视频与触觉信息开展预训练的具身基础模型。触觉的加入使模型能够感知视觉难以直接观测的接触状态、受力变化与物体约束,从而完成一系列仅依赖视觉难以稳定解决的接触密集型任务。为充分利用高频触觉反馈,Being-H0.8进一步提出了慢快动作专家机制。在标准的完整动作块生成机制之上,模型引入了一条轻量级的快速更新流:系统首先在每个动作时域开始时计算“世界—动作上下文”并缓存;随后,在时域内的少数锚点处,注入最新观测到的本体状态与触觉反馈,动态生成或修正当前正在执行的动作片段。这一机制既保留了动作块预测的整体规划能力与计算效率,又能根据接触过程中的实时反馈快速调整动作,为精密抓取、插拔、旋拧、装配等接触密集型操作提供更高的稳定性与响应速度。
**创新点二:自主研发TactoHand,让触觉数据的规模化应用成为可能**
触觉是灵巧操作中最关键却长期缺席的感知模态之一。人类在许多操作中必须通过触摸判断物体是否接触、是否滑动以及施力是否合适,触觉能直接反映接触位置、接触范围、受力状态以及物体与手部之间的空间关系。这些信息往往无法仅通过视觉可靠获得。然而,现有触觉传感器和数据采集系统普遍成本高昂,采集流程也高度依赖专用硬件、触觉手套和受控实验环境。数据采集人员通常难以摆脱实验室场景的限制,更难以在真实世界中覆盖足够多样的物体、任务和交互方式。因此,触觉数据始终难以达到基础模型预训练所需的规模。
针对这一瓶颈,智在无界自主研发了面向大规模无标注人类视频的密集触觉伪标签系统TactoHand。该系统无需为数据采集者配备触觉手套或额外传感器,即可从普通人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度,以接近零边际成本的方式为海量视频补充触觉监督。基于TactoHand,智在无界首次将触觉信息扩展至超过50万小时的人类视频,并将其用于具身基础模型预训练。这使得触觉数据第一次从昂贵、稀缺的实验室信号,转变为可以大规模生产和利用的预训练资源。
**创新点三:采用创新性TopoHand架构,打通人手、灵巧手与平行夹爪的动作空间**
智在无界是最早开展大规模人类视频预训练的团队之一,也较早意识到:要将人类操作知识有效迁移至机器人,关键不仅在于扩大数据规模,还必须解决人手、灵巧手、平行夹爪等异构本体之间的动作空间不一致问题。在Being-H0.5中,团队首次提出统一动作空间UAS,通过预定义语义槽位,将末端位姿、夹爪开合、手指关节和机器人状态等不同控制变量映射到共享表示中,从而支持30余种异构机器人本体。然而,第一代UAS主要依赖动作槽位及其掩码实现跨本体兼容,尚未从运动学结构层面统一人手与不同机器人末端执行器。
在Being-H0.8中,团队进一步提出第二代统一动作空间TopoHand,为人类手部、灵巧手和平行夹爪提供统一的运动学接口。TopoHand采用固定拓扑的“螺旋手”表征,由20个语义关键点和20个规范关节变量组成,并以手腕为中心建立统一坐标系:X轴指向中指指尖在手掌平面上的投影方向,Z轴与手掌法线方向一致,Y轴则用于构成右手坐标系。在这一表示下,不同本体特有的关节命名、机械结构和网格拓扑均被隔离在策略接口之外。模型不再直接依赖某一具体机器人或人手模型的原始关节定义,而是在统一的语义拓扑和运动学空间中学习操作规律。相比第一代UAS,TopoHand不仅实现了控制变量层面的兼容,还进一步消弭了人手、灵巧手和平行夹爪之间的结构差异,使大规模人类视频中的操作先验能够更加高效地迁移到多种机器人本体,并显著提升跨本体预训练的效率与可扩展性。
**结语**
在一年左右的时间里,智在无界已围绕“大规模人类视频预训练”完成多个关键里程碑:相继发布了基于数千小时、超万小时、20万小时、50万小时人类视频预训练的具身基础模型。这几代模型的持续演进,分别回应了通用具身基础模型在不同发展阶段所面临的核心数据问题:人类视频如何使用?如何规模化地应用人类视频进行模型预训练?又如何从数据中提炼高质量信息,持续驱动模型进化?接下来,我们面对的是一个更宏大、更关键的时代命题:“什么样的训练范式,能够加速通用具身基础模型的到来?”迈向全新的1.0时代,智在无界将致力于给出自己的答案。
