人形机器人加速落地已成为行业共识。尽管围绕“大脑”能力的补强已持续一段时间,但业内逐渐意识到,仅拥有理解与决策能力并不等同于掌握了可执行的技能。从认知到动作之间,机器人仍需完成动作策略生成、本体适配及反馈修正等关键环节。本届WAIC上,多家具身智能“深圳军团”企业纷纷展示了解决方案,试图缩短模型能力到真机执行的链路。
跨维智能将这一距离前移至数据端。在WAIC上,该公司发布并开源了Aligned DexWorld数据集。该数据集旨在解决具身智能训练中的异构问题,将真人示教、真机遥操和仿真合成等多源数据,统一映射到三维物理空间与时间序列中。跨维智能指出,不同来源的数据在视角、本体构型和动作空间上存在差异,未经对齐的混合训练甚至可能产生负迁移。除对齐数据外,该公司还展示了仿真引擎DexVerse的生成式仿真能力,通过持续生成多样化的物体姿态、场景布局和交互任务,为世界模型提供更广阔的训练空间。现场演示的手机装盒和商超扫码任务,直观呈现了技术效果。面对物料偏移或瓶型随机变化,机器人能灵活重规划动作,完成精准抓取与放置。简而言之,跨维智能试图通过统一数据的物理语言,让模型能力更顺畅地迁移至真机。
智平方则更关注如何将认知、协调和执行串联成闭环。其WAIC展出的AlphaBot 2搭载了NeuroVLA类脑大模型。按照设计,该模型将控制体系分为“皮层-小脑-脊髓”三个层次:皮层负责语义理解和任务规划,小脑负责高频运动协调与动态修正,脊髓负责毫秒级运动执行和安全反射。由于高层任务规划无法直接转化为连续关节动作,机器人需在执行中持续感知环境与自身状态,在目标变化或动作失败时动态调整,并维持长流程任务的时序信息。智平方强调的主动感知、故障自恢复和时序记忆,正是为了打通这些环节。在PCB上下料任务中,AlphaBot 2需面对不同型号、尺寸的PCB以及透明反光托盘,连续完成托盘取料、上下料、移动运输和双臂协同等动作,这考验了感知、任务规划、动态修正与运动执行之间能否形成闭环。
乐聚机器人则试图通过后训练,补上通用模型与具体岗位技能之间的距离。作为以本体和运动控制见长的人形机器人企业,乐聚没有选择从头训练通用具身基模,而是利用上游模型企业的预训练成果,结合自身机器人本体和工业场景开展垂域后训练、本体适配和真机评测。乐聚技术负责人王强将这一过程比作给机器人开设“技校”:基础模型解决认知广度,后训练则让机器人围绕具体岗位学习技能。以快递分拣为例,蚂蚁灵波的LingBot-VLA 2.0已通过预训练掌握识别物体、理解指令和基础抓放等能力;乐聚进一步采集300条任务数据进行后训练,使模型学习不同包裹在具体环境中的识别、抓取与分类方法,并部署至夸父机器人完成真机任务闭环。据悉,乐聚已将数据处理、代码适配、模型后训练和真机部署测试等流程封装为后训练工具链。此次展出的纸箱拆垛、塑料箱拆垛和小件上料,也对应了这套转化路径。展会期间,夸父机器人连续三天每天接近10小时不间断完成任务,机器稳定性出现了初步量变突破。
逐际动力则将认知到执行的链路进一步拆分为Sys2认知层、Sys1技能层和Sys0运控层。认知层负责理解任务和作出决策,技能层承接具体能力,运控层则负责将其落实为本体动作。逐际动力此次展示的Oli机器人搭载COSA人形大脑系统和WBT全身运动基础模型。其中,WBT能够实时追踪机器人全身关节,并在动作执行过程中维持平衡。现场动捕演员连续完成深蹲、太极和舞蹈等动作,Oli则进行实时复现。与单个预设动作相比,这一演示更侧重展示长程动作如何被映射至机器人本体并稳定执行。在操作端,逐际动力还展示了搭载COSA系统的TRON2双臂机器人。现场,TRON2通过视觉感知和语音交互,自主抓取糖果并递送给用户,呈现出机器人从感知、技能生成到底层执行之间的衔接。
可以看到,随着人形机器人产业的可见度不断提升,行业内外的期待也在持续拉高。人形机器人企业的展示无疑都在试图回应同一个问题:如何在技术路径尚未完全收敛的情况下,跨过实用性的门槛。但WAIC的演示仍不同于规模化应用。人形机器人面对新任务需要多少数据、训练和适配周期多长,技能能否跨本体、跨场景复用,以及在长期运行中能否保持稳定,仍需更多真实项目验证。
