鼓狮财经7月31日讯,谷歌DeepMind近日发布了一款全新的人工智能模型,旨在赋予人形机器人全身协调动作的能力。这是谷歌将Gemini技术拓展至机器人领域的重要一步,致力于让机器人在复杂环境中具备推理与规划能力。
新系统名为Gemini Robotics 2,其核心突破在于实现了对整个人形机器人的全身控制,而非仅限于上半身。在演示视频中,该模型操控Apptronik公司的Apollo机器人,成功完成了穿过房间、拿起洒水壶并放置至架子、同时避开障碍物等一系列连贯动作。
除了Gemini Robotics 2,DeepMind还同步推出了Gemini Robotics ER 2。该模型充当机器人的“推理大脑”,负责规划多步骤任务及协调多机器人协作;而Gemini Robotics 2则负责将视觉和语言指令转化为具体的电机控制指令。两者协同工作,显著提升了机器人的自主性。
谷歌展示了机器人灵巧性的显著提升,例如在测试中,“拧下灯泡”任务的成功率达到了92%。然而,对于扎垃圾袋、封Ziplock密封袋等更为精细的操作,系统表现仍显不足,成功率相对较低。
此外,DeepMind还建立了一套新的安全评测基准,旨在测试机器人识别不确定情况及拒绝执行风险指令的能力。谷歌强调,相较于前代模型,Gemini Robotics ER 2是迄今为止最安全的版本,在指令遵循和避让人类方面表现更佳。
在发布计划方面,Gemini Robotics ER 2将通过AI Studio开发者平台开放,企业级平台也将提供私人预览;而Gemini Robotics 2及On-Device 2模型则将优先提供给早期合作伙伴及100多家受信任的测试机构。目前,谷歌正与Apptronik、Agile Robots SE以及Boston Dynamics等核心合作伙伴展开合作。
DeepMind机器人业务副总裁Carolina Parada表示,目标是构建一个被所有机器人使用的智能系统,将AI带入物理世界。然而,业务总监Kanishka Rao也坦言,距离实现媲美人类的灵巧性仍任重道远。当前机器人动作缓慢且谨慎,且学习效率远低于人类,往往需要经历多次尝试才能调整行为。
此次发布延续了谷歌在机器人领域的战略。此前,Alphabet曾收购多家初创公司并一度缩减业务,关闭了Everyday Robots部门。如今,面对OpenAI和英伟达在机器人AI领域的积极布局,谷歌正重新激活这一战略,试图在通用机器人基础模型和开发平台方面抢占先机。
