具身智能赛道持续吸引资本关注,各类榜单层出不穷。然而,当“第一”几乎成为行业标配时,榜单的公信力正面临严峻考验。不久前,千寻智能就经历了尴尬时刻。6月初,其基座模型Spirit v1.6在RoboArena榜单上以1918分超越英伟达Cosmos3的1880分,一度登顶“世界第一”。紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计融资近50亿元,创下行业融资频率新高。但这股热情很快遭遇冷水。业内对评测数据的质疑声四起,有观察者指出,在310次评测记录中,有72%的分数来自两个特定账号。随后,RoboArena官方调查后移除了存疑数据,Spirit v1.6也随之被除名。

这一事件并未浇灭玩家热情。近半年来,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明等头部公司几乎每家都宣称拥有“第一”,且维度各不相同。这或许不难理解,当前技术路线尚未统一,真机成功率多在五六成,外界很难直接判断企业实力,榜单便成了重要参考。但当榜单发布方混杂(高校、机构、媒体),且涉及商业利益时,它还能否作为客观的“尺子”,成为了一个大问题。一位投资人坦言,榜单更多是市场行为,是投资决策的参考,千寻事件并不意外。在他看来,真正在意排名的往往是地方引导基金或国资资金,“第一”是他们报告里的亮点。但也有投资人认为,在技术门槛高、信息不对称的早期,榜单提供了横向比较的起点。

当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?

01. 技术路线还没统一,先人手一个“第一”

我们先来梳理目前市面上的榜单,建立一个大致印象。据不完全统计,具身智能的活跃榜单高达20余个。按评测内容,这些榜单大致可以分成三类。VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces;世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench;专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin 2.0、SimplerEnv、LIBERO和CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。

有了这层坐标,近半年具身基座模型的战报就能对号入座。今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。

而乱象,也是从各种榜单开始的。最明显的是,榜首像流水席,“第一名”更换频繁。RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。

更让人迷惑的是,同一个榜里会同时冒出好几个“第一”。World Arena就是典型,智元GE-Sim 2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。

三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。

02. 一个“第一”是怎么造出来的?

既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。

成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一”,核心是省掉关键限定词。比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。

第二种方式是利用“刷题”等方式直接干预结果。一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。有从业者表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子:一是评测者身份无门槛,任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高;二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A是固定的,B是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上;三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。

这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。

03. 去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。

更深一层的问题是,这个行业目前还没有一把“通用的尺子”。具身智能从业者用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。

不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。

综合业内共识,真正可信的榜单,大体同时具备三个特征。一是分项透明,不是只甩一个“第一”。不论是综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测由第三方掌控,且有反刷题设计。MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

三是看评测机制,而不是看更新频率。更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。

但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?答案在于行业当下的阶段。眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

最新快讯

2026年07月22日

21:52
7月22日,据鼓狮财经报道,东北制药(000597.SZ)发布公告称,公司已正式收到国家药品监督管理局核准签发的《化学原料药上市申请批准通知书》,获批生产玛巴洛沙韦原料药。该药品为抗流感病毒药物,主要适用于成人和儿童流感患者。此次获批将有助于丰富公司产品管线,增强市场竞争力,但具体投产销售时间及实际销售情况仍存在不确定性。
21:52
鼓狮财经7月22日讯,长江证券(000783.SZ)发布公告,董事长刘正斌提议使用公司自有资金,通过集中竞价交易方式回购股份。本次回购金额不低于1亿元,不超过2亿元。回购资金将主要用于实施员工持股计划、股权激励,或用于维护公司价值及股东权益。
21:51
7月21日至22日,国务院国资委举办中央企业负责人研讨班。会议强调,要高质量实施新一轮国资国企改革方案,推动改革工作向纵深发展。 在改革重点上,会议提出明确要求:在主业管理方面,需进一步优化企业功能分类;在重组整合方面,要确保新组建企业起步即加速。在深化公司治理方面,要加强党委(党组)前置研究的实质把关,差异化完善二、三级子企业董事会建设;同时要强化经理层成...
21:51
今日,多家A股公司密集披露2026年半年报及业绩预告,业绩表现亮眼。其中,益生股份净利暴增近49倍,联讯仪器、南网数字净利最高预增均超9倍,中微半导净利增逾九成,贝达药业、奥浦迈等公司亦有预增公告。 以下是详细情况: 益生股份:上半年净利同比增4897% 公司公告称,2026年上半年实现营业收入16.97亿元,同比增长28.44%;归属于上市公司股东的净利润...
21:15
鼓狮财经7月22日讯,好上好(001298.SZ)发布公告称,公司于7月22日收到深交所上市审核中心出具的审核中心意见告知函。深交所审核确认,公司符合发行条件、上市条件及信息披露要求。目前,公司后续将向证监会履行注册程序。值得注意的是,该事项尚需获得证监会的同意注册,最终结果仍存在不确定性。
21:15
据鼓狮财经7月22日报道,保加利亚议会当日通过表决,批准美军在2026年7月24日至10月1日期间,于贝兹梅尔空军基地驻扎。具体部署内容包括最多8架美国空军KC-135空中加油机及其机组人员、最多250名配备个人武器的士兵,以及相关机场设备。 7月21日,保加利亚外交部证实已收到伊朗驻保加利亚大使馆发出的外交照会,内容涉及美军可能在该基地部署加油机一事。对此...
21:15
据刚果(金)卫生部7月22日发布的消息,该国埃博拉疫情累计死亡病例已达999例。本轮疫情由本迪布焦型埃博拉病毒引发,截至目前,刚果(金)与乌干达两国累计报告的死亡病例已超过1000例。 根据刚果(金)卫生部截至7月20日的统计,该国共报告确诊病例2473例,死亡999例。同期,乌干达卫生部数据显示,该国累计确诊病例为20例,其中2例死亡。 目前,刚果(金)共...
21:15
过去两年,人们热议AI时代需要什么样的人才,却鲜有人深究:AI时代到底需要什么样的教育?这个问题无人敢轻易作答,但硅谷的科技与金融精英们,早已用真金白银投出了答案。这两年,硅谷悄然兴起一股反常趋势:一群最信奉科技的人,正砸下数十万美元,将孩子送入一种“非典型”的新式学校。它们有一个共同的名字——替代教育。 这些所谓的替代教育,学费高昂得令人咋舌。今年秋天,曼...
21:15
2026世界人工智能大会的整体基调相较往年显得更为务实。本届大会以“智能伙伴 共创未来”为主题,在百余场论坛与活动中,超过10%的场次聚焦于智能体领域,大会遴选的十款“镇馆之宝”中亦有四款为智能体相关产品。作为行业发展的风向标,WAIC释放出新的信号:当前AI产业正告别参数与算力至上的“上半场”,全面驶入智能体落地、服务实体产业的“下半场”。 第一,产业技术...
20:44
7月22日,速达股份发布公告称,公司董事会秘书兼财务总监谢立智基于对公司未来发展前景的坚定信心及对公司价值的认可,决定提前终止原定的减持计划。谢立智同时承诺,自公告披露之日起六个月内,不再减持其持有的公司股份。截至公告披露日,谢立智在此次减持计划执行期间未进行任何减持操作,其持股数量及比例均保持不变。
20:44
据鼓狮财经7月22日报道,杭氧股份发布公告称,董事长郑伟提议在符合相关法律法规及《公司章程》规定的利润分配政策前提下,以2026年度中期分红股权登记日的总股本为基数,实施2026年度中期利润分配,且分配金额不低于公司2026年半年度归属于上市公司股东净利润的30%。
20:44
据鼓狮财经7月22日消息,永和股份(605020.SH)发布公告,宣布已取得中国工商银行衢州分行出具的股票回购专项贷款承诺函。根据该函件,银行承诺提供不超过2.7亿元的贷款,贷款期限为3年,资金将专项用于公司股份回购。 此前,永和股份已制定股份回购计划,拟动用资金1.5亿元至3亿元,用于实施注销减资及员工持股计划。