具身智能赛道持续吸引资本关注,各类榜单层出不穷。然而,当“第一”几乎成为行业标配时,榜单的公信力正面临严峻考验。不久前,千寻智能就经历了尴尬时刻。6月初,其基座模型Spirit v1.6在RoboArena榜单上以1918分超越英伟达Cosmos3的1880分,一度登顶“世界第一”。紧接着,千寻宣布完成15亿元A+轮融资,三个月内累计融资近50亿元,创下行业融资频率新高。但这股热情很快遭遇冷水。业内对评测数据的质疑声四起,有观察者指出,在310次评测记录中,有72%的分数来自两个特定账号。随后,RoboArena官方调查后移除了存疑数据,Spirit v1.6也随之被除名。

这一事件并未浇灭玩家热情。近半年来,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明等头部公司几乎每家都宣称拥有“第一”,且维度各不相同。这或许不难理解,当前技术路线尚未统一,真机成功率多在五六成,外界很难直接判断企业实力,榜单便成了重要参考。但当榜单发布方混杂(高校、机构、媒体),且涉及商业利益时,它还能否作为客观的“尺子”,成为了一个大问题。一位投资人坦言,榜单更多是市场行为,是投资决策的参考,千寻事件并不意外。在他看来,真正在意排名的往往是地方引导基金或国资资金,“第一”是他们报告里的亮点。但也有投资人认为,在技术门槛高、信息不对称的早期,榜单提供了横向比较的起点。

当“第一”的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?

01. 技术路线还没统一,先人手一个“第一”

我们先来梳理目前市面上的榜单,建立一个大致印象。据不完全统计,具身智能的活跃榜单高达20余个。按评测内容,这些榜单大致可以分成三类。VLA操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是RoboChallenge Table30、MolmoSpaces;世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是World Arena和WorldModelBench;专项基准榜,考察“极端情况下会不会露馅”,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是RoboTwin 2.0、SimplerEnv、LIBERO和CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。

有了这层坐标,近半年具身基座模型的战报就能对号入座。今年5月,星动纪元Era0宣称拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨维DSCFuncWorld是World Arena Track2第一。进入6月,千寻Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登顶MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。

而乱象,也是从各种榜单开始的。最明显的是,榜首像流水席,“第一名”更换频繁。RoboChallenge Table30的榜首,过去半年里至少换了四次:先是千寻Spirit v1.5以50.33%的成功率刷新纪录,很快又被极佳视界GigaBrain-0.1、美国波士顿动力Atlas、星动纪元Era0先后超越。这个速度,比大语言模型的主流榜单更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜单上的榜首位置,通常能守数月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月为换榜周期。“当下的具身智能,单个模型能霸榜一周就算不容易。”一家头部具身智能公司的从业者表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而MMLU这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像RoboChallenge的Table30,30项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的“保质期”于是被压到了以周计。

更让人迷惑的是,同一个榜里会同时冒出好几个“第一”。World Arena就是典型,智元GE-Sim 2.0、跨维DSCFuncWorld对外都称自己“登顶World Arena”,但事实是,这个榜单含有多条赛道,智元GE-Sim 2.0在Track1(感知与动作响应)以68.26分排第一,跨维DSCFuncWorld在Track2(数据引擎)排第一。“第一”分属不同个子榜,对外却被统一写成了同一句话。对不熟悉赛道划分的读者来说,两家并列的“World Arena第一”的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更模糊的地带是,榜单性质混杂,“第一”的含金量却被默认成同一档,容易产生误导。一些公司的对外口径里,经常会同时列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒体的测评中也位居第一”。前者是7×24小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。其中最模糊的是“产业榜”,有些榜单顶着“产业”二字,但既不是真机锁死的硬榜,也不是学术机构背书的benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,“双料第一”才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。

三种现象叠加,结果就是榜单“第一”严重通货膨胀。而且这种通胀不只停留在营销层面,一个“第一”的头衔往往能换来关注度、资源和实打实的估值溢价。

02. 一个“第一”是怎么造出来的?

既然榜单能撬动真金白银,如何把第一造出来,也形成了“潜规则”。业内人士介绍,虽然千寻Spirit v1.6属于极端个例,但行业里造“第一”的现象并不少,手法大致有三种。

成本最低、也最普遍的一种方式是话术包装,“单科第一”成了“总分第一”,核心是省掉关键限定词。比如实际拿的是“RoboTwin 2.0双臂协同VLA类Clean档第一”,对外就变成“登顶RoboTwin 2.0”;实际是“LIBERO-Plus场景泛化专项第一”,对外就成了“LIBERO-Plus榜首”。数据没造假、成绩也是真的,但“第一”所指代的范围被人为放大了。

第二种方式是利用“刷题”等方式直接干预结果。一条是“照着考题练”。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复“刷题”、过拟合到特定场景换来高分。有从业者表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和LLM领域的“数据泄露、数据污染”有本质区别。另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如RoboArena采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子:一是评测者身份无门槛,任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的Elo分数快速推高;二是匹配不强制全覆盖,随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A是固定的,B是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上;三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。事后,RoboArena补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于20%的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份“权威报告”,把媒体榜和学术benchmark并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。

这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,“第一”就成了。

03. 去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。

更深一层的问题是,这个行业目前还没有一把“通用的尺子”。具身智能从业者用“炒鸡蛋”和“拌凉菜”打了一个比方:机器人A擅长炒鸡蛋、成功率90%,机器人B擅长拌凉菜、成功率85%,但不能就此说A比B强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把“炒鸡蛋的能力”和“拌凉菜的能力”折算进同一个打分体系里。

不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。

综合业内共识,真正可信的榜单,大体同时具备三个特征。一是分项透明,不是只甩一个“第一”。不论是综合榜还是专项榜,可信的做法都是把细项一一拆开。以RoboChallenge Table30为例,它测的是30项日常任务的综合成功率,可信之处在于,不仅告诉读者64.33%这个综合数字,还让读者看到30项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测由第三方掌控,且有反刷题设计。MolmoSpaces不允许微调,模型直接“裸考”;LIBERO-Plus则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

三是看评测机制,而不是看更新频率。更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如RoboChallenge一次完整评测周期可能要数周,30项任务每项跑10次,一共300次真机尝试,7×24小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如RoboArena采用了Elo评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。

但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?答案在于行业当下的阶段。眼下这场“第一”的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,“第一”的通货膨胀会自然消散,榜单也会退回它本该在的位置。或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

最新快讯

2026年07月22日

22:56
鼓狮财经7月22日电,奥比中光(688322.SH)发布公告称,公司正在筹划在香港发行H股股票并计划在联交所挂牌上市。这一举措旨在深化全球化战略布局,构建国际化资本运作平台,同时拓宽多元化的融资渠道。目前,相关具体细节尚未敲定。值得注意的是,本次H股发行不会导致公司实际控制权发生变更。后续,该方案尚需提交董事会及股东大会审议,并需获得中国证监会及香港联交所等...
22:25
7月22日,鼓狮财经报道,恩捷股份(002812.SZ)发布公告,宣布拟采用集中竞价交易方式回购公司股份。本次回购金额不低于1亿元且不超过2亿元,回购价格上限为93元/股。 公告指出,回购的股份将用于实施股权激励计划或员工持股计划。回购期限自董事会审议通过之日起六个月内。
22:25
鼓狮财经7月22日讯,容百科技(688005.SH)披露了2024年半年度报告。数据显示,公司上半年实现营业收入87.21亿元,同比增长39.57%;归属于上市公司股东的净利润达到1.09亿元,成功实现扭亏为盈。 业绩回暖主要得益于海外客户订单放量、三元及钠电正极材料销量增长、磷酸锰铁锂产品满产满销,以及原材料价格上涨带来的成本传导。财务数据显示,第二季度单...
22:24
【热点】华电辽能澄清不涉及算电协同项目;立新能源表示无算力产业相关业务布局 【项目投资】金安国纪拟20亿元投建珠海国纪增资扩产项目;奥海科技控股子公司拟投建智新控制研发中心及生产基地 【业绩预告】南网数字预计上半年净利润同比增长1051.24%至1511.74%;奥浦迈预计上半年净利润同比增加约229% 【中标合同】平治信息预中标3亿元算力服务采购项目;许继...
22:17
《科创板日报》7月22日讯,继澜起科技与普冉股份之后,佰维存储成为本月第三家宣布回购方案的存储企业。7月22日盘后,佰维存储发布公告,由董事长孙成思提议以集中竞价交易方式回购公司股份。回购资金总额拟定为2亿元至2.5亿元,价格上限设定为不超过董事会决议前30个交易日均价的150%,或不超过558.44元/股。佰维存储强调,此次回购旨在维护公司价值和股东权益,...
21:52
7月22日,据鼓狮财经报道,东北制药(000597.SZ)发布公告称,公司已正式收到国家药品监督管理局核准签发的《化学原料药上市申请批准通知书》,获批生产玛巴洛沙韦原料药。该药品为抗流感病毒药物,主要适用于成人和儿童流感患者。此次获批将有助于丰富公司产品管线,增强市场竞争力,但具体投产销售时间及实际销售情况仍存在不确定性。
21:52
鼓狮财经7月22日讯,长江证券(000783.SZ)发布公告,董事长刘正斌提议使用公司自有资金,通过集中竞价交易方式回购股份。本次回购金额不低于1亿元,不超过2亿元。回购资金将主要用于实施员工持股计划、股权激励,或用于维护公司价值及股东权益。
21:51
7月21日至22日,国务院国资委举办中央企业负责人研讨班。会议强调,要高质量实施新一轮国资国企改革方案,推动改革工作向纵深发展。 在改革重点上,会议提出明确要求:在主业管理方面,需进一步优化企业功能分类;在重组整合方面,要确保新组建企业起步即加速。在深化公司治理方面,要加强党委(党组)前置研究的实质把关,差异化完善二、三级子企业董事会建设;同时要强化经理层成...
21:51
今日,多家A股公司密集披露2026年半年报及业绩预告,业绩表现亮眼。其中,益生股份净利暴增近49倍,联讯仪器、南网数字净利最高预增均超9倍,中微半导净利增逾九成,贝达药业、奥浦迈等公司亦有预增公告。 以下是详细情况: 益生股份:上半年净利同比增4897% 公司公告称,2026年上半年实现营业收入16.97亿元,同比增长28.44%;归属于上市公司股东的净利润...
21:15
鼓狮财经7月22日讯,好上好(001298.SZ)发布公告称,公司于7月22日收到深交所上市审核中心出具的审核中心意见告知函。深交所审核确认,公司符合发行条件、上市条件及信息披露要求。目前,公司后续将向证监会履行注册程序。值得注意的是,该事项尚需获得证监会的同意注册,最终结果仍存在不确定性。
21:15
据鼓狮财经7月22日报道,保加利亚议会当日通过表决,批准美军在2026年7月24日至10月1日期间,于贝兹梅尔空军基地驻扎。具体部署内容包括最多8架美国空军KC-135空中加油机及其机组人员、最多250名配备个人武器的士兵,以及相关机场设备。 7月21日,保加利亚外交部证实已收到伊朗驻保加利亚大使馆发出的外交照会,内容涉及美军可能在该基地部署加油机一事。对此...