• 隐私政策
  • 联系我们
  • 关于我们
2026 年 7 月 22 日 星期三
聚赢方舟
广告
  • 首页
  • 快讯 7x24
  • 行业新闻
  • 商业动态
  • 股市风云
  • 期货研报
  • 基金财讯
  • 贵金属
No Result
View All Result
  • 首页
  • 快讯 7x24
  • 行业新闻
  • 商业动态
  • 股市风云
  • 期货研报
  • 基金财讯
  • 贵金属
No Result
View All Result
聚赢方舟
No Result
View All Result
Home 行业新闻

人均第一,具身智能榜单能信吗?

by 聚赢方舟
1 天 ago
in 行业新闻
Reading Time: 2 mins read
A A
分享至微博分享给朋友


ADVERTISEMENT

文 | 定焦 One,作者 | 王璐,编辑 | 魏佳

具身智能赛道持续吸引资本目光的同时,各类相关榜单也越来越多。当 「第一」 几乎成为各家标配时,榜单还有可信度吗?

一个多月前,千寻智能就经历了尴尬时刻。6 月初,其具身基座模型 Spirit v1.6 在 RoboArena 榜单上以 1918 分的成绩超过了英伟达 Cosmos3 的 1880 分,一度位居 「世界第一」;紧接着,千寻宣布完成 15 亿元 A+轮融资,三个月内累计完成四轮密集融资,总额接近 50 亿元,创下具身智能赛道的融资频率新高。

不过,业内对评测数据的质疑几乎从次日就开始升温。有观察者指出,在 310 次评测记录中,有 72% 的分数来自两个账号。更值得关注的是,RoboArena 官方随后发布声明,经回溯调查后移除了部分存疑的评测数据,并更新了榜单排名。Spirit v1.6 也随之从榜单上除名。

但这一事件并未浇灭玩家们的热情,翻开近半年的行业新闻,星动纪元、原力灵机、极佳视界、智元、跨维、鹿明……几乎每一家头部公司手里都攥着一个 「第一」,且这些 「第一」 维度各不相同。

这一景象或许不难理解,具身智能目前技术路线还没统一、真机成功率大多卡在五六成,外界想判断一家公司到底行不行,很大程度上只能依赖榜单。可当发榜的既有高校、机构也有媒体,各家标准各不相同、有的还牵扯商单和利益关系时,榜单本身还能不能当尺子用,就成了一个问题。

一位关注具身赛道的投资人坦言,榜单更偏市场行为,最多算投资决策的一个参考,他对于千寻这件事并不吃惊。在他看来,真正在意名次的,往往不是以财务或技术为出发点的机构,而是一些地方引导基金或偏国资的资金,一个 「第一」,可能正是他们 「写在报告里一个比较好的入口」。但也有投资人持不同看法,他们认为在技术门槛高、信息不对称的早期赛道,榜单至少提供了一个横向比较的起点。

当 「第一」 的数量比认真做机器人的公司还多时,这些榜单到底是在测技术,还是在测讲故事的能力?哪些榜单还值得看?

01. 技术路线还没统一,先人手一个 「第一」

我们先来盘一盘目前市面上的榜单,建立一个大致印象。据不完全统计,目前具身智能的活跃榜单高达 20 余个。按评测内容,这些榜单大致可以分成三类。

VLA 操作综合榜,考察机器人能不能真干活,跑的是任务成功率,代表榜单是 RoboChallenge Table30、MolmoSpaces;

世界模型榜,考的是脑内推演对不对,考察模型对物理世界的推演,不考机器人手脚利不利索,代表是 World Arena 和 WorldModelBench;

专项基准榜,考察 「极端情况下会不会露馅」,针对单点极端能力,比如双臂协同、仿真到真机迁移,代表是 RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的价值在于,在综合榜照不到的极端场景里,把模型的短板逼出来。

需要说明的是,这三类榜单各有侧重、互不替代。真机榜测执行、世界模型榜测推演、专项榜测边界,没有任何一个能覆盖具身智能的全部能力。

有了这层坐标,近半年具身基座模型的战报就能对号入座。如果把近两个月具身基座模型的战报汇总,可以得到一份相当壮观的名单。

今年 5 月,星动纪元 Era0 宣称拿下 RoboChallenge Table30 第一;智元 GE-Sim 2.0 是 World Arena Track1 第一;跨维 DSCFuncWorld 是 World Arena Track2 第一。进入 6 月,千寻 Spirit v1.6 拿下 RoboArena 第一 (后被除名),鹿明 Prime R0 登顶 MolmoSpaces。几乎每一家都是第一,而且都有具体榜单排名作背书。

而乱象,也是从各种榜单开始的。

最明显的是,榜首像流水席,「第一名」 更换频繁。

RoboChallenge Table30 的榜首,过去半年里至少换了四次:先是千寻 Spirit v1.5 以 50.33% 的成功率刷新纪录,很快又被极佳视界 GigaBrain-0.1、美国波士顿动力 Atlas、星动纪元 Era0 先后超越。

这个速度,比大语言模型的主流榜单更新快得多。2023 年到 2025 年,GPT-4、Claude 3、Gemini 1.5 在 MMLU、GSM8K 等榜单上的榜首位置,通常能守数月甚至一年,即便是 2020 年到 2022 年的高速迭代期,GPT-3、PaLM 也是以月为换榜周期。「当下的具身智能,单个模型能霸榜一周就算不容易。」 一家头部具身智能公司的从业者米范表示。

其将主要原因归结为两点。一是物理世界的随机性,同一个模型在真机上跑两次,成功率差三到五个百分点很正常,光照、物体位置、机械臂公差都会影响结果,而 MMLU 这类大语言模型榜单是固定题目、确定性判分,同一模型跑一百次分数几乎不变。二是测试任务的公开程度,像 RoboChallenge 的 Table30,30 项任务分布是公开的,各家可以照着任务专门采数据、微调模型再提交,榜首的 「保质期」 于是被压到了以周计。

更让人迷惑的,是同一个榜里会同时冒出好几个 「第一」。

World Arena 就是典型,智元 GE-Sim 2.0、跨维 DSCFuncWorld 对外都称自己 「登顶 World Arena」,但事实是,这个榜单含有多条赛道,智元 GE-Sim 2.0 在 Track1(感知与动作响应) 以 68.26 分排第一,跨维 DSCFuncWorld 在 Track2(数据引擎) 排第一。「第一」 分属不同个子榜,对外却被统一写成了同一句话。

对不熟悉赛道划分的读者来说,两家并列的 「World Arena 第一」 的说法几乎无法分辨,甚至会怀疑是不是有人在撒谎,但其实谁都没说错,只是不够精确。

还有一层更模糊的地带是,榜单性质混杂,「第一」 的含金量却被默认成同一档,容易产生误导。

一些公司的对外口径里,经常会同时列出 「某模型在 RoboChallenge 排名第一」,和 「在某具身智能媒体的测评中也位居第一」。前者是 7×24 小时真机跑出来的成功率,后者可能只是编辑部闭门讨论、甚至商务合作敲定的名单,两者被并排放进一句话,含金量却被默认成了同一档。

其中最模糊的是 「产业榜」,有些榜单顶着 「产业」 二字,但既不是真机锁死的硬榜,也不是学术机构背书的 benchmark,而是咨询公司或媒体合办的打分榜。类似情况也在大语言模型圈出现过,但随着学术榜、商业测评、媒体榜逐渐分层,「双料第一」 才慢慢被拆掉,而具身智能,眼下正处在那个尚未分层的阶段。

三种现象叠加,结果就是榜单 「第一」 严重通货膨胀。而且这种通胀不只停留在营销层面,一个 「第一」 的头衔往往能换来关注度、资源和实打实的估值溢价。

02. 一个 「第一」 是怎么造出来的?

既然榜单能撬动真金白银,如何把第一造出来,也形成了 「潜规则」。业内人士介绍,虽然千寻 Spirit v1.6 属于极端个例,但行业里造 「第一」 的现象并不少,手法大致有三种。

成本最低、也最普遍的一种方式是话术包装,「单科第一」 成了 「总分第一」,核心是省掉关键限定词。

比如实际拿的是 「RoboTwin 2.0 双臂协同 VLA 类 Clean 档第一」,对外就变成 「登顶 RoboTwin 2.0」;实际是 「LIBERO-Plus 场景泛化专项第一」,对外就成了 「LIBERO-Plus 榜首」。数据没造假、成绩也是真的,但 「第一」 所指代的范围被人为放大了。

第二种方式是利用 「刷题」 等方式直接干预结果。

一条是 「照着考题练」。榜单公开的任务分布、评分标准、环境参数,都可以拿来做定向后训练,在一些任务相对固定的榜上尤其明显,各家可以通过反复 「刷题」、过拟合到特定场景换来高分。

米范表示,具身领域的部分榜单的测试任务是公开的,各家可以针对这些任务专门采集数据、微调模型后再提交,这在具身圈被视为正常迭代,不算作弊,和 LLM 领域的 「数据泄露、数据污染」 有本质区别。

另一条是钻评测机制的漏洞。有些榜权威性很高,机制却有空子可钻。比如 RoboArena 采用开放注册、分布式评测,本意是让更多人参与,却留下了三个空子。

图源 / RoboArena 官网

一是评测者身份无门槛。任何人都能注册当裁判,短期内大量新账号集中评测同一个模型,就能把它的 Elo 分数快速推高;

二是匹配不强制全覆盖, 随机分配对手不等于必须跟同期在榜者都打一轮,评测者领任务时,A 是固定的,B 是从分数相近的模型里随机抽,样本不够大时两个模型完全可能一次都排不上。比如 Spiritv1.6 早期与 DreamZero 交手,23 场后停战,与 5 月 30 日入榜的英伟达 Cosmos3-Nano-Policy 为零对战;

三是集中刷评,用多个账号密集评测自家模型,把负面记录降低。比如 Spirit v1.6 的 310 次评测记录中,72% 的分数来自于 ECUST 和 Robotics Lab 两个账号,它们用 224 场评测刷出 97% 胜率,把 Spirit v1.6 推上第一,但英伟达用同样条件自测 21 次,胜率 0%,两组数据摆在一起,直接让从业者产生怀疑。

事后,RoboArena 补了规则:评测者必须是无利益关联的第三方,堵住自刷账号的入口,评测完成率低于 20% 的账号标为可疑,堵住选择性匹配。而处理后,千寻跌出榜单。

还有一种方式最隐蔽也最泛滥,是资源置换,把榜单直接做成生意。

不少媒体榜评选标准并不透明,有的干脆与被评对象存在商务合作,双方联合发一份 「权威报告」,把媒体榜和学术 benchmark 并排包装。它不涉及技术,也不涉及数据,只涉及预算和关系。不止一位从业者表示,刷榜、买榜等现象并不少见。

这三种手法往往叠加,先靠针对性训练或钻空子把分数刷上去,再用赛道偷换掩盖来源,最后用话术对外传播,必要时再买个媒体榜背书。层层包装之下,「第一」 就成了。

这些手法在行业内部并不是秘密。真正的问题在于,看穿它们需要一定的技术功底,技术越复杂,外行越难分辨,故事就越容易讲。

03. 去掉水分,还该信什么?

不止一位具身智能从业者坦言,他们当下已经不太关注榜单排名了,因为榜单能刷、能买,即便一切合规,物理环境的复杂性也让数据很难做到百分百准确。

更深一层的问题是,这个行业目前还没有一把 「通用的尺子」。

具身智能从业者 gashero 用 「炒鸡蛋」 和 「拌凉菜」 打了一个比方:机器人 A 擅长炒鸡蛋、成功率 90%,机器人 B 擅长拌凉菜、成功率 85%,但不能就此说 A 比 B 强。炒鸡蛋考验抓取和翻锅,拌凉菜考验精准倒料和搅拌,两件事技能不同、难度不同、评价标准也不同。当下的具身智能赛道还没有一个统一标准,能把 「炒鸡蛋的能力」 和 「拌凉菜的能力」 折算进同一个打分体系里。

不过,这不代表榜单一无是处。从业者普遍认为,榜单仍有其参考价值,关键在于知道什么值得看,以及看完之后还该看什么。

图源 / RoboChallenge 官网

综合业内共识,真正可信的榜单,大体同时具备三个特征。

一是分项透明,不是只甩一个 「第一」。

不论综合榜还是专项榜,可信的做法都是把细项一一拆开。以 RoboChallenge Table30 为例,它测的是 30 项日常任务的综合成功率,可信之处在于,不仅告诉读者 64.33% 这个综合数字,还让读者看到 30 项里哪几项做得好、哪几项掉链子。只报总分、不报细项的榜,价值要大打折扣。

二是评测由第三方掌控,且有反刷题设计。

MolmoSpaces 不允许微调,模型直接 「裸考」;LIBERO-Plus 则加了光照突变、背景杂乱、相机角度变化等极端扰动,专门防止靠死记硬背拿分。它们的共同特点,是让刷题变难,让泛化成为真正的门槛。

三是看评测机制,而不是看更新频率。

更新慢的榜单不一定可靠,更新快的榜单也不一定可刷。有些榜更新慢,可能因为真机评测成本极高,比如 RoboChallenge 一次完整评测周期可能要数周,30 项任务每项跑 10 次,一共 300 次真机尝试,7×24 小时连续运行,这是物理世界的成本约束。而有些榜更新快,则是机制设计。比如 RoboArena 采用了 Elo 评分系统进行动态排名,每天都有新对战数据进来,排名自然每天更新。这种快本身不是问题,它的可信度取决于机制是否严密、漏洞是否被补上。

但是,既然圈内都知道榜单有水分,为什么大家还在拼命刷?

答案在于行业当下的阶段。

眼下这场 「第一」 的争夺战,本质上是资本焦虑的产物。今年是具身基座模型密集迭代的一年,早期赛道出货量、营收、订单量都不稳定,只能拿榜单顶上。融资导向的阶段没变,刷榜这件事就不会停。

当行业进入下一阶段,评判的标尺会自然切换,例如每年交付多少台、有哪些固定客户、是否能盈利。到那时候,「第一」 的通货膨胀会自然消散,榜单也会退回它本该在的位置。

或许,那些不忙着刷榜、只顾着把机器人送进产线的公司,才是行业真正的答案。

*应受访者要求,文中米范为化名。

聚赢方舟

专业财经网站

聚赢方舟 (arkxx.com) 网站是长沙聚赢方舟文化传媒有限公司旗下运营的财经资讯门户网站。聚赢方舟致力于为用户提供全面而深入的财经资讯与金融数据分析。网站汇集了最新的市场行情、股票动态、投资策略以及经济趋势,为投资者和财经行业人士提供及时的新闻参考。网站通过高效的数据处理与分析工具,聚赢方舟帮助用户把握市场机会,优化投资决策。

此外,网站还定期发布专业的市场评估报告和财经评论,确保用户能够获得最准确的市场洞察。

方舟日历

2026 年 7 月
一 二 三 四 五 六 日
 12345
6789101112
13141516171819
20212223242526
2728293031  
« 6 月    

标签

中国 中国企业 也不 买了 互联网 假日 养老金 北大 千元 印度 反超 奶茶 家族 工龄 怎么回事 或将 房价 房贷 新能源 新闻 日本 更大 有什么 村官 来了 楼市 江苏 沙特 浙江 特斯拉 电动车 石油 美元 美国 美籍 节日 芯片 让人 越南 长假 防晒 阿里 阿里巴巴 院士 首富

© 2025 长沙聚赢方舟文化传媒有限公司 by 聚赢方舟 - 湘 ICP 备 2025135270 号-1

No Result
View All Result
  • Home

© 2025 长沙聚赢方舟文化传媒有限公司 by 聚赢方舟 - 湘 ICP 备 2025135270 号-1

此网站使用 cookie。继续使用本网站即表示您同意使用 cookie。访问隐私和 cookie 策略.。