基于数万次真机评测,机器人大模型年度评测报告发布

当大语言模型在数字世界不断刷新人类认知边界,一场关于 AI 如何“扎根”现实物理世界的革命正悄然进行。

基于数万次真机评测,机器人大模型年度评测报告发布

来源:中国日报网 2026-02-04 15:09
  • weixin
  • weibo
  • qqzone
分享到微信

中国日报2月4日电(记者 马思)当大语言模型在数字世界不断刷新人类认知边界,一场关于 AI 如何“扎根”现实物理世界的革命正悄然进行。全球首个具身智能大规模真机评测平台—— RoboChallenge 近日正式发布首份年度报告。报告基于过去数月内(2025 Q4~2026 Q1)平台完成的数万次严苛远程真机测试,以大规模、标准化、可复现的数据,客观揭示了当前视觉-语言-动作模型在真实物理环境中的能力边界与共性挑战。

近年来,大语言模型与视觉语言模型取得了爆发式突破,人工智能在感知、认知与推理层面展现出惊人潜力。然而,将这种能力可靠地赋予机器人,使其在复杂多变的物理世界中理解、决策并执行任务,仍是横亘在研究者面前的巨大挑战。真机测试长期面临难以复现、缺乏统一标准、成本高昂等核心痛点,导致模型评估往往停留在仿真环境或有限场景,其“现实世界智能”成色几何,始终难以量化评判。RoboChallenge正是为破解这一行业共性难题而生。

据悉,作为由原力灵机与 Hugging Face 联合发起的全球首个具身智能大规模真机评测平台,RoboChallenge致力于构建一个开放、公正、可大规模复现的“真实考场”。自 2025 年 10 月 15 日正式上线以来,平台已成功部署了包含 UR5、Franka Panda、ARX5、ALOHA 等四大主流机型在内的 20 台真机集群,构筑起一个稳定、多元的远程物理测试网络。

为推动真机评测走向规范化、标准化,2025 年 11 月 20 日,原力灵机与 Hugging Face 深度集结智源研究院、智元机器人、Qwen、星海图、自变量、清华大学、西安交通大学及 GOSIM,共同成立了 RoboChallenge 组委会。

基于对海量真机测试数据的深度分析,RoboChallenge 年度报告揭示了以下核心发现与亮点观察:基础任务趋近成熟,“叠碗”和“物体移入盒子”两项任务因其相对较高的成功率,成为多数模型首选的验证性任务,类似具身智能的入门“考题”。复杂任务依然“屹立不倒”:涉及多步骤序列决策、长期规划及精细灵巧操作的任务,如“整理纸杯”、“制作三明治”等,

此外,报告指出,对当前所有参测模型而言仍极具挑战,成功率长期处于低位,部分甚至接近零。当前在 Table30 评测集上表现最佳的模型,其整体成功率也仅在 50% 左右。这既体现了现有模型的进步,也充分说明了 Table30 任务集设计的挑战性与现实价值,表明具身智能在通用能力上仍有巨大提升空间。

同时,实测数据显示,参测模型虽具备较强的指令语义理解能力(呈现移动趋势),但在精细操作任务中成功率不足 15%。这种现象在 RoboChallenge 平台上沉淀了大量真机失败数据,这份公开的“错题集”可作为模型迭代优化的关键参考。

RoboChallenge 标为,未来将持续迭代,引入更多机器人本体类型,拓展至更多元化、更贴近真实工业与家庭需求的场景评测集,并设计更具挑战性的任务。平台还将探索分布式真机评测机制,进一步扩大测试规模与效率。

【责任编辑:何思】
中国日报网版权说明:凡注明来源为“中国日报网:XXX(署名)”,除与中国日报网签署内容授权协议的网站外,其他任何网站或单位未经允许禁止转载、使用,违者必究。如需使用,请与010-84883777联系;凡本网注明“来源:XXX(非中国日报网)”的作品,均转载自其它媒体,目的在于传播更多信息,其他媒体如需转载,请与稿件来源方联系,如产生任何问题与本网无关。
版权保护:本网登载的内容(包括文字、图片、多媒体资讯等)版权属中国日报网(中报国际文化传媒(北京)有限公司)独家所有使用。 未经中国日报网事先协议授权,禁止转载使用。给中国日报网提意见:rx@chinadaily.com.cn
C财经客户端 扫码下载
Chinadaily-cn 中文网微信
×