中央广播电视总台“CMG机器人挑战赛——点球大战”近日在湖南永州正式开赛。一台名为启元Q1的人形机器人在绿茵场上与人类选手互罚点球:它既能助跑射门,也能横向扑救。这场赛事看似娱乐,实则把具身智能行业最关心的一个问题抛到了公众面前——谁来给机器人打分?

就在同一周, Figure AI 创始人Brett Adcock在社交平台发布Figure 03自主攀爬工业梯子的视频,声称这是“历史性突破”。但视频没有披露成功率、测试条件与失败数据,机器人动作也明显慢于人类。演示与验收之间的张力,从未如此尖锐。

CMG赛事选择了足球点球作为考题,不是没有道理。射门需要髋、膝、踝联动,手臂摆动配重;守门则要在不足0.5秒内完成视觉追踪、轨迹预判、重心调整与横向扑救。户外光照、草皮摩擦、风噪和观众干扰,都是实验室里很难复现的变量。

这意味着一场公开赛事同时考了四项能力:动态平衡、全身协调、实时感知与抗干扰。相比剪辑过的产品视频,赛事提供了一个可围观、可复验、可比较的“压力容器”。

CMG机器人挑战赛点球大战现场,启元Q1人形机器人在赛事场地上展示射门与扑救动作

Figure 03的爬梯子视频之所以引发争议,恰恰因为它只完成了“演示”这一步。爬梯子时,视觉伺服、抓握扶手与腿部动态平衡必须同时工作,任何一环出错都会摔。但视频没有回答:失败率是多少?环境参数是否被精心挑选?量产机是否具备同样能力?

这并非苛责某一家公司。整个行业都面临同样的诱惑:在社交媒体上发一段高光视频,比发布一份测试报告更容易获得融资与关注。但2026年,投资人、客户与监管者开始要求更多——他们要看到可量化、可复现、可对比的真实能力。

中国的回应是标准先行。2026年6月1日,工信部《YD/T 6770—2026 人工智能 关键基础技术 具身智能基准测试方法》正式实施。这是中国具身智能领域首份行业标准,构建了统一基准测试框架。

该标准覆盖了静态仿真、动态仿真、真实环境测试与组合式测试四大方法,确立了任务执行效率、任务成功率、人工干预率、场景扰动衰减率与平均任务能耗五大核心指标。测试任务库包含万余条任务,覆盖三百余种场景。

与此同时,《人形机器人 全生命周期管理规范》提出“一机一码”,为每台人形机器人赋予唯一的“身份证号”,覆盖生产、流通、维护、回收全流程。这意味着监管者开始把人形机器人当作一类需要持续追踪的产品,而不是一次性展出的样品。

上海机器人产业技术研究院作为国家机器人检测与评定中心总部,正围绕“智能、可靠、安全、兼容、可信、绿色”六大需求构建评测体系,并已颁发超过六百张CR认证证书。它的角色越来越像机器人行业的“国家考场”。

对厂商而言,评测体系的出现是一把双刃剑。一方面,统一标准让不同技术路线可以在同一标尺下比较,减少无效研发;另一方面,那些靠剪辑视频撑起来的估值,可能在标准化测试中迅速缩水。

资本市场已经感受到风向变化。2026年上半年,国内具身智能赛道融资总额超过九百亿元,其中过半涌向“大脑派”——通用大脑、VLA模型与世界模型。 蚂蚁灵波 启动十五亿元首轮融资,求之科技、破壳机器人同日公布大额融资,方向都指向跨本体泛化的通用大脑。

这种资本迁移暗示:当本体硬件逐渐同质化,真正稀缺的是能在不同机器人平台上复用、在真实场景中稳定运行的智能决策系统。评测体系越完善,“大脑”的定价就越容易脱离单纯的硬件成本逻辑。

从更宏观的视角看,自主评测标准关系到中国在全球具身智能竞争中的主动权。如果中国厂商能率先在本土完成大规模标准化验证,其产品与方案出海时就会多一张被国际采信的“成绩单”。

当然,标准本身也在动态演进中。 智元机器人 副总裁朱洁表示,标准落地需要结合工业、家庭、零售、巡检等真实场景持续迭代。企业、检测机构与应用方必须协同,才能打通“标准—测试—认证—落地”的闭环。

回到CMG点球大战现场,启元Q1的每一次扑救与射门,都在回答一个朴素的问题:这台机器人到底能不能在真实世界里稳定干活?答案也许不完美,但它至少是公开的、可讨论的、可重复的。

从爬梯子到踢点球,从实验室到赛场,具身智能正在经历一次从“表演艺术”到“工程学科”的转换。2026年或许就是这道分水岭:谁经得起公开评测,谁才有资格进入下一回合。

本文基于公开报道整理。