过去两周,我们顺着具身智能的链条连写了两篇:从决定机器人「接触世界那一端」的灵巧手,到决定「怎么动脑」的VLA与世界模型。今天,轮到那道横在所有玩家面前、却最容易被Demo光环掩盖的坎——数据。当WAIC 2026上的机器人不再跳舞、开始叠衣服搬箱子时,行业才猛然意识到:比造出更灵活的肢体、更聪明的大脑更难的,是喂饱它们的「数据天堑」。

先给一个数字,它几乎定义了当下具身智能的全部焦虑。截至2026年初,全球现有高质量具身数据总量约50万小时;而训练一个通用具身模型,预计需要超过1000万小时。缺口超过99%——这意味着,今天机器人学到的,连「及格线」的零头都不到。

为什么数据会这么稀缺?因为机器人要的不是互联网上唾手可得的文本与图片,而是「动作—触觉—视觉—语义」全模态、带着力矩与延迟反馈的真实交互数据。它能让模型学会「拧开瓶盖时力该多大」,而不只是「认出这是个瓶子」。这种数据,只能一条一条在真实世界里积累。

WAIC2026具身智能展台

行业把数据切成一座金字塔。塔基是互联网数据,量最大、最便宜,但和机器人动作几乎不沾边——多家公司已经直接弃用。中间层是仿真合成数据,成本低、能无限扩展,却始终隔着一道「域适应」的鸿沟。塔尖的真机遥操作数据质量最高,可单小时采集成本能突破万元,规模化根本负担不起。

于是各家开始摸索「配比」。 自变量机器人 告诉高工人形机器人,10份无本体数据(人类第一视角操作)搭配1份真机数据,就能达到同等规模纯真机数据的训练效果,把模型训练的数据成本降到约1/20。中科慧灵采用约70%真实场景视频+20%无本体遥操作+10%仿真增强;零次方则在预训练阶段用开源数据集+少量自采Ego数据+UMI遥操作,场景精调再回到真机闭环。

真正的军备竞赛,是「数采工厂」的百万小时计划。 千寻智能 已在全国100多个城市部署超过30万个采集点位、专职采集人员超千人,2026年目标完成100万小时真实交互数据。 智元机器人 旗下的觅蜂科技,2026年中已达成百万小时级产能,并喊出千万小时级目标,还发布了MEgo系列无本体采集硬件。

星海图 与北京亦庄共建「亦数智能」,启动100万小时超高质量真实数据计划,规划今年完成百万小时、三年迈向千万小时,并把年度产出的5%—10%免费或优惠开放给区内企业。京东则依托供应链优势,宣布两年内积累超1000万小时优质数据,自研JoyEgoCam采集终端与JoyAI-RA大模型。

连运营商和创业公司也挤了进来。 戴盟机器人 与中国移动合作启动「数采进家庭」,首期投放1000套设备,满产每年可产生100万小时数据; 鹿明机器人 计划今年在六大真实场景投放1万台背包版FastUMI Pro,目标同样直指百万小时级产能。

但堆量不是答案。 光轮智能 联合创始人杨海波把有效数据的来源归结为两条路径——人类第一视角视频数据与仿真合成数据,并把前者重建进仿真、在仿真中泛化生成,实现更大规模与多样性的供给。这家公司还是Newton仿真技术委员会中唯一的中国企业成员,与英伟达、谷歌DeepMind、迪士尼、丰田研究院共同引领下一代开源物理AI仿真标准,全球前五的世界模型团队均已与其合作。

光轮智能人类数据采集设备

飞轮怎么真正转起来?业内的共识是「仿真预训练—真机微调—场景回流」的闭环:用仿真把预训练成本压到最低,用真机数据精准修正,再通过真实部署让数据持续回流。英伟达的判断是,过去几年由遥操作主导的采集方式正在接近上限,行业正从teleoperation转向更易规模化的「传感化人类数据」(第一视角视频、动捕、可穿戴设备)。

这条路上, 诺亦腾 机器人以human-centric data为核心,把零散的人类交互数据转化为可复用、可跨本体迁移的训练基础设施,并刚完成Pre-A++轮融资; 帕西尼 则牵头国家WG7具身数据标准工作组,试图统一跨硬件、跨场景的数据复用标准——「数据质量远重于规模」是其创始人反复强调的底线。

政策也在补位。2026年6月,国家数据局印发行业数据集建设方案,将具身智能纳入创新领域重点支持方向;北京亦庄每年发放1亿元「数据券」支持企业采购数据产品,试图用公共杠杆撬动「数据孤岛」的打通。

一个必须泼的冷水:单纯堆数据量是无效的。灵初智能联合创始人陈源培有个尖锐的对比——10万小时人类数据,可能不如1000小时有效。 智元 合伙人姚卯青判断,若把具身智能的GPT-3.5时刻定义为通用能力的显著涌现,行业有望在2027年底至2028年初看到关键进展,前提正是千万小时级数据积累取得突破。

值得一提的是,连大模型侧的玩家也在用数据反哺本体。 蚂蚁灵波 开源的LingBot-VLA 2.0在预训练阶段融入6万小时高质量真实物理数据,覆盖17家厂商20多种构型; 宇树 等本体厂商则通过海量真机部署,把每一次现场运行都变成数据回流的入口。

回到我们这三篇系列。灵巧手是「最后一毫米」,VLA与世界模型是「第一性大脑」,而数据是让两者真正运转起来的「燃料与飞轮」。手再灵、脑再聪明,没有持续、低成本、高质量的数据回流,机器人就永远停在展台的才艺表演里。

所以,当资本半年豪掷近千亿涌进具身赛道,真正决定胜负手的,未必是谁先亮出更炫的Demo,而是谁能以最低成本、最高效率跨过「数据」这道天堑。这场飞轮之战,才刚刚开始转动。

本文基于公开报道整理。