具身数据飞轮闭环

2026 年,具身智能行业最确定的赢家,可能不是任何一家机器人本体厂。当 宇树科技 银河通用 这类整机公司还在为量产和毛利较劲时,一批专门给机器人“喂数据”的公司已经先赚到了钱——它们不造机器人,只卖训练数据。

这背后的逻辑很简单:大语言模型可以蹭互联网上现成的万亿 token,而机器人要学会抓杯子、开门、整理货架,必须一条条采集真实物理交互数据。公开数据显示,截至 2026 年初,全球可用的高质量真实数据仅约 50 万小时,而通用具身模型要迎来能力涌现的临界点,至少需要数千万小时。缺口超过 99%。

更刺眼的是仿真与真实的鸿沟。斯坦福 HAI《AI Index Report 2026》披露,仿真环境里机器人任务成功率已达约 89.4%,一旦搬进真实家庭场景却骤降到约 12%。也就是说,模型在“考场”满分,到了“现场”大概率不及格。

具身智能真实数据缺口

这解释了为什么行业共识在 2025 到 2026 年完成了 180 度转向:硬件本体很快被追平,算法架构每半年刷新一次,世界模型也涌入开源。唯一没法被合成、没法被抄袭的,是沉淀在真实场景里的数据。谁掌握数据,谁就掌握了机器人真正落地的钥匙。

于是“具身数据飞轮”成了今年 WAIC、WRC 上最高频的词。飞轮的转法很清晰:用真机或人类采集交互数据,做治理标注,喂给 VLA 或世界模型训练,再把模型部署到岗位上真实作业,机器人每天产生的运行数据又回流反哺训练。每转一圈,数据更多、模型更强、机器人更好用,进而部署更多、采集更多。

但要让飞轮转起来,先得解决“数据从哪来”。产业界摸索出两条截然不同的生产路线,在成本、质量和规模之间做不同取舍。

第一条是集中式数据工厂。代表玩家如 光轮智能 ,走“仿真 + 真机”双路线,一边用数字孪生批量生成合成数据,一边补充真实动作数据校准; 帕西尼感知 则在天津建了一座 1.2 万平方米的超级数据工厂,摆 150 个标准化采集单元,靠真人佩戴触觉手套同步记录视觉、力觉、关节轨迹。

具身训练数据两条生产范式对比

这类打法的特点是重资产、高质量、单价高。市场公开报价显示,常规日常动作数据约 500 到 1000 元/小时,跑酷、打球这类高动态稀缺数据甚至按秒收费,一秒钟 10 块,折算一小时 3.6 万元。

第二条是分布式众包。 千寻智能 在全国 100 多个城市布了 40 多万个真实采集点,靠可穿戴设备让普通人即戴即采; 京东 则依托零售、物流、家政等真实业务场景,计划两年内累计采集超 1000 万小时数据。它们的逻辑是用零硬件门槛撬动海量贡献者,边际成本极低。

“岗位化”也是一种低门槛数据回流。 擎朗智能 强调先找泛化要求不高的具体岗位让机器人干起来,上岗后每天产生真实运行数据; 星动纪元 则押注物流这类有清晰节拍的场景; 北京人形机器人创新中心 通过开源平台慧思开物整合超 200 万组场景数据,开放给 200 多家合作伙伴二次开发,用生态方式滚雪球。

海外也有同类玩家。 无问智科 提出“世界模型 × 数据工厂 × 世界模拟器”三位一体,依托长三角德清采集训练场做虚实融合; 星海图 则把闭环称为“具身智能生产力飞轮”,从产业场景沉淀真机数据再反哺模型。两家都把数据基建当成卖水人的生意。

跨维智能 代表另一条思路:用高保真仿真器生成海量数据,把“数据问题转化为算力问题”。行业里一个被广泛接受的说法是,仿真能解决 0 到 90%,最后那 10% 的长尾细节仍要靠真实数据补齐。两条路径不是替代,而是互补。

卖数据这门生意最诱人的地方,是边际成本近乎为零。和造一台机器人耗一件成本不同,一份高质量场景数据采一次之后,可以授权给不同公司反复使用,格式稍加适配就能交付。这也是为什么 光轮智能 客户覆盖 英伟达 、字节、 智元机器人 等半条产业链,2025 年营收翻了 10 倍、2026 年一季度新增订单就超过去年全年。

帕西尼感知 的超级工厂总投入约 8856 万元,满产年产能近 2 亿条数据,对应年营收 1 到 2 亿元,投产一两年就能回本。但当数据开始被反复授权、跨厂流通,数据孤岛与标准之争也会浮现——谁能定义接口,谁就定义生态。

资本已经用脚投票。IT 桔子统计,2026 年上半年有 25 家中国具身智能数据创业公司合计拿到超 170 亿元融资; 智元机器人 孵化的觅蜂科技成立仅 10 天就拿了红杉中国领投的数亿元融资,自研的 MEgo 无本体采集设备已量产交付超 2 万套; 艾欧智能 也刚完成数亿元融资,服务全球 150 余家机器人企业。

但门槛正在从“有没有”变成“能不能用”。当百万小时数据涌入市场,数据标准缺失、质量评估体系空白、隐私合规不清,成了新的分水岭。一份标注混乱、来源不可追溯的数据,喂给模型反而有害。

这也是为什么专业数据公司开始卷工具链和评测标准,而不只是卷采集规模。谁能把“人的技能与示范快速迁移到机器人身上”做成一套可复用范式,谁才真正卡住数据飞轮的咽喉。

对整机厂和模型公司来说,数据基建的爆发未必是威胁,更像解放。把数据采集、治理、标注这些脏活外包给专业“卖水人”,自己集中资源做核心技术与产品,反而加速了从“能演示”到“能作业”的跨越。

回到开头那个问题:具身智能的终局护城河到底是什么?本体会被追平,算法会被开源,模型架构半年一变。真正沉淀下来、谁也抢不走的,是每一次真实交互里积累的那条数据河。数据飞轮一旦转起来,后来者很难绕开。

本文基于公开报道整理。