具身智能圈这一年最大的焦虑,不是机器人能不能站起来,而是训练它的数据从哪来、要花多少钱。8 月下半月的两条消息,把一种此前偏小众的思路推到了台前——用「人戴摄像头干活」的第一人称视频,去喂机器人学操作。

8 月 15 日,原力无限(Infiforce)宣布完成近 1.5 亿美元 A 轮及 A+ 轮融资,由敦鸿资产领投、几乎全为国资与高校背景资本。它的核心打法很直接:不先造一台爆款机器人,而是把「第一人称人类视频(Ego 数据)」当成训练燃料,再配一套叫 DataGrid 的数据基础设施。

什么叫 Ego 数据?说白了就是人头上戴个摄像头、第一视角记录自己怎么抓、怎么拧、怎么放。随手即采、几乎零边际成本,规模天然是互联网量级。这和主流的「遥操作采集」形成鲜明对照——后者要真人穿戴外骨骼或摇杆去操控本体,硬件贵、工时贵、专家贵,千到万小时基本就封顶。

第一人称视频(Ego)与遥操作(Teleop)两种数据采集范式的成本与规模对比

原力无限把自己定位成「具身智能的 Hugging Face」:DataGrid 不只服务一种机体,而是跨轮式、双足、通用臂等多形态共享的数据公共层。它自报的基准里,AtomVLA 在 Libero 上 97%、HiMem-WAM 97.7%、第三代 AIM 世界模型在 RoboTwin 2.0 上 93.1%——这些是公司自报数字,需独立复现验证,但方向已经很清楚:用便宜到近乎免费的人类视频,去逼近昂贵遥操作才能换来的操作能力。

无独有偶,就在同一周,元流(Current Robotics)披露累计数亿元融资、并发布新的机器人世界模型 CurrentWorld-0。创始人祝毅晨出自 美的集团 具身智能部,是较早把 VLA 与世界模型推进到「CoT 链式思维」的研究者。元流把世界模型摆进「评测场」,强调用仿真去评估策略而非只训练策略。

更早几天,美国 Dyna Robotics 也放出结果:人类视频可以显著缩放(scale)机器人学习。再往前,物理智能(Physical Intelligence)的 π0 用 VLA+扩散范式把「视觉-语言-动作」打通,影响了大半开源社区。多家公司、两个半球,撞上了同一条直觉。

DataGrid 数据飞轮:部署越多、数据越厚、模型越强、再回灌本体

不是只有一条路:触觉也在抢「数据稀缺」这道题

把视角拉宽,会发现「数据稀缺」正在被从不同侧面围攻。 戴盟机器人 走的是触觉锚定路线:发布触觉锚定世界模型 Daimon-TWM,并建成含触觉的全模态物理世界数据集,试图从「指尖感知」侧补齐操作稳定性。它和 Ego 路线并不互斥,一个补「怎么摸得准」,一个补「数据从哪来」。

资本的态度也在变。上半年国内具身智能融资 935 亿元、同比增长 5 倍,但钱不再只追整机,而是往数据基建、基础模型、核心零部件扩散。8 月里, 智元机器人 星海图 跟投了元流; 星动纪元 背景的团队孵出了潜界科技; 傅利叶智能 出现在奇点智控的天使轮里——产业资本在用钞票投票「谁能卡住数据入口」。

西方镜像是另一条飞轮: 特斯拉 的 Optimus、 Figure AI 都靠已部署机器人的回采数据迭代,逻辑和 DataGrid 同源——机器人越多,数据越厚,模型越强。区别在于,原力无限是从纯数据基建起手,而不是先卖硬件。

多家共振:用人类视频训练机器人从孤例变共识

为什么「便宜的数据」突然值钱

答案在落地端。 小鹏汽车 要把 IRON 人形机器人月产能拉到千台级; 比亚迪 首款人形本月亮相; 宇树科技 挂牌后成了赛道定价锚。当本体从「 demo 台」走向「产线/商场」,对训练数据的需求从「够发论文」变成「够填真实工况」,廉价、海量、可规模化的信号源就成了胜负手。

当然,坑也明摆着。把人类视频「翻译」成机器人可执行的动作,需要跨本体的泛化能力,目前仍存疑;各家自报的 benchmark 缺乏独立评测;谁来定数据采集合规的「国标」,也会变成话语权之争(原力无限就参与了相关国家规范的起草讨论)。

回看 8 月这条暗线:从 美的集团 出身的祝毅晨做世界模型评测,到原力无限把 Ego 数据做成共享层,再到 Dyna 用人类视频缩放学习——几家路径不同,却都盯上了同一个瓶颈:训练数据太贵、太慢、太难规模化。

具身智能的数据路线,正从「买硬件、雇人遥操」走向「廉价信号源 + 飞轮」。这束火苗能不能烧成主炉,取决于「翻译」这一步——把人类视频转成机器人可执行的动作——能否被工程化解决。

本文基于公开报道整理。