2026 年 7 月,小米机器人团队抛出一篇足以改写具身智能数据格局的论文:Xiaomi-Robotics-1。这篇工作的核心不是新架构,也不是新损失函数,而是一个让同行很难复制的数字——超过 10 万小时的真实机器人操作轨迹。
论文由 小米机器人 团队 33 位作者完成,已挂在 arXiv:2607.15330。作者声称,这是目前公开已知的、规模最大的真实世界机器人操作数据集之一。
视觉-语言-动作模型(VLA)走到今天,大家都在抢两张牌:一张叫数据规模,一张叫数据真实性。过去两年,开源社区里风头最劲的多是仿真数据或互联网视频蒸馏:便宜、量大、易得,但一到真实机器人上就容易掉链子。
小米这次选了另一条路:全部用 UMI 采集的真实世界轨迹。UMI 是一套低成本双手夹爪数据采集接口,可以让操作员像打游戏一样,把真实动作直接录进机器人数据流。它不依赖动捕棚,也不依赖昂贵的力控手套,这意味着规模化复制相对容易。
从项目页披露的数据分布看,这 10 万+小时覆盖了家庭、办公、工业、餐饮、商业、户外六大场景,包含约 1.7K 个不同场景、240 万条轨迹片段、超过 260 项任务。对象词云里出现最多的是 table、bed、floor、cloth;动词则是 hold、place、grasp、lift、wipe。换句话说,这是一套以桌面与家居操作为主的通才数据。
数据量大只是表象,更关键的问题是:这些轨迹如何变成 VLA 能吃的语言条件?小米设计了一条可扩展的自动标注流水线:把每条轨迹切分成若干 clip,然后用自然语言描述前后场景的状态迁移。
举个直观的例子,"把杯子从桌面移到水槽"不再是干巴巴的动作序列,而被标注为"杯子:在桌上 → 在水槽中"这样的状态迁移语言。对模型来说,这种标注既提供了动作学习的密集条件,也让高层语言指令和低层动作输出之间多了一座桥。
训练策略采用两阶段配方。第一阶段是预训练:在海量真实轨迹上让模型学会可泛化的动作生成能力;第二阶段是后训练:把这些能力与具体机器人本体以及人类的自然语言指令对齐。
这个分法的直觉很朴素。预训练阶段让模型看过足够多的"世界 + 动作"组合,形成类似机器人通才的物理直觉;后训练阶段再用少量数据把它适配到特定 embodiment,避免从零开始调教一台新机器人。
作者还系统验证了 scaling 行为。左图显示,当预训练数据从 12.5% 提升到 100%,验证动作误差持续下降;右图显示,模型规模从 2B 增加到 10B,误差曲线同样走低。这说明 Xiaomi-Robotics-1 具备语言模型那种"堆数据 + 堆参数"的扩展性,而这对机器人领域并不是理所当然的——很多机器人策略在数据变大后收益会快速饱和。
论文在仿真 benchmark 上给出了硬成绩。RoboCasa365 是斯坦福推出的多任务操作基准,集合了 365 个日常家庭任务,从倒垃圾到叠衣服都有。Xiaomi-Robotics-1 在这个榜单上以 57.4% 的成功率登顶,比之前的最佳成绩 46.6% 高出近 11 个百分点。
在 RoboDojo 上,它的平均得分达到 20.07,同样大幅领先此前 SOTA 的 13.07。RoboDojo 更偏向高难度、长程、需要双手协调的复合任务,这个分数说明模型不仅能做原子动作,还能把动作串成完整流程。
更让人关注的是零样本泛化能力。论文指出,模型在未见过的新环境中开箱即用表现稳健,并且只需少量后训练数据就能迁移到新的复杂灵巧任务。这对产业落地非常重要:没有人会为一台家用机器人重新采集 10 万小时数据,但如果有一个强大的预训练基础策略,现场微调几百条轨迹就能干活,商业模式就通了。
这件事的标志性意义还在于它代表的数据路线之争。同期也有团队走仿真到现实的迁移路线,也有团队用单条人类视频做 one-shot 学习。小米用 10 万小时真实数据证明,工业级 scaling 仍然是可靠路径——前提是数据Pipeline足够高效、成本可控。
小米在机器人硬件上的布局也给这条路线提供了落脚点。 CyberOne 全尺寸人形机器人、 CyberDog 2 四足机器狗,以及更早开源的 Xiaomi-Robotics-0 项目,共同构成了从数据采集、模型训练到硬件部署的闭环。
作者还表示,代码和模型检查点将会开源。考虑到数据集本身涉及真实环境和隐私问题,完整开源 10 万小时原始视频的可能性不大,但模型权重和训练代码一旦放出,很可能成为机器人社区的新一代基座。
当然,这项研究也不是没有限制。真实数据规模虽然大,但分布仍偏向桌面与家居场景,工业装配、野外作业、非结构化地形等场景的覆盖度未知。此外,真实数据采集的清洗、对齐、隐私合规成本,其他团队能否复制,仍是问号。
但无论如何,Xiaomi-Robotics-1 把 VLA 的竞赛抬到了"十万小时真实数据"这个量级。它告诉产业:具身智能的 Scaling Law 也许不像大语言模型那样平滑,但只要数据 Pipeline 够扎实、硬件够便宜,真实世界里的机器人策略依然可以越训越强。
本文基于公开报道整理。