学术前沿

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

小米机器人团队提出 Xiaomi-Robotics-1,一个基于 10 万+小时 UMI 真实操作轨迹预训练的视觉-语言-动作基础模型。通过可扩展的自动标注流水线将轨迹片段标注为自然语言状态迁移,模型在 RoboCasa365 与 RoboDojo 上刷新 SOTA,并展现出数据与模型规模的良好扩展性。代码与模型检查点将开源。

论文

主体信息

小米机器人团队提出 Xiaomi-Robotics-1,一个基于 10 万+小时 UMI 真实操作轨迹预训练的视觉-语言-动作基础模型。通过可扩展的自动标注流水线将轨迹片段标注为自然语言状态迁移,模型在 RoboCasa365 与 RoboDojo 上刷新 SOTA,并展现出数据与模型规模的良好扩展性。代码与模型检查点将开源。