CALVIN 提供 4 个仿真环境、34 类任务与约 24 小时人类遥操作数据,核心考察「连续完成一串语言指令」的长程能力,是语言条件操作策略最经典的公开基准。
- 平台
- Franka Panda(仿真)
- 任务
- 长程语言条件操作、多环境泛化
- 协议
- MIT
多阶段任务连着做。评估策略的持续性与恢复能力先看这批。
CALVIN 提供 4 个仿真环境、34 类任务与约 24 小时人类遥操作数据,核心考察「连续完成一串语言指令」的长程能力,是语言条件操作策略最经典的公开基准。
BEHAVIOR-1K 基于真人问卷筛出 1,000 项最需要机器人代劳的家务活动,配 50 个可交互场景与 9,000 多件物体,支持流体、柔体与状态变化,是最贴近真实家庭需求的具身仿真基准。
Meta-World 提供 50 项标准化机械臂操作任务与多套 ML/MT 评测协议,是多任务与元强化学习领域最通用的基准,现由 Farama 基金会持续维护,环境接口保持长期兼容。
RLBench 提供 100 项手工设计的操作任务,每项都可无限量自动生成专家示教,是 PerAct、RVT、Act3D 等三维操作策略的标准评测环境,也是仿真示教数据的重要来源。
10Kh RealOmni-Open DataSet 由简智机器人于 2026年1月5日开源,定位大规模无本体具身数据集;公开口径称累计时长超 10Kh、规模超 1Mil clips,专注 10 大家庭场景与 30 项…
2025 ICCV发布的语言条件机器人操作基准,含100类任务、2000+物体,支持长程推理与常识迁移,提供自动化训练数据。
日本 AIRoA 在 Toyota HSR 上遥操作采集 23762 段家居服务演示(约 87 小时),含擦布、咖啡、洗碗等长程移动操作(2025)。
2020年AI2发布,含25,743条自然语言指令与5,856段专家演示,基于AI2-THOR的七类家务长程任务。
Assembly101 含 4,321 段玩具组装与拆解视频,同时提供 8 路固定视角与 4 路第一视角,并标注手部三维姿态和逐步操作序列,是研究长程装配任务与操作错误检测的核心数据集。
UT Austin 在 UR5 上采集 365 段无分段长程厨房演示,用于无监督技能发现与层级模仿学习(2023)。
UT Austin 在 UR5 上采集 5000 段玩具厨房家务演示,含食物、锅具拾取与放置,用于层级模仿学习(2023)。
10 万段驾驶视频、1.2 亿帧、10 万关键帧含多任务标注,覆盖多种天气与时段,NeurIPS 2018 发布。
BDRBench-20 字节机器人操作基准:字节单臂VLA操作基准,8000条真机轨迹,Apache-2.0,2025
2023年多阶段电缆布线分层imitation数据集,含1442路由、11915选择与257端到端演示轨迹。
北航与NUS的紧密协调双臂长程数据集,18个任务、平均361步/4.27阶段,2026年发布。
布朗大学早餐动作数据集,77小时52人制作早餐视频,含约2000个长程活动与动作序列表注。
UT Austin自底向上技能发现数据集,基于robosuite层次化模仿,分解长程任务为可复用基元,2023年。
2023年UMass发布,扩展Watch-and-Help支持多智能体通信,含5类家庭任务与长程协作子目标完成。
UR5软管长程可形变操作数据集,1000条episodes、10+场景,含语言标注,CC BY-NC 4.0,2023年。
2022年港中文发布,扩展ALFRED支持智能体主动提问,含50类问句模板与对话引导的家务任务完成。
CVPR 2025长期第一人称生活记录数据集,6人同住300小时多模态视频,支持长程活动理解与具身问答。
约 2,000 段第一人称任务视频配 40K QA 对,含长程任务步骤推理与状态查询,NeurIPS 2022。
UC伯克利真实功能操作长程基准,2.25万条轨迹、多阶段抓取-重定向-装配,Franka,CC-BY-4.0,2024年。
UC Berkeley 在 Franka 上采集 22550 段功能性装配轨迹,需抓取-重定位-插入多阶段技能,评测泛化(2024)。
Fourier ActionNet 是傅利叶正式开源的全尺寸人形机器人数据集。官网文章称首批上线超 3 万条高质量真机训练数据,包含多种自由度灵巧手训练数据和手部任务模仿学习数据,并配套采集、训练、部署工具链。
2023年真实家具组装长程操作基准,8种家具、219小时遥操作演示,含标准化配置与数据集。
AI2与CMU的长程多模态终身导航基准,68万回合、181个HM3DSem场景,Stretch执行,2024年。
2022年Meta发布,高保真家庭重排仿真,含10.5万+重排episodes与200+任务类别,支持长程家务操作。
2022年MIT发布,基于Habitat 2.0的杂物收拾长程基准,含15类任务、10,802物体与4.7万+ episodes。
2021年物体中心交互仿真环境,15个可交互场景支持温度/湿度等状态,含VR演示与BEHAVIOR。
USC CLVR的层次化家具装配仿真环境,60+可装配模型、6类机械臂,长程多步装配,2021年发布。
InternData-A1 是上海人工智能实验室 InternRobotics 体系开源的长程双臂操作数据集,面向多阶段复杂任务训练,与 InternManip 训练框架配套,可直接用于 VLA 模型预训练与微调。
2023年发布,基于Minecraft的开放世界多任务智能体,含200+任务与多模态记忆规划,覆盖长程任务。
AIRI等基于Isaac Sim的厨房长程基准,563条4–8步语言指令、约2700条移动操作轨迹,Mobile ALOHA,2025年。
长程语言导航+抓取放置移动操作,574轨迹真实与仿真(2024) LaNMP: 语言-导航-操作-感知移动操作数据集 开源数据集,含公开可下载样本与官方评测。
IIT的长程双臂操作数据集,200条episodes、20个长程任务、17.6万观测-动作对,真实机器人,2023年。
LIBERO 含 130 项任务、划分为四个任务套件,专门用于评测机器人策略在空间、物体、目标与长程任务上的知识迁移与遗忘问题,是当前 VLA 模型论文最常用的仿真评测基准之一。
CIS的层次化长程语言条件操作基准,10个长程任务,基于Ravens仿真、UR5e,需子目标规划,2023年。
2024年ETRI发布,面向语言任务规划器的基准,含ALFRED+AI2-THOR与WAH-NL+VirtualHome两套评测。
ManipArena 双臂移动操作数据:双臂+移动底盘真实操作,10812+轨迹,Apache-2.0,2025
AI2的移动机械臂操作基准,30个厨房场景、150+物体类,ArmPointNav长程导航+操作,2021年。
2025年基于ManiSkill3的家庭重排低级操作基准,含TidyHouse等三任务约3.3万任务计划,HF可下。
2024/2025年GPU并行化机器人仿真与渲染框架,含50+操作任务与可下载演示数据集,RSS 2025。
NVIDIA自动生成大规模演示系统,4.8万+条跨12个操作任务的轨迹,含长程装配与厨房,2023年。
2023年微软发布,多智能体协作规划基准CuisineWorld,含Overcooked式与Minecraft任务,强调对话协调。
2022年Stanford发布,基于Minecraft的开放世界具身平台,含73万YouTube视频与180K维基,支持长程任务规划。
Hendrycks 等提出的 57 学科 14042 道多选题基准,衡量大模型多任务语言理解能力。
Mobile ALOHA 开源了移动双臂遥操作硬件方案与配套示教数据,用 50 条示教即可让机器人完成炒虾、乘电梯等长程家务任务,是「低成本硬件 + 少量示教」路线影响力最大的公开工作之一。
谷歌机器人舰队多任务强化学习数据集,92万余条真实轨迹,覆盖拾取、放置、重排等长程技能,2021年发布。
2022年Everyday Robot发布,开放词汇可查询场景表示,含55项真实厨房长程任务,用于LLM规划器落地 grounding。
OakInk2(CVPR 2024)聚焦双手协同完成的复杂长程任务,把交互拆成「基元-任务」层级并给出完整双手与物体位姿标注,是研究双手协作操作与任务级模仿的重要公开数据集。
Meta的人机协作长程规划基准,10万条自然语言任务、60房屋、5819物体,Habitat 3.0,2024年。
2023年NTU发布,基于MineDojo的层级任务规划框架,覆盖60+长程技能与多步规划轨迹。
斯坦福与伯克利的弹塑性长程操作数据集,2460条真实Franka轨迹(含LeRobot版),揉面擀面等,2023年。
斯坦福等在 Franka 上采集约 2460 段面团长程可塑物体操作数据,用 15 种工具完成擀面、切饼、包饺子(2023)。
2023年生成式仿真框架,用GPT-4自动生成百余种刚体操作与运动任务及轨迹数据。
RoboGround 视觉语言操作数据:2.4万仿真演示11.2万指令,1.02TB,MIT,CVPR2025
2018/2019年众包遥操作数据集,Pilot含3224条演示,真实集111小时、54名用户长程操作。
RoboVQA 面向长程机器人任务收集大规模视频问答数据,覆盖任务可行性、剩余步骤、失败原因等提问类型,用于训练与评测具身模型的高层推理能力,而非只看单步动作。
2022年大规模真实机器人操作数据集,13万片段覆盖700+任务,含语言指令与多模态传感数据。
USC CLVR层次化技能先验数据集,厨房等域约500条演示,自底向上发现可复用长程技能,2020年。
CMU提出的杂乱场景整理长程基准,8300个场景与任务,RGB+深度,需多步物体归位与重排,2021年。
加州大学圣地亚哥分校在 Franka 上采集 150 段厨房任务演示,配自然语言指令,覆盖多样日常物体操作(2023)。
Unitree G1 Dex3 烤面包操作数据:G1七自由度双臂+Dex3灵巧手,418幕,Apache-2.0,2025
2022年多模态提示机器人操作基准,程序化生成桌面任务,发布65万专家轨迹用于模仿学习。
UT Austin的视觉模仿长程数据集,含摆桌、冲咖啡等长程任务,仿真+真实演示,UR5,2023年。
UT Austin 在 Franka 上采集的 150 段厨房任务视觉模仿演示,覆盖摆桌、冲咖啡等 Household 任务(2022)。
2018年MIT发布,程序化家庭活动仿真器,含2,500+活动程序与5,000+日常任务,支持自然语言到动作映射。
2021年中科大发布,基于VirtualHome-Social的社会协作基准,含10万+多智能体协作与助人轨迹。
帝国理工在 Rethink Sawyer 上采集约 2000 段腕部相机遥操作演示,强调灵巧操作的鲁棒视觉模仿学习(2023)。
上面是按场景挑出的代表;要继续细筛可回 数据集总库 按数据类型 / 任务 / 模态过滤。
我是硅基参考 Agent,熟产品库、数据集、公司档案和近期资讯。你可以直接问,也可以先让我了解你是谁、在看什么——我会把库里的资料和你说的话对上号,像同事聊天那样一点点聊。