PhysInOne 由 vLAR Group 于 2026年4月15日推出,面向视觉-物理联合学习与推理,覆盖力学、光学、流体与磁学等物理领域,并提供大规模多视角视频与动态 3D 场景标注。
- 任务
- 物理感知、视频生成、物理属性估计
- 协议
- 以官方公开许可为准
室内导航、场景图、可达性理解。移动底盘与空间智能用。
PhysInOne 由 vLAR Group 于 2026年4月15日推出,面向视觉-物理联合学习与推理,覆盖力学、光学、流体与磁学等物理领域,并提供大规模多视角视频与动态 3D 场景标注。
ARIO(All Robots In One)由鹏城实验室联合中山大学发布,主打统一数据格式标准,把不同本体、不同传感器配置的机器人数据规范到同一套 schema 下,目标是解决国内具身数据「各家格式互不兼容」的问题。
InternData-M1 聚焦「移动 + 操作」耦合场景,补齐了纯桌面数据集缺失的底盘移动与全身协同环节,是国内少数公开的移动操作大规模数据集,同属上海人工智能实验室 InternRobotics 开源体系。
Galaxea Open-World Dataset 是星海图随 G0 模型一并开放的真实开放场景数据集,全部由同一款移动双臂本体在家居、零售、办公等真实空间连续采集,强调「单一本体 + 真实场景」而非多机拼盘。
18,968 个专业设计的室内房间布局数据集,含家具实例、语义与平面图,与 3D-FUTURE 配套,2020 发布。
阿里巴巴家具数据集,含 13,151 个高质量 3D 家具模型与多视图渲染图、纹理与标注,2020 发布,用于 3D 物体理解。
含 1,482 次室内重建、478 个带物体变化的环境,提供 RGB-D 序列与语义实例,用于场景变化理解,ICCV 2019。
2025 RSS/ICML发布的统一仿真平台与合成数据集,含51万轨迹、5000万+状态转移、276任务、5500资产,基于METASIM。
K2 页面将 EmbodiedDataSet 描述为具身智能数据集,数据源融合场景实测、实验室数据、合作伙伴训练场与仿真环境,并支撑算法训练。
2024年发布的统一可扩展视觉-语言机器人交互仿真框架,基于Isaac Sim,含生成式3D资产与四类交互基准。
SAGE-3D 由群核科技 SpatialVerse 开源,用 3D 高斯泼溅重建室内空间并配套视觉语言导航指令(关联论文 arXiv:2510.21307),采用 CC BY-4.0 许可,主打仿真到真机的导航迁移。
2022年发布的真实世界铰接物体知识库,含48类、2037个真实扫描铰接物体模型,以ArtiKG知识图谱组织外观/结构/物理/语义。
2023年发布的以自我为中心多模态3D感知数据集与基准,含5000+扫描、100万RGB-D视图、160k 3D框、760+类。
2024年发布的城市级具身仿真平台,含GRScenes十万个可交互场景、89类功能场景,配套LLM驱动的NPC与GRBench基准。
TongSIM-Asset 是北京通用人工智能研究院随 TongSIM 仿真平台开放的三维资产库,基于 Unreal Engine 5 构建可交互场景与物体(关联论文 arXiv:2512.20206),用于批量搭建具…
i2Nav-Robot 是武汉大学 i2Nav 实验室发布的大规模室内外机器人数据集,提供激光、视觉、IMU 与 GNSS 多源同步数据及高精度位姿真值,用于多传感器融合导航与建图算法评测。
147,702 商品清单、398,212 图像与 7,953 个带材质/真实尺寸的 3D 模型,CVPR 2022 发布,用于物体理解与检索。
EgoDex 是苹果公开的大规模第一视角灵巧操作数据集,含约 829 小时视频与配套三维手部/手指追踪,覆盖 194 类日常桌面任务,主打「用人类第一视角数据预训练灵巧手策略」。
Argoverse 2 含 1,000 段带传感器数据的标注序列与 25 万个运动预测场景,特色是提供细粒度矢量高精地图与长尾类别标注,常用于长尾感知与轨迹预测研究。
Assembly101 含 4,321 段玩具组装与拆解视频,同时提供 8 路固定视角与 4 路第一视角,并标注手部三维姿态和逐步操作序列,是研究长程装配任务与操作错误检测的核心数据集。
10 万段驾驶视频、1.2 亿帧、10 万关键帧含多任务标注,覆盖多种天气与时段,NeurIPS 2018 发布。
50 个城市街景数据集,5,000 精细标注 + 20,000 粗标注帧,提供语义/实例/全景分割与立体深度,CVPR 2016。
协作视觉对话导航数据集,含 2,050 段导航对话、7,000+ 轨迹、83 个房屋,智能体通过对话询问完成导航,2019 发布。
DriveMLM 自动驾驶仿真对话数据:CARLA中280小时驾驶数据5万路线,Apache-2.0,2023
Ego-Exo4D 首次大规模同步采集第一视角与第三视角视频,含 1,286 小时数据、740 名参与者、13 座城市,覆盖烹饪、修车、舞蹈等技能场景,并配专家解说,是「看人学技能」这条路线的关键数据集。
Ego4D 含 3,670 小时第一视角日常生活视频,来自 9 个国家、74 个地点的 931 名参与者,是具身视觉预训练规模最大的公开人类视频库,也是 R3M、VC-1 等视觉表征模型的主要训练来源。
Gibson 数据库含 572 栋真实建筑、1,447 层楼的三维扫描,主打「真实感仿真」以缩小 Sim2Real 差距,是 iGibson 与后续室内具身仿真平台的场景基础。
AI2与CMU的长程多模态终身导航基准,68万回合、181个HM3DSem场景,Stretch执行,2024年。
HM3D 含 1,000 个建筑级真实空间的高保真三维重建,是 Habitat 仿真器上视觉导航研究的主力场景库,配套语义标注版本可直接做物体目标导航(ObjectNav)训练与评测。
2019年马里兰大学发布,基于Matterport3D的找物导航,含约9,000条语言+视觉辅助指令,智能体可主动求助。
HD-EPIC 是 EPIC 系列的高密度标注版本,在 9 个厨房约 41 小时视频上做了三维数字孪生、眼动、手部姿态与食谱级细粒度标注,用于检验多模态大模型在真实厨房场景的推理能力。
HOI4D 含 4,000 段第一视角序列、约 240 万帧 RGB-D,覆盖 800 个物体实例与 16 个类别,提供逐帧三维手物姿态与分割标注,是类别级手物交互与关节物体操作研究的核心数据集。
开放词汇移动操作基准,1200+评测回合,基于Stretch真机(2023) HomeRobot: 开放词汇移动操作 (OVMM) 开源数据集,含公开可下载样本与官方评测。
HORA(Human Object to Robotic Action)在 Hugging Face 公开约 13.6 万条样本,围绕「把人手操作重演成机器人动作」构建,采用 Apache-2.0 宽松许可,可商用,适…
833 分钟、19 人 33 物体,Aria 眼镜 + Quest3 同步采集 3D 手-物位姿,CVPR 2025。
高语义保真合成场景数据集,含 211 个场景、18,000+ 可交互物体、466 类,专为高效具身 AI 训练设计,2023 发布。
HumanML3D 在 AMASS 与 HumanAct12 基础上补齐文本标注,含 14,616 段动作与 44,970 条文本描述,是文本驱动动作生成(MDM、MotionGPT 等)事实上的标准基准。
KITTI 是自动驾驶与三维视觉领域的开山数据集,定义了立体匹配、光流、视觉里程计与三维检测等一整套评测任务,至今仍是几乎所有相关方法的必测基准。
城郊驾驶数据集,15 万图像、10 亿+ 3D 点、密集语义/实例标注,覆盖 360 度全景,PAMI 2022 发布。
长程语言导航+抓取放置移动操作,574轨迹真实与仿真(2024) LaNMP: 语言-导航-操作-感知移动操作数据集 开源数据集,含公开可下载样本与官方评测。
AI2的移动机械臂操作基准,30个厨房场景、150+物体类,ArmPointNav长程导航+操作,2021年。
Matterport3D 覆盖 90 栋真实建筑、10,800 个全景视角与 194,400 张 RGB-D 图像,是 R2R 视觉语言导航基准的底层场景,至今仍是室内三维理解与导航最常被引用的数据集。
Motion-X 提供约 1,560 万帧全身表达性三维动作与 8.11 万段序列,含手部与面部细节及配套文本标注,是规模最大的公开「文本-全身动作」数据集之一,也常被用作人形机器人动作库来源。
Nav-CoT-110K 提供约 11 万条视觉语言导航的思维链样本,把「下一步往哪走」的中间推理过程显式写成文本,采用 Apache-2.0 许可,用于训练导航模型的显式推理能力。
2023混合仿真+实体敏捷机器人Sim2Real策略学习框架,提出SFPL安全指标,举办RoboMaster Sim2Real挑战赛。
nuScenes 含 1,000 段 20 秒场景、约 140 万张相机图像与 39 万帧激光点云,是首个提供完整 360 度相机+激光+毫米波传感器套件的公开自动驾驶数据集,长期作为三维检测标准基准。
OakInk2(CVPR 2024)聚焦双手协同完成的复杂长程任务,把交互拆成「基元-任务」层级并给出完整双手与物体位姿标注,是研究双手协作操作与任务级模仿的重要公开数据集。
Objaverse 开放 80 万以上带标注三维模型,Objaverse-XL 进一步扩展到 1,000 万量级,是三维生成模型与具身仿真场景最主要的公开资产来源,规模比 ShapeNet 高两个数量级。
纽约大学与Meta联合发布的开放词汇移动操作数据集,10个真实家庭、171次拾放评测,融合语义记忆与语言,2024年。
OmniObject3D 用专业扫描设备采集 6,000 个真实物体、覆盖 190 个日常类别,同时提供高精网格、多视角图像与点云,弥补了 CAD 类资产库「不像真东西」的短板。
百万级自动驾驶数据集,100 万 LiDAR 帧、700 万图像、15k 带标注场景,覆盖多样场景与天气,NeurIPS 2021。
ORS3D-60K 三维任务调度数据:6万复合任务覆盖4376真实室内场景,Apache-2.0,2025
PartNet 对 26,671 个三维模型做了 57 万多个部件实例的细粒度层级标注,是「机器人要抓门把手而不是抓整扇柜门」这类部件级功能理解研究的核心数据集。
Phys100K 机器人可达性理解数据:10万多机器人RGB/深度可达性样本,CVPR2025,2025
2022年程序生成的大规模具身AI室内数据集,含1万套房屋场景,支持导航与操作任务。
CVPR 2023全景视频场景图数据集,400段长视频含111段第一人称,标注对象、关系与时空全景图。
基于 Matterport3D 的视觉语言导航基准,含 90 个室内环境、10,567 条全景轨迹与 7,189 条自然语言指令,CVPR 2018 发布。
18 个高保真室内场景重建数据集,含网格、纹理、语义与实例标注,单场景达数亿面,2019 发布,用于视觉导航仿真。
远程指代视觉导航数据集,21,702 条指令、4,140 个目标物体、489 类对象,要求智能体在陌生室内找人指定物体,CVPR 2020。
RLBench 提供 100 项手工设计的操作任务,每项都可无限量自动生成专家示教,是 PerAct、RVT、Act3D 等三维操作策略的标准评测环境,也是仿真示教数据的重要来源。
RoboSense 是面向拥挤与非结构化环境的第一视角机器人感知与导航数据集及基准,由上海交大团队开源,重点覆盖人群密集、遮挡严重的真实户外场景,弥补了自动驾驶数据集在低速服务机器人视角下的缺失。
AI2发布的视觉语义导航基准,99个仿真场景、约1.98万训练回合,支持LoCoBot sim-to-real迁移,2020年。
RxR 含约 12.6 万条多语言视觉语言导航指令,覆盖英语、印地语、泰卢固语三种语言,并记录标注者描述时的视觉注意轨迹,是 VLN 领域规模最大、标注最细的多语言基准。
SCAND 由人类遥操作机器人在校园真实人流中采集,含 138 段轨迹、约 8.7 小时、25 英里行驶数据,专门服务「机器人怎么走才不冒犯人」的社会化导航模仿学习研究。
ScanNet 含 1,513 段室内 RGB-D 扫描、覆盖 707 个不同空间与约 250 万视角,提供密集三维语义与实例标注,是三维场景理解领域使用最广的真实数据集,几乎所有点云分割方法都在其上评测。
ScanNet++ 用激光扫描仪配合单反与手机采集 460 个室内场景,几何与纹理精度远高于上一代,同时支撑新视角合成与精细语义分割两类评测,是当前高保真室内三维数据的标杆。
约 15,000 个从真实室内扫描提取的物体、2,902 个标注实例、15 类,含背景噪声与残缺,ICCV 2019 发布。
基于 ScanNet 的 3D 视觉指代数据集,51,583 条自然语言描述、11,046 个物体、800 个场景,ECCV 2020 发布。
ShapeNetCore 含 51,300 个人工核验的三维 CAD 模型、覆盖 55 个常见类别,是点云与三维深度学习的奠基数据集;官网近期访问不稳,可从 Hugging Face 官方镜像获取。
面向场景的物体导航(FAO)基准,需从多个物体中按细粒度描述定位目标,含 ScanNet 重建场景,CVPR 2021 发布。
具身空间问答数据集,650 个 ScanNet 场景、6.8K 情境化设置、33.4K 问答对,需先定位智能体位置再理解空间,ICLR 2023。
3.5K 套专业室内设计场景,含全景图、2D/3D 标注、语义与平面图,覆盖多房间布局,ECCV 2020 发布。
TartanDrive 采集约 5 小时高速越野驾驶数据,同步记录悬挂、轮速与车身姿态等动力学通道,是研究非结构化地形动力学建模与可通行性预测的少数公开真实数据集。
2021年多模态物理仿真平台,支持视听渲染与刚体/柔体交互,含Transport挑战与物体数据集。
基于 Google Street View 的室外视觉语言导航数据集,9,326 条指令、61,319 条路网边,含定位与导航任务,CVPR 2019。
2025水下机器人操作VLA仿真数据集,Stonefish中2275条episode、20任务,BlueROV2+4-DoF臂,LeRobot格式。
USTC 移动操作真机数据:中科大移动机械臂真实操作数据,CC BY-NC-SA 4.0,2024
将离散 R2R 指令迁移到 Habitat 连续环境的 VLN 基准,支持真实动作控制与碰撞,ECCV 2020 发布。
Waymo Open Dataset 感知子集含约 2,000 段 20 秒高质量标注场景,运动预测子集覆盖十万量级交通场景,传感器精度与标注质量在公开自驾数据集中处于顶部,并持续举办年度挑战赛。
上面是按场景挑出的代表;要继续细筛可回 数据集总库 按数据类型 / 任务 / 模态过滤。
我是硅基参考 Agent,熟产品库、数据集、公司档案和近期资讯。你可以直接问,也可以先让我了解你是谁、在看什么——我会把库里的资料和你说的话对上号,像同事聊天那样一点点聊。