WorldModel Data Atlas
收藏官方服务:
资源简介:
一个任务优先、证据感知的开放数据集目录,用于世界模型研究。
A task-prioritized, evidence-aware open dataset catalog for world model research.
创建时间:
2026-08-16
原始信息汇总
WorldModel Data Atlas 数据集目录
概述
WorldModel Data Atlas 是一个面向世界模型研究的开放数据集目录,采用任务优先的组织方式,帮助研究者根据所需训练或评估的世界模型能力快速筛选合适的数据集。该目录收录了 203 个数据集,涵盖 6 个主要任务类别、6 个领域和 45 种模态。与按时间顺序排列的论文列表不同,本目录依据数据集主要支持的世界模型能力进行分类,并补充领域、模态、结构、来源、获取方式和许可证等元数据信息。
分类体系
每个数据集仅分配一个主要任务,次要用途和跨领域属性通过标签表示。
| 维度 | 解决的问题 | 示例 |
|---|---|---|
| 主要任务 | 主要训练或评估的能力 | 预测、动作条件动力学、决策制定 |
| 领域 | 数据采集的世界类型 | 机器人、驾驶、游戏、物理 |
| 模态 | 可用的信号类型 | 视频、动作、机器人状态、LiDAR、语言 |
| 结构 | 样本的组织方式 | 时间序列、轨迹、交互片段 |
| 来源 | 数据的生产方式 | 真实世界、仿真、遥操作、合成 |
六个主要任务类别:
- 预测与生成动力学 — 未来观测或状态预测、视频预测及长时程生成
- 动作条件动力学 — 学习世界如何响应动作而变化
- 决策制定与智能体轨迹 — 规划、控制、模仿学习、离线强化学习及智能体行为
- 空间与时空世界建模 — 3D/4D 重建、占用率、场景流及动态空间表示
- 物理与因果推理 — 物理属性、交互、干预及反事实推理
- 世界模型评估与诊断 — 主要用于衡量模型能力和失败模式的数据集
数据集目录节选
预测与生成动力学(24 个)
- OpenS2V-Nexus(2025):五百万规模的主题到视频训练数据集和细粒度基准。模态:RGB 视频、动作、场景元数据。领域:机器人/具身 AI。
- Ego4D(2022):Meta AI 与国际学术联盟收集的大规模第一人称视频数据集,包含物体交互预期和长期动作预测基准。模态:RGB 视频、音频、3D 网格、注视、IMU。需要申请访问。
- EPIC-KITCHENS-100(2022):大规模第一人称厨房活动数据集,包含连续视频、动作片段、动词-名词标签和手-物交互预期基准。模态:RGB 视频、音频、动作标签、语言。需申请/协议访问。
- Kubric(2022):生成具有精确 3D、光流、深度和分割标注视频的流水线。模态:合成视频、深度、光流、分割、3D 状态。
- BDD100K(2020):跨越城市、天气和一天中不同时间的大规模驾驶视频数据集,包含检测、车道、可驾驶区域和跟踪标注。模态:RGB 视频、2D 框、分割、车道标记。需注册访问。
- Virtual KITTI 2(2020):逼真合成驾驶视频数据集,包含深度、光流、场景流和 3D 标注。
- AMASS(2019):统一 4D 人体运动数据库,将 15 个动作捕捉数据集整合为 SMPL 表示。
- Argoverse 1(2019):用于 3D 跟踪和运动预测的自动驾驶数据集,包含轨迹、传感器日志和 HD 地图。
- INTERACTION Dataset(2019):聚焦交叉口、环岛和合流等高度交互驾驶场景的轨迹数据集。
- Kinetics-700(2019):涵盖 700 类日常和体育动作的大规模人类动作视频数据集。
- 3DPW(2018):包含 SMPL 参数和相机信息的真实世界 3D 人体姿态视频数据集。
- Charades-Ego(2018):同一室内活动的第一人称和第三人称视频配对数据集。
- Something-Something V2(2018):细粒度标签依赖时间变化的手-物交互短视频数据集。需注册访问。
- YouTube-VOS(2018):大规模视频对象分割数据集,包含跨帧掩码和长期跟踪场景。
- DAVIS(2016):高质量视频对象分割和跟踪数据集,包含密集帧级掩码。
- Moving MNIST(2015):经典视频预测基准,通过移动 MNIST 数字生成。
- Human3.6M(2014):大规模多视角人体运动数据集,包含同步视频、3D 关节点、相机参数和动作标签。需注册/协议访问。
- UCF101(2012):包含 101 类人类动作的公开视频数据集。
- HMDB51(2011):从电影和公开视频中收集的 51 类人类动作视频数据集。
- KTH Human Actions(2004):早期真实视频基准,用于视频预测。
动作条件动力学(20 个)
- HandEdit(2026):用于将人手编辑为灵巧机器人具身的大规模第一人称数据集。
- ViTacWorld(2026):面向接触丰富操作的视觉-触觉-动作轨迹资源。
- DrivingDojo(2024):面向交互式驾驶世界模型的视频数据集,涵盖驾驶操作、多智能体互动和动作指令跟随基准。
- RoboCasa(2024):面向家庭机器人学习的大规模仿真环境,包含多样化厨房、物体、语言任务和生成的视觉-动作轨迹。
- ARMBench(2023):仓库机器人拣放过程中收集的大规模以对象为中心的基准数据集。
- RH20T(2023):真实世界双臂操作数据集,包含多视角 RGB-D、力传感和机器人状态。
- H2O(2022):包含双手和物体 3D 姿态的第一人称手-物交互数据集。
- HOI4D(2022):4D 人-物交互视频数据集,包含手、物体和相机运动标注。
- ManiSkill(2022):用于机器人操作学习的高效物理仿真基准和轨迹生成环境。
- MineDojo(2022):围绕 Minecraft 构建的多模态知识与交互平台。
- RT-1 Data(2022):用于训练 Robotics Transformer 的真实机器人多任务语言条件操作轨迹。
- DexYCB(2021):手-YCB 物体交互的 RGB-D 视频数据集,包含 3D 手和物体姿态。
- iGibson(2021):生成具身导航和操作轨迹的高保真交互 3D 模拟器。
- InterHand2.6M(2020):大规模 3D 交互手部姿态数据集,包含真实和合成序列。
- RoboNet(2020):跨多个实验室、机械臂、视角和物体收集的机器人交互视频数据集。
- robosuite Benchmark(2020):模块化机器人操作仿真框架,提供生成的多任务轨迹、视觉观测和物理状态。
- OmniPush(2019):包含 RGB-D 视频和状态的真实机器人推动动力学数据集。
搜集汇总
数据集介绍

构建方式
WorldModel Data Atlas 以任务为核心,系统梳理了203个开源数据集,依据其支撑的世界模型能力划分为预测与生成动力学、动作条件动力学、决策与智能体轨迹、空间与时空世界建模、物理与因果推理、世界模型评估与诊断六大类别。每个数据集被赋予唯一的主任务,并辅以领域、模态、结构、来源和许可等元数据,确保分类清晰且避免重复收录。该图谱以单一数据源驱动,可复现地生成GitHub README和交互式网站,实现高效维护与同步更新。
特点
该图谱的显著特点在于其任务优先的组织逻辑和证据感知的注释方式。研究者可直接依据所需能力检索数据集,而无需遍历按时间排列的论文列表。多维度元数据涵盖模态、规模、结构、来源与许可,便于横向比较。精选的官方链接与编辑指导标注了数据集的有用特性和重要局限,而非简单排名。中英双语内容和交互式网站的搜索、过滤及详细对比功能,进一步提升了资源的可用性与透明度。
使用方法
使用WorldModel Data Atlas时,研究者需首先明确所需训练或评估的世界模型能力,然后在六大任务类别中定位对应数据集。GitHub README提供可浏览的目录,而交互式网站支持高级搜索、筛选和双语切换,便于深入比较数据集的规模、组织、许可及适用场景。每个条目的官方主页、论文和代码链接可直接跳转获取数据及附带的加载工具,从而实现从检索到应用的无缝衔接。
背景与挑战
背景概述
WorldModel Data Atlas 是由 worldopendata 社区于近期创建的一份任务优先、证据感知的开放数据集目录,旨在为世界模型(World Model)研究提供系统性的数据资源导航。该目录由社区维护,收录了203个数据集,覆盖6个主要任务类别(如预测与生成动力学、行动条件动力学、决策制定等)和45种模态,并提供了双语(英文/中文)的交互式网站和可复现的维护机制。其核心研究问题是帮助研究者快速识别适合训练或评估特定世界模型能力的数据集,从而避免传统按时间排序的论文列表在数据选择上的低效。该目录通过任务优先的组织方式、研究导向的元数据(如领域、模态、结构、来源、访问与许可)以及证据感知的说明,为世界模型领域的实验设计提供了重要的参考资源,促进了跨模态、跨领域的比较与复用。
当前挑战
世界模型研究的核心挑战在于数据集的多模态性与异构性:单个世界模型往往需要整合视觉、动作、状态、语言等多种信号,而现有数据集的模态覆盖和标注质量参差不齐,导致跨数据集训练与评估的难度显著。此外,构建该目录本身面临数据集的来源多样化、许可协议复杂、开放程度不一等问题,部分数据集(如 OpenS2V-Nexus)的发布状态尚待验证,且各数据集在结构、采样方式和任务定义上的差异,使得统一分类和比较变得困难。为克服这些挑战,WorldModel Data Atlas 采用了任务优先的分类体系,并引入了证据感知的说明(如适用性和局限性),同时通过可复现的维护流程和双语呈现,提升了目录的实用性与可扩展性。
常用场景
经典使用场景
WorldModel Data Atlas作为世界模型研究的任务优先型数据集目录,其核心应用在于为研究者提供基于能力维度的数据集检索与对比平台。该目录将203个公开数据集按预测与生成动力学、行动条件动力学、决策与智能体轨迹、空间与时空世界建模、物理与因果推理以及世界模型评估与诊断六大主任务进行系统归类,使研究者能够依据目标能力(如未来帧预测、动作条件状态转移或因果反事实推理)快速锁定候选数据集。借助领域、模态、结构、来源及许可等多维元数据,以及网站端交互式筛选功能,该目录在数据集选择过程中大幅降低了文献检索的时间成本,成为世界模型实验设计中的关键导航工具。
解决学术问题
该数据集目录有效回应了世界模型研究中长期存在的数据集选择碎片化与标准缺失问题。在既有文献中,数据集常按时间线或领域罗列,难以直接映射到具体的能力评估需求,导致研究者在跨领域比较模型效能时面临基准不一致的困境。WorldModel Data Atlas通过任务优先的编目逻辑与证据感知的注释(涵盖数据集的适用特性与重要局限),为学术社区提供了一种可复现的、去重化的资源组织范式。它促进了基准测试的标准化,使得针对不同世界模型能力的训练与评估更具可比性,从而推动了该领域从零散案例研究向系统性知识积累的演进,增强了研究的可重复性与结论的普适性。
衍生相关工作
围绕WorldModel Data Atlas已衍生出多项重要学术工作。其分类体系催生了对世界模型能力维度(如行动条件动力学与因果推理)的深入剖析,相关研究论文常引用该目录以论证数据集选择的合理性,并据此设计跨能力基准。目录中标注的经典数据集如RoboNet、Ego4D等,被大量后续工作用于预训练与微调大规模视频预测模型、机器人策略网络,进而推动了如DrivingDojo、RoboCasa等新型专用数据集的构建,这些新工作进一步丰富了世界模型的数据生态。此外,该目录的证据感知注释方法启发了其他领域(如医学影像、自然语言处理)构建任务导向型数据目录的实践,促进了数据管理规范与可重复性标准的广泛采纳,形成了从资源梳理到方法创新再到生态扩展的良性学术循环。
以上内容由遇见数据集搜集并总结生成



