遇见数据集

ABot-World-Explorer-4D

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

ABot World Explorer 4D 是一个深度增强的动作条件视频数据集,源自 ABot-World-0 项目。该数据集包含 20 个片段(episodes),共计 181,561 个 EXR 深度帧,以及对应的 RGB 视频、动作注释和 COLMAP 相机姿态。每个样本由视频文件(video.mp4)、注释归档(annotations.tar)和深度目录(depth/shard-*.tar)组成。注释归档中包含动作序列(action.json)、文本描述(caption.json)和 COLMAP 稀疏模型(cameras.txt, images.txt, points3D.txt)。深度数据采用 OpenEXR 格式,以绝对度量米为单位,分辨率为 1920x1080,三个通道(B、G、R)存储相同的深度值。该数据集适用于深度感知的世界模型、多模态对齐、动作条件视频生成、可控生成及智能体学习研究。注意:数据集不提供精确的逐帧时间戳对齐,也非校准传感器基准。许可证为 Apache-2.0。

ABot World Explorer 4D is a depth-enhanced action-conditioned video dataset derived from the ABot-World-0 project. It contains 20 episodes with a total of 181,561 EXR depth frames, along with corresponding RGB videos, action annotations, and COLMAP camera poses. Each sample consists of a video file (video.mp4), an annotation archive (annotations.tar), and a depth directory (depth/shard-*.tar). The annotation archive includes action sequences (action.json), text descriptions (caption.json), and a COLMAP sparse model (cameras.txt, images.txt, points3D.txt). Depth data is stored in OpenEXR format, with absolute metric meters, a resolution of 1920x1080, and three channels (B, G, R) containing the same depth values. This dataset is suitable for research on depth-aware world models, multimodal alignment, action-conditioned video generation, controllable generation, and agent learning. Note: The dataset does not provide precise per-frame timestamp alignment and is not a calibrated sensor benchmark. License: Apache-2.0.

创建时间:
2026-07-30
原始信息汇总

ABot World Explorer 4D 数据集详情

数据集概览

ABot World Explorer 4D 是一个深度增强(depth-enabled)的动作条件视频数据集,源自 ABot-World-0 研究项目(arXiv:2607.19191)。该数据集以 4D 形式提供 20 个片段的视频、动作标注、相机位姿以及绝对度量深度数据,主要用于世界模型、多模态对齐、动作条件视频生成和智能体学习等研究方向。

  • 许可证:Apache-2.0
  • 数据规模:20 个片段(episodes),样本数量小于 1K
  • Base source objects:120
  • EXR depth objects:181,561
  • 总数据对象数:181,681
  • 深度表示:绝对度量深度(Absolute metric)
  • 深度单位/缩放:米(m)/ 1.0
  • 语义划分:无

数据集结构

text meta/abot-world-explorer-poster.png metadata.jsonl data/<prefix>/<sample_id>/video.mp4 data/<prefix>/<sample_id>/annotations.tar data/<prefix>/<sample_id>/depth/shard-*.tar LICENSE README.md

  • sample_id 为匿名化、数据集命名空间内的 HMAC 标识符,源密钥和 OSS 位置未发布。
  • 数据按 sample_id 前两位作为前缀进行目录分组。

数据文件格式

video.mp4

保留源 MP4 原始字节,未进行发布时转码。

annotations.tar

未压缩的 POSIX USTAR 归档文件,包含:

  • action.json:序列元数据和逐帧控制记录
  • caption.json:包含 perspectivescene_staticnarrative 字符串及 dense_temporal 数组
  • sparse/0/ 下的三个 COLMAP 位姿文件(cameras.txtimages.txtpoints3D.txt

COLMAP 位姿文件

  • 所有 20 个 4D 片段的审核模型均为纯位姿(pose-only)模型
  • 包含一台 1920×1080 的 PINHOLE 相机
  • images.txt 中所有观测行为空,points3D.txt 无点记录
  • 图像命名按 frame_000001.jpg 顺序排列,图像与深度计数在每个片段内匹配

OpenEXR 深度文件

  • 格式:OpenEXR v2,单部件扫描线图像
  • 分辨率:1920×1080,数据与显示窗口匹配 (0, 0)-(1919, 1079)
  • 通道:BGR,均为 FLOAT 类型,采样 1×1,无 Z 或 alpha 通道
  • 压缩/行序:PXR24 / 递增 Y
  • 审核发现 B、G、R 三通道承载相同的深度平面值
  • PXR24 压缩为有损压缩,会将 32 位浮点数据降至 24 位精度
  • 深度按米为单位的绝对度量深度存储,scale_to_m=1.0

深度文件按六位帧键(如 depth/000001.exr)排序,分组存储于未压缩的 shard-*.tar 归档中,每个分片不跨样本。

数据预览

Hugging Face 数据集查看器由 metadata.jsonl 支持,覆盖全部 20 个片段。查看器将类型化描述符转为可播放的 HTTPS 源,不复制或重写媒体负载。深度 TAR 归档作为普通仓库负载,查看器不进行解码。

使用建议与限制

  • 适用场景:度量深度感知的世界模型、多模态对齐、动作条件视频、可控生成和智能体学习研究
  • 不适用场景:不能作为校准传感器基准,不保证物理/因果正确性
  • 已知局限:精确时长、时间戳级别的 RGB/动作/位姿/深度对齐关系未声明;深度测量方式(相机 z 深度或欧氏距离)及无效哨兵值含义未知;dense_temporal 数组可能为空

引用

如需引用,请参考 ABot-World-0 论文(arXiv:2607.19191),引用详情见 arXiv 页面。

搜集汇总
数据集介绍
ABot-World-Explorer-4D 数据集图片
构建方式
ABot World Explorer 4D 数据集是 ABot-World-0 项目的一个深度增强型子集,旨在为行动条件视频生成和世界模型研究提供高质量的四维数据。其构建过程严格遵循原始数据的字节保留原则,从源清单中选取了20个片段,包含181,681个基础源对象,其中深度信息以181,561个OpenEXR格式的深度文件形式呈现。每个样本均包含视频文件、注释档案以及分层组织的深度分片,注释档案内置了动作序列、场景描述和COLMAP相机位姿模型。构建时采用了匿名化的HMAC标识符,确保数据来源的不可追溯性,同时保持了数据的原始性和完整性。
特点
该数据集的核心特点在于其深度信息的高精度与多模态对齐能力。深度数据以绝对度量单位(米)存储,分辨率为1920x1080,采用OpenEXR格式编码,并经过严格的审计确保通道一致性。每个片段的深度文件与视频帧数严格匹配,提供了逐帧的相机位姿和动作控制信号。数据集的规模虽小(20个片段),但其四维特性涵盖了空间和时间维度,为世界模型训练提供了细腻的感知基础。此外,数据集的注释采用标准化结构,支持可扩展的字段解析,便于研究者进行跨模态的联合建模。
使用方法
数据集的使用需遵循其精心设计的文件组织架构。研究者可通过metadata.jsonl获取匿名sample_id,进而利用Hugging Face的snapshot_download功能按需下载特定样本的视频、注释和深度分片。深度数据以TAR归档形式存储,通过OpenEXR库进行解析,可提取R通道深度图并验证通道一致性。注释文件提供了帧级动作控制向量和相机位姿信息,与COLMAP模型兼容,便于集成到现有的三维重建或生成框架中。值得注意的是,深度数据的绝对度量语义和位姿对齐精度需在应用前进行独立验证,以确保研究结果的可靠性。
背景与挑战
背景概述
ABot-World-Explorer-4D是由阿里巴巴AMAP数据部门于2026年发布的一个面向动作条件视频与度量深度感知研究的高质量数据集。该数据集作为ABot-World项目的重要组成部分,旨在为交互式世界模型提供底层数据基础设施,其核心研究问题在于如何构建具有绝对度量精度的多模态数据资源,以支撑动作条件下的视频生成、多模态对齐及智能体学习等前沿课题。该数据集通过整合20个场景片段的视频、动作注释、COLMAP相机位姿及海量OpenEXR深度图像,开创性地实现了度量深度信息与动作控制信号的同步采集,为世界模型研究提供了兼具物理精度与交互性的基准数据,对推动可交互虚拟环境构建及相关领域研究具有重要的奠基性作用。
当前挑战
该数据集所面临的挑战涵盖领域问题与技术构建两大维度。在领域问题方面,其致力于攻克动作条件视频预测中的空间认知与交互一致性难题,尤其是如何从单目视频中精准解耦相机运动与场景结构,实现以度量深度为支撑的可控视频生成;同时,它挑战了传统数据集在度量深度标注上的缺失,为世界模型提供了物理真实的几何先验。在构建过程中,数据集面临了多模态数据同步采集的严峻考验,包括数万级深度图像与视频帧在时间戳级严格配准的工程复杂性,以及COLMAP相机位姿在无稀疏点云条件下的纯位姿建模转换。此外,对OpenEXR深度文件进行的无损字节级保存策略,确保了数据源的保真性,但PXR24压缩带来的精度损失与深度语义的尚未完全界定,构成了数据使用中的潜在技术壁垒。
常用场景
经典使用场景
ABot-World-Explorer-4D 数据集作为 ABot-World 框架中具深度信息的子集,核心应用场景聚焦于动作条件视频生成与度量深度感知的世界模型研究。其提供的 20 个片段、超 18 万张 EXR 深度图及配套 COLMAP 位姿文件,为训练和评估以第一人称视角探索的智能体奠定了基础。研究者常利用该数据集的绝对度量深度信息(以米为单位,比例因子 1.0)来监督模型学习场景几何结构,并结合动作序列与视频帧,实现动作-视觉-深度联合建模。其紧凑的规模(20 个片段)使其成为快速验证世界模型构想、多模态对齐算法以及可控视频生成范式的理想实验平台,尤其适合在单块桌面级 GPU 上开展交互式环境回放研究。
解决学术问题
该数据集针对具身智能领域中长期存在的稀疏三维标注缺失问题,提供了以度量深度为核心的高质量视觉-动作-位姿同步数据,推动了动作条件视频生成从二维像素级预测向三维几何感知的范式跃迁。它解决了构建真实世界模拟器时面临的跨模态对齐难题,使得模型能够学习环境中动作与场景深度变化间的因果关联。在学术层面,ABot-World-Explorer-4D 支持了世界模型对物理规则和空间不变性的学习,促进了无需大量人工标注即可获得可泛化 3D 理解的研究路径。其发布为多模态学习社区提供了基准数据,助力验证深度信息在提升视频预测一致性、减少幻觉现象以及增强长时程交互稳定性方面的效用,对探索下一代智能体决策系统具有里程碑意义。
衍生相关工作
围绕 ABot-World-Explorer-4D 数据集,学术界已衍生多项引人注目的开创性工作。其奠基论文《ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU》提出了利用此数据集进行无限交互式世界回放的高效框架,通过紧凑的提示驱动机制实现在消费级硬件上的实时场景演化。后续研究探索了基于该深度信息的度量感知世界模型,旨在生成几何一致的长时程视频,其中代表性工作包括利用三维特征体素优化动作条件视频扩散模型。此外,该数据集启发了关于多模态对齐的研究,例如通过联合目标进行视觉-语言-动作-深度预训练,以提升跨场景泛化能力。尽管这些后续工作可能采用不同版本的扩展语料(如 ABot-World-Explorer-500h),但核心方法均借鉴了本 4D 子集在深度表示与位姿规范化方面的经验,共同勾勒出迈向通用智能体学习的基础设施蓝图。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务