遇见数据集

ABot-World-Explorer-500h

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

ABot World Explorer 500h 是一个用于动作条件视频预测和可控世界模型研究的数据集。该数据集包含30,969个视频片段,每个片段对应一个动作条件视频,并附带键盘动作、字幕和COLMAP文本稀疏模型。数据集的样本标识符为匿名HMAC标识符,每个样本包含一个MP4视频文件和一个注释归档文件(annotations.tar),其中包含action.json(动作序列数据)、caption.json(字幕描述)和COLMAP稀疏模型文件(cameras.txt, images.txt, points3D.txt)。数据集规模为30,969个片段,源对象数量为185,814个,无语义分割,许可证为Apache-2.0。数据集旨在支持动作条件视频预测、可控世界模型、表示学习和智能体学习等研究任务。用户需自行评估其适用性、偏差、安全性和法律义务。

ABot World Explorer 500h is a dataset for action-conditioned video prediction and controllable world model research. It contains 30,969 video clips, each corresponding to an action-conditioned video, accompanied by keyboard actions, captions, and COLMAP text sparse models. The sample identifier is an anonymous HMAC identifier. Each sample includes an MP4 video file and an annotation archive (annotations.tar), which contains action.json (action sequence data), caption.json (caption descriptions), and COLMAP sparse model files (cameras.txt, images.txt, points3D.txt). The dataset size is 30,969 clips, with 185,814 source objects, no semantic segmentation, and licensed under Apache-2.0. The dataset is intended to support research tasks such as action-conditioned video prediction, controllable world models, representation learning, and agent learning. Users are advised to evaluate its suitability, biases, safety, and legal obligations.

创建时间:
2026-07-30
原始信息汇总

ABot World Explorer 500h 数据集详情

数据集概述

ABot World Explorer 500h 是一个包含 30,969 个动作条件视频片段(action-conditioned video episodes)的数据集,与 ABot-World-0 论文(arXiv:2607.19191)中描述的数据基础设施相关联。该数据集主要用于动作条件视频预测、可控世界模型、表示学习和智能体学习等研究方向。

关键统计信息

项目 数值
视频片段数 30,969
源对象数 185,814
语义划分
许可证 Apache-2.0

注意:仓库名称中的"500h"仅作为标识符,并非经过审计的时长声明。确切时长、帧率、帧数和对齐统计信息本数据集不进行声明。

数据组织与格式

目录结构

meta/abot-world-explorer-poster.png metadata.jsonl data/<prefix>/<sample_id>/video.mp4 data/<prefix>/<sample_id>/annotations.tar LICENSE README.md

  • sample_id 为匿名 HMAC 标识符
  • annotations.tar 为确定性生成、未压缩的 POSIX USTAR 归档文件,包含 action.jsoncaption.json 及完整 COLMAP 稀疏模型(sparse/0/{cameras,images,points3D}.txt
  • 源键和 OSS 位置不对外发布

数据文件格式说明

video.mp4:保留源 MP4 字节,发布时不进行转码处理。

action.json:UTF-8 JSON 对象,包含序列元数据和 frames 数组。主要字段包括:

字段 说明
control_scheme 源控制方案名称
original_fps, fps 源帧率与采样帧率
sample_stride 相对源序列的采样步长
start_frame_index, end_frame_index, total_frames 序列/帧范围元数据
thresholds 方案特定的控制阈值(可能为空)
frames 每采样帧一个有序控制记录的数组

每个 frames[] 对象包含 frame_idtimestampkeys(控件名到布尔值的映射)以及四个长度为 3 的数值向量:delta_translation_camdelta_translation_cam_smoothdelta_euler_degdelta_euler_deg_smooth。旋转增量以度为单位。

caption.json:UTF-8 JSON 对象,包含 perspectivescene_staticnarrative 字符串和 dense_temporal 数组(可能为空)。字符串值中的完整令牌私有源路径标识符会被替换为 [redacted]

COLMAP 位姿文件cameras.txtimages.txtpoints3D.txt 三个文件组成一个完整的 COLMAP 文本稀疏模型,必须一起解读。采用 Hamilton 四元数描述世界坐标到相机坐标的映射,COLMAP 相机轴为 +X 右、+Y 下、+Z 前。

使用说明

选择性下载

支持通过完整提交 ID(commit ID)进行可复现的下载,可从 metadata.jsonl 获取匿名 sample_id,再据此推导对应的视频和标注文件路径。

预期用途与限制

  • 适用场景:动作条件视频预测、可控世界模型、表示学习、智能体学习研究
  • 限制:并非符号模拟器,不保证物理、因果、人口或地理覆盖范围。用户需自行评估下游使用的适用性、偏差、安全性和法律义务。

引用信息

对应的论文为《ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU》(arXiv:2607.19191),可通过 arxiv.org/abs/2607.19191 访问。

扩展数据访问

如需额外数据访问或定制数据集需求,可通过 phys_ai_data@service.alibaba.com 联系高德数据部门。

搜集汇总
数据集介绍
ABot-World-Explorer-500h 数据集图片
构建方式
ABot World Explorer 500h数据集依托于ABot-World-0项目的数据基础设施精心构建而成,共包含30,969个动作条件视频片段。每个片段均配备MP4格式的视频文件、数据集原生的键盘动作记录、语义化文字描述以及一套完整的COLMAP文本稀疏模型。数据集的构建过程严格遵循匿名化处理原则,每次样本均基于HMAC生成匿名标识符,确保源数据的关键信息不被泄露。视频文件保留原始的MP4编码格式,未经过转码处理,保证了数据的原始性。动作和描述信息分别存储于独立的JSON文件中,而相机的姿态参数则通过COLMAP文本格式进行组织,这一系列精细化的设计确保了数据的结构清晰、易于解析与使用。
特点
该数据集的核心特色在于其高度的结构化和丰富的注释信息。每个视频片段不仅包含视觉内容,还附带了精确到帧的动作指令、多视角的文字描述以及稀疏的三维重建模型,为相关的科学研究提供了多维度的数据支持。数据集的规模可观,源自超过18万个源对象,覆盖了多样的场景与交互。值得注意的是,数据集的注释文件采用了确定性的、未压缩的POSIX USTAR格式进行打包,确保了数据的完整性与可重复性。此外,数据集的预览索引仅包含匿名标识符和不可变的资源链接,既保障了数据的安全访问,又便于用户高效地浏览与获取数据,体现了其设计上的严谨与实用。
使用方法
该数据集面向动作条件视频预测、可控世界模型、表征学习及智能体学习等前沿研究方向。使用过程中,用户首先需通过metadata.jsonl文件获取样本的匿名标识符,随后基于该标识符推导出对应的数据路径,并可利用快照下载接口按需获取所需的数据文件。数据文件以视频与打包的注释文件形式提供,注释包含动作序列、文字描述和相机姿态参数。处理数据时,用户须遵循安全规范,对解压的成员文件进行严格的路径与哈希校验,以避免潜在的安全风险。特别提醒,由于数据集中部分跨模态对齐参数可能未明确标注,使用者在充分利用数据的同时,需依据自身研究需求审慎评估其适用性,并承担相应的安全与合规义务。
背景与挑战
背景概述
ABot World Explorer 500h是由高德地图计算机视觉实验室于2025年发布的大规模动作条件视频数据集,由Jiang等人主导构建,包含30,969个视频片段,总计超过500小时的探索性交互数据。该数据集旨在为可控世界模型、动作条件视频预测及智能体学习提供基础设施,其构建过程融合了多模态数据(视频、键盘动作、字幕及COLMAP稀疏重建模型),以促进具身智能体在真实物理世界中的推理与泛化能力。作为ABot-World-0项目的一部分,该数据集填补了真实世界探索数据在规模与多样性上的空白,推动了视频生成、表征学习及智能体决策领域的交叉研究,并已发布相关学术论文,对世界模型领域产生了显著影响。
当前挑战
该数据集面临的挑战主要涵盖两方面:其一,领域固有难题——真实世界探索中视频与动作间的时序对齐、多模态信息(视觉、控制信号、语义字幕)的集成,以及稀疏COLMAP模型在复杂动态场景下的精确重建,均需克服噪声与不确定性,以确保数据质量与物理一致性;其二,构建过程中的挑战——需在匿名化前提下平衡隐私与完整性的矛盾,即对源路径进行HMAC哈希与[redacted]处理,同时保证数据可复现性;此外,数据格式的异构性(如动作阈值、语义分段可能缺失)要求消费者具备稳健的解析能力,而选择性下载机制虽优化了存储,却增加了数据管理的复杂性。
常用场景
经典使用场景
ABot World Explorer 500h数据集作为动作条件视频预测领域的基石性资源,其经典使用场景聚焦于构建可控世界模型与智能体行为学习。研究者利用其30,969个带有原生键盘动作标注、语义描述及COLMAP稀疏重建模型的视频片段,训练模型根据输入的离散动作序列生成连贯的未来帧,从而探索从感知到决策的端到端预测范式。该数据集特别适用于评估模型在复杂真实场景中的泛化能力,以及研究动作与视觉演化之间的因果关系,为开发具备空间理解与交互能力的视觉预测系统提供了标准化的训练与测试平台。
实际应用
在实际应用中,该数据集为机器人操作、自动驾驶仿真及虚拟交互内容生成等技术提供了宝贵的数据基础。例如,机器人开发者可借此训练视觉运动策略,使智能体依据环境反馈做出反应,提升其在未知场景中的自适应能力。在游戏或虚拟现实领域,数据集支持构建交互式环境,用户的操作能实时驱动画面演化,增强沉浸感。此外,该数据集的开放许可和结构化格式,便于企业快速部署于数据驱动的仿真平台,用于验证算法鲁棒性,从而缩短产品研发周期并降低实地测试成本。
衍生相关工作
该数据集衍生了一系列开创性工作,主要集中在世界模型架构创新与交互式视频生成方向。例如,基于此数据集训练的ABot-World-0模型展示了在单块桌面GPU上实现无限交互式世界展开的能力,其采用的动作条件扩散或自回归框架为可控视频生成树立了新范式。后续研究可能进一步拓展至多模态融合,利用COLMAP位姿信息增强空间一致性,或开发更高效的动作编码器以支持毫秒级实时响应。此外,该数据集还催生了关于数据质量评估、跨领域适配和物理约束生成等子课题,形成了活跃的研究脉络,推动着从视频预测向通用智能体模拟器的加速演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务