遇见数据集

Open-AoE-2000H

收藏
github2026-07-15 更新2026-07-17 收录
官方服务:

资源简介:

Open-AoE是一个大规模、真实世界的以自我为中心的操纵数据集,完全使用消费级智能手机收集。它提供约2000小时的第一人称视频,包含同步的手部运动、相机运动和双语原子动作标注。该仓库将这些信号连接到可视化、人机重定向、机器人重放和模型特定训练配方。

Open-AoE is a large-scale, real-world egocentric manipulation dataset collected exclusively using consumer-grade smartphones. It provides approximately 2000 hours of first-person videos, accompanied by synchronized hand movements, camera motions, and bilingual atomic action annotations. This repository links these signals to visualization, human-robot redirection, robot replay, and model-specific training recipes.

创建时间:
2026-07-07
原始信息汇总

数据集概述:Open-AoE

Open-AoE 是一个大规模、真实世界的自我中心操作数据集,完全使用消费级智能手机收集。它提供了约 2,000 小时 的第一人称视频,并同步了手部运动、相机运动和双语言原子动作标注。该仓库连接了这些信号与可视化、人-机器人重定向、机器人回放以及模型特定的训练方案。

核心数据资源

资源 访问方式 说明
技术报告 浏览 技术报告 PDF 包含数据集设计、处理、分析、工具链和实验内容。
数据集 Open-AoE-2000H Hugging Face · ModelScope 包含数据集文件和发布信息。
数据规范 字段级文档 说明目录结构、模式、坐标系和验证说明。
采集应用 即将发布 智能手机数据采集客户端。

数据集信号与用法

每个数据段是一个同步的多模态记录,包含以下主要信号:

信号 主要工件 典型用途
原始和去畸变RGB raw_video.mp4, raw_video_undistorted.mp4 视觉观察、视频建模和叠加。
相机元数据 video_info.json, undistorted_video_info.json 内参、畸变、设备信息、分辨率和帧率。
相机运动 camera_traj.npz 公制尺度6自由度轨迹和世界/相机变换。
手部重建 hands.npz 逐帧双手MANO姿态、形状、根部变换和有效性。
原子动作 ego_action_annotation.json 时间对齐的动作,包含手、动词、物体和双语描述。

工具链与入门路径

从原始数据到模型输入的完整工具链分为三个阶段:

阶段 组件 输出
检查 AoE-Visualization 每个数据段的回顾视频,用于视觉和时间质量检查。
重建/重定向 AoE-Reconstruct-Retarget 重建资产、机器人轨迹、模拟验证和机器人化视频。
转换/训练 AoE-Training-Ready 模型特定的数据集、动作、补丁、启动器和训练方案。

用户可根据需求选择不同的起始点:

关键特性

  • 智能手机优先采集:使用消费级设备使真实世界自我中心数据的采集变得可访问和可扩展。
  • 操作对齐信号:校准的RGB与相机运动、MANO手部重建、有效性遮罩和原子动作同步。
  • 完整的数据到模型路径:该仓库覆盖了检查、重定向、表示转换和模型特定的训练集成。
  • 模块化和可扩展:组件可独立使用,新的机器人实体或模型方案可作为自包含集成添加。

数据处理与质量控制

数据经过以下质量控制流程:

  1. 设备端采集控制:检查手部可见性、佩戴条件、光照、运动质量和设备健康状态。
  2. 离线质量控制与场景标注:过滤无效或敏感内容,标准化帧率,切片视频,并分配场景/任务元数据。
  3. 重建与标注:估计相机轨迹,重建MANO手部,并生成原子动作片段。
  4. 质量检查与交付:应用完整性、正确性和时间一致性检查,随后进行人工审查。

仓库结构

Open-AoE/ ├── Open-AoE-tech-report.pdf # 当前技术报告 ├── open-aoe-2000h/ # 数据集格式和字段级文档 ├── aoe-visualization/ # 同步数据回顾和渲染 ├── aoe-reconstruct-retarget/ # 重建、重定向、回放和叠加 ├── aoe-training-ready/ # 模型适配器、转换器、启动器和补丁 ├── assets/mano/ # 共享MANO设置帮助;模型文件未跟踪 ├── docs/ # 概览和流水线图 ├── CONTRIBUTING.md ├── LEGAL.md └── LICENSE

许可与第三方组件

  • 仓库中的原始源代码遵循 Apache 2.0许可
  • 数据集发布条款、模型权重、机器人资产、MANO文件和第三方组件可能使用不同的许可。在重新分发或商业使用前,请阅读 LEGAL.md 和相关子项目的README。
搜集汇总
数据集介绍
Open-AoE-2000H 数据集图片
构建方式
Open-AoE-2000H数据集依托消费级智能手机进行大规模真实世界第一人称操作数据采集,构建了一套从原始信号到模型输入的完整工具链。采集阶段,手机端应用实时监控手部可见性、光照条件及运动质量,确保上传内容符合质量标准。离线处理阶段,系统对视频进行帧率标准化、场景标注及敏感内容过滤,随后通过重建与标注流程估计相机轨迹、重构MANO手部模型并生成原子动作分割。最终,经过完整性、正确性与时间一致性检验后交付数据,形成涵盖RGB视频、相机运动、手部重建及双语动作注释的多模态同步记录。
特点
该数据集的核心优势在于其真实世界适用性与端到端可用性。首先,完全基于普通智能手机采集,大幅降低了第一人称操作数据的获取门槛,实现了规模化与可扩展性。其次,数据包含校准RGB视频、度量级6自由度相机轨迹、双手MANO参数化重建、有效性掩码以及带时间戳的原子动作标签,信号高度对齐且丰富。尤为突出的是,数据集不仅提供原始信号,更配备了面向视觉-语言-动作策略、世界模型等多种模型的训练转换配方,形成了从数据审查、人体至机器人运动重定向到模型专项训练的完整通路,结构模块化且易于扩展。
使用方法
使用者可根据不同目标灵活切入数据集的各个模块。如需了解单段数据内容,可查阅数据规范文档并利用可视化工具生成包含手部、轨迹、动作及3D视图的同步回顾视频。若需训练策略模型,数据集中集成了多个自包含的模型适配器,包括数据转换脚本、环境配置、训练指令及补丁,覆盖ACT、Diffusion Policy、GR00T N1.7等主流VLA策略以及DreamZero等世界模型。对于机器人重定向任务,可通过重建与重定向子项目将人类运动映射至Unitree G1、Galbot等机器人平台,生成仿真验证与机器人执行视频。所有工具均具备独立使用能力,新增模型或机器人集成可通过遵循贡献指南以自包含形式添加。
背景与挑战
背景概述
Open-AoE-2000H数据集由蚂蚁集团研究团队于2024年创建,是一项面向真实世界第一人称视角操作行为的大规模采集工程。该数据集以消费级智能手机为采集终端,收录了约2000小时的日常操作视频,并同步提供手部运动、相机轨迹及双语原子动作标注等丰富模态信息。其核心研究问题在于弥合人类自然操作与机器人技能学习之间的鸿沟,通过构建从数据采集到模型训练的一体化工具链,为视觉-语言-动作模型、世界模型及视频动作模型等前沿方向提供标准化的训练支撑。该数据集的发布显著推动了具身智能领域的数据基础设施发展,为跨平台机器人操作的泛化研究奠定了重要基石。
当前挑战
该数据集所解决的领域挑战在于,现有机器人学习数据集多依赖实验室环境或仿真平台,难以覆盖真实世界中智能手机采集的多样化操作场景,且常缺乏高精度的手部重建与动作语义对齐信息。Open-AoE-2000H通过整合时域对齐的6自由度相机轨迹、MANO手部参数及原子动作标注,填补了真实环境下大规模自我中心操作数据的空白。在构建过程中,团队面临的主要挑战包括:确保智能手机在不同光照与遮挡条件下手部可见性的实时检测、多设备采集帧率的标准化处理、以及海量视频数据中动作片段的自动切分与语义标签的精准生成,最终通过多层质量控制流水线保障数据的一致性与可靠性。
常用场景
经典使用场景
在具身智能与机器人学习领域,大规模真实世界的第一人称操作数据是训练视觉-语言-动作(VLA)模型的关键资源。Open-AoE-2000H作为一项里程碑式的数据集,凭借其2000小时的智能手机原生采集视频,以及同步的手部运动、相机轨迹和双语原子动作标注,为从人类演示到机器人策略的端到端迁移提供了完整的训练范式。研究者可借助该数据集训练诸如ACT、Diffusion Policy、π0.5、SmolVLA等VLA策略,以及DreamZero、iVideoGPT等世界模型,实现从视觉观察到动作生成的高效映射。
解决学术问题
长期以来,学术界面临着真实操作数据匮乏、采集成本高昂且缺乏标准化标注的困境,这严重制约了通用操作模型和具身智能体的泛化能力。Open-AoE-2000H的创新之处在于,它通过消费级智能手机的普及性采集,解决了数据规模化、异质性与精细动作标注之间的矛盾。该数据集不仅首次在2000小时规模上实现了多模态信号的精确同步(包括MANO手部重建、6-DoF相机轨迹与原子动作分割),还提供了完整的数据到模型的工具链,从而降低了机器人学习研究的实验门槛,推动了操作策略在跨物体、跨场景中的可迁移性研究。
衍生相关工作
基于Open-AoE-2000H,研究社区已衍生出一系列具有影响力的学术工作。在VLA策略方面,SmolVLA、GR00T N1.7、H-RDT和VITRA等模型通过该数据集提供的动作编码规范进行了适配训练,显著提升了少样本场景下的操作准确性。在世界模型领域,DreamZero和iVideoGPT借助其海量第一人称视频数据探索了隐式动作空间的学习。此外,AoE-Reconstruct-Retarget子项目中的Phantom和Retarget Lab模块推动了人体到机器人运动重定向的标准化评测,为灵巧手与双臂平台的技能迁移建立了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务