遇见数据集

ACE-Data-0

收藏
arXiv2026-07-31 更新2026-08-01 收录
官方服务:

资源简介:

ACE-Data-0是一个大规模、多模态、长时域的人机交互数据集,由南洋理工大学和ACE机器人联合创建,旨在为具身智能研究提供同步感知与运动数据。该数据集包含150小时、1700万帧视频及75000个交互片段,覆盖200个任务类别,由50名参与者在2个家庭环境中完成,并同步采集了第一人称与多视角第三人称视频、全身运动捕捉、手部姿态、物体6D位姿、音频和触觉信号。数据创建采用目标级指令而非步骤式脚本,保留了自然行为变异性,通过多传感器同步校准系统确保时空对齐。该数据集主要服务于模仿学习、世界模型、视觉-语言-动作系统和具身AI基准测试,旨在解决从感知到动作全环路的学习瓶颈。

创建时间:
2026-07-31
原始信息汇总

ACE-Data-0 数据集概述

基本信息

  • 数据集名称:ACE-Data-0(Human-Centric Ambient Capture as Embodied Data Engine)
  • 发布机构:新加坡南洋理工大学 S-Lab 与 ACE Robotics
  • 许可协议:ACE-Data-0 研究许可协议,仅限非商业学术研究使用
  • 语言:英语
  • 数据规模:10K < n < 100K
  • 访问方式:门控访问(需提交申请表格)

数据规模

指标 数值
录制活动时长 150小时以上
视频帧数 1700万帧以上
交互片段数 75,000以上
任务类别 200以上
参与人数 50以上
采集环境数 2个
同时视角数 8个外部视角 + 4个第一人称鱼眼视角

采集场景与设备

双尺度采集配置

特征 桌面级 房间级
空间面积 约30平方米桌面工作区 约200平方米家具齐全公寓
目标 精细手-物体操作 全身活动与移动
外部RGB相机 8×GoPro(距离0.3-0.5米) 8×ZED One(任意点至少4视角覆盖)
光学动作捕捉 16×OptiTrack PrimeX 22 12×OptiTrack PrimeX 22
手部姿态 8视角三角测量+人工精修 Manus动作捕捉手套@60Hz

参与者穿戴设备

  • ACE-Ego-Head-V02 Lite 头戴设备(4个鱼眼相机、IMU、5个追踪标记点)
  • 41标记点动作捕捉服
  • 全掌触觉传感手套

数据模态(每条数据包含)

模态 内容
第一人称视频 4个鱼眼视角@20 FPS,含IMU和每帧头戴设备6自由度位姿
外部视频 8个同步视角@30 FPS,含内参和世界坐标位姿
人体运动 41关节骨架、手部姿态、SMPL-X参数
物体状态 扫描或2DGS网格、6自由度位姿@60Hz、多视角2D/3D边界框、运动轨迹
音频 外部相机和头戴设备的多源音频
触觉 全掌压力分布,已归一化和基线校正
语言 分段活动描述、任务目标和子目标序列

数据类别

  • 原子人-物交互(atomic HOI):1-3个家务任务,约3分钟
  • 人-物交互链(chains of HOI):连续活动约20-30分钟,结束后场景恢复整齐
  • 人-场景交互(human-scene interaction):全身运动和家具接触,几乎无物体,约5分钟

时空对齐技术

  • 时间同步:所有设备注册到OptiTrack 60Hz时钟,通过拍摄纳秒级分辨率时钟实现毫秒级残差
  • 空间标定:使用带反光角点的ArUco板连接无公共视野的外部相机(中位重投影误差<3像素),头戴设备通过手眼标定求解(约2像素误差)

基准测试

  • 留出10小时作为测试集
  • 评估30多种已发表方法,涵盖三个层面:视频触觉推断、人体运动恢复、第一人称和外部视角手部运动
  • 现有方法在接触、遮挡、自运动和长时程场景下表现显著下降

访问条件

  • 仅限非商业学术研究,授予指定个人使用
  • 需使用机构邮箱申请,提交研究用途说明
  • 访问权限个人专属、不可转让,禁止重新分发
  • 禁止识别、重新识别或分析参与者;禁止生物识别、监控或特征分析
  • 数据文件尚未发布,将在后续版本中发布

引用信息

bibtex @article{cao2026acedata0, title = {ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine}, author = {Cao, Yukang and Xie, Haozhe and Wen, Beichen and Yao, Runmao and Liu, Yinghao and Huang, Yue and Liao, Zhichao and Wang, Yunxiang and Liu, Haiheng and Tian, Xingshun and Su, Dawei and Zhuo, Long and Tao, Dacheng and Wang, Xiaogang and Pan, Liang and Liu, Ziwei}, journal = {arXiv preprint arXiv:2607.28625}, year = {2026} }

搜集汇总
数据集介绍
ACE-Data-0 数据集图片
构建方式
ACE-Data-0依托环境捕捉引擎(ACE)构建,该引擎将真实家居环境转化为空间校准、时间同步的录制空间。系统采用桌面尺度与房间尺度两种互补配置,前者以密集近距相机与高分辨率触觉传感解析精细的手物操作,后者以广基线相机与光学动作捕捉覆盖整个家居环境。所有传感器流经光学时钟同步至毫秒级,并通过标记桥接校准统一至共同世界坐标系。数据采集由50名参与者在2个环境中完成,涵盖200种任务类别,共计150小时、1700万帧图像与75000个交互片段。参与者依据目标级指令自由行动,保留了自然的行为变异性。
特点
ACE-Data-0的核心优势在于多模态数据的时空对齐与丰富标注。每段序列同步记录第一视角与多视角外部视频、全身与手部运动、物体6自由度轨迹、音频与触觉信号,且所有模态均在同一时间轴与世界坐标系内注册。数据广泛覆盖原子操作、长时序复合任务及人-场景交互,其标注包括人体与手部姿态、物体网格与位姿、触觉压力图、音频描述及自然语言文本。得益于同步记录特性,各训练信号均对应同一物理时刻,为具身智能研究提供了统一的多感官基元。
使用方法
ACE-Data-0可直接用于多种具身智能任务。研究者可依据需求自由组合模态,例如以第一视角视频为输入、触觉信号为监督,训练视觉-触觉预测模型;或利用多视角视频与运动捕捉数据,评估和提升人体姿态估计与手部重建算法。该数据集亦支持跨视角分析,可对比第一人称与第三人称下的交互理解差异。由于所有模态均同步对齐,其亦能作为模仿学习、世界模型与视觉-语言-动作系统的训练语料,通过目标导向的行为演示与丰富的状态标注,促进机器人学习从感知到动作的完整闭环。数据集的层级化基准(信号级、场景组件级、交互级)则为系统评估不同感知能力提供了标准框架。
背景与挑战
背景概述
ACE-Data-0数据集由南洋理工大学S-Lab与ACE Robotics联合构建,于2026年发布,旨在突破具身智能领域的数据瓶颈。该数据集通过创新性的环境捕获引擎(ACE),将真实家居环境改造为时空同步的录制空间,以桌面级与房间级双尺度配置,同步采集第一人称与多视角第三人称视频、全身与手部运动、物体6D轨迹、多通道音频及触觉信号。数据集涵盖150小时、75,000个交互片段、1700万帧图像,涉及200种任务类别,由50名参与者在2个真实家居环境中完成。其核心研究问题在于为具身智能提供完整的感知-行动闭环数据,以支持模仿学习、世界模型及视觉-语言-动作系统的研究。该数据集通过将不同模态数据在统一时空坐标系下对齐,为具身智能研究提供了前所未有的物理监督基准,对相关领域具有深远影响。
当前挑战
ACE-Data-0面临多重挑战。在领域层面,现有数据集多存在模态碎片化、环境非自然及时间跨度短等问题,难以支撑长时程、目标导向的复杂交互理解。在构建过程中,需解决多传感器硬件同步困难(如相机、惯性测量单元、触觉手套间的时间对齐)、跨视角空间标定(如稀疏视角下的相机位姿估计)、以及在大规模数据采集下保证标注质量与一致性问题。此外,长时程数据中的遮挡、极端视角、自我运动等也构成了对现有方法评估的严峻考验,亟需发展融合多视角与多模态信息、具备物理约束的鲁棒感知模型。
常用场景
经典使用场景
ACE-Data-0作为大规模多模态具身智能数据集,其经典使用场景在于为长时程家庭环境中的具身交互研究提供统一基准。该数据集通过同步采集第一视角与多视角第三人称视频、全身与手部运动捕捉、物体6自由度轨迹、音频及触觉信号,构建了感知-行动闭环的完整记录。研究者可基于其150小时、涵盖200种任务类别的丰富数据,开展从原子操作到复杂人机物交互的各类研究,尤其适合验证具身智能体在真实家庭环境中感知、推理与执行能力的综合表现。
实际应用
在实际应用层面,ACE-Data-0为机器人学习领域提供了宝贵的训练资源。其同步的人体示范数据可直接用于模仿学习、视觉-语言-动作模型及世界模型的开发,加速具身智能体在家庭场景中的技能习得。数据集中的触觉与多视角视频为触觉感知预测研究提供了坚实基础,有助于提升机器人在遮挡条件下的操作可靠性。同时,其层级化基准测试框架为评估各类感知算法提供了标准化的测试平台,促进学术成果向实际机器人系统的转化落地。
衍生相关工作
ACE-Data-0衍生了多项开创性工作。基于其数据特性,研究者开发了跨模态触觉预测方法,如从视觉观测估计手部压力分布,显著提升了接触感知的准确性。在人体运动恢复领域,该数据集催生了多视角融合与场景感知的新架构,推动了全局轨迹估计技术的进步。此外,其丰富的标注信息启发了手物交互重建、具身智能评估协议等一系列后续研究,形成了一个活跃的研究生态,持续扩展着数据集的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务