HumanEgo
收藏数据链接:
官方服务:
资源简介:
HumanEgo数据集:一个包含原始Aria录制和MPS处理标注的人类自我中心视频数据集,用于零样本机器人学习。数据集托管在HuggingFace上,无需登录或令牌即可访问。
HumanEgo Dataset: A human egocentric video dataset containing raw Aria recordings and MPS-processed annotations, tailored for zero-shot robotic learning. The dataset is hosted on HuggingFace and accessible without login or access tokens.
创建时间:
2026-05-24
原始信息汇总
数据集概述:HumanEgo
- 名称:HumanEgo
- 全称:HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos
- 核心目标:通过少量(分钟级)人类第一人称(自我中心)视频,实现机器人的零样本学习。
数据集信息
- 数据来源:使用 Project Aria Gen 1 智能眼镜进行录制,并经过 MPS(SLAM + 手部追踪)流程处理。
- 数据托管:数据集(原始 Aria 录制数据 + MPS 处理后的标注)发布在 HuggingFace 公共数据集
Leo-TX/HumanEgo上,无需登录或 Token 即可下载。 - 数据内容:包含人类自我中心视角的视频、SLAM 数据及手部追踪标注。
- 数据规模:目前提供示例录音供端到端测试,后续将发布包含更多任务(如
serve_bread、water_flowers)的完整数据集。 - 下载方式:通过官方 GitHub 仓库中的
scripts/download_data.py脚本进行下载,支持选择任务和数量(例如:python scripts/download_data.py --task serve_bread --num 20)。
数据集用途
- 研究领域:机器人学习、零样本学习、人机交互、计算机视觉。
- 核心任务:从人类自我中心视频中学习机器人操作技能,实现零样本迁移。
数据集组成与处理
- 预处理:提供完整的预处理流程,包括 SLAM 重建、手部追踪、物体检测等,使用了 SAM 2、Grounding DINO、CoTracker 等视觉基础模型。
- 训练:基于流匹配(Flow Matching)的训练框架,配置文件位于
cfg/training/目录下。 - 推理:推理阶段文档待完善。
相关资源
- 官方网站:https://humanego-ai.github.io
- 论文:arXiv:2605.24934
- 视频介绍:YouTube
- 引用格式:可参考官方提供的 BibTeX 条目。
搜集汇总
数据集介绍

构建方式
在机器人学习领域,如何从少量人类演示中高效提取可迁移技能一直是关键挑战。HumanEgo数据集依托Project Aria第一人称眼镜进行采集,记录人类执行日常操作任务(如摆放面包、浇花)时的头戴式视频。数据经过MPS系统(SLAM与手部追踪)处理,输出包含了3D空间轨迹、手部姿态及物体交互信息的密集注释。用户可通过HuggingFace平台直接下载原始录像与预处理后的标注结果,亦可利用提供的端到端采集脚本自行录制新数据,并运行全套预处理流程完成从原始传感器数据到结构化训练样本的转化。
使用方法
使用HumanEgo数据集时,研究者可通过HuggingFace API一键下载特定任务(如serve_bread)的示例记录,包含原始视频与预处理完成的训练数据。下载后执行预处理脚本可复现完整的GPU管线,生成最终用于训练的特征。训练阶段通过调用FlowMatchingTrainer并指定任务配置(YAML文件),可针对性地学习该任务的动作生成模型。当前数据集已完成样本下载、预处理及训练流程的文档化,推理接口正处于发布阶段,旨在实现从人类视频到机器人指令的端到端映射。
背景与挑战
背景概述
HumanEgo数据集由马里兰大学与Meta等机构的研究人员于2026年联合创建,核心研究人员包括Zhi Wang、Botao He、Kelin Yu等。该数据集旨在解决机器人学习领域长期存在的样本效率低下与语义理解匮乏问题,通过利用人类自我中心视角短视频(分钟级),推动机器人从人类日常操作行为中零样本学习。其研究问题聚焦于如何从稀疏的自我中心视频中提取可泛化的操作技能,以跨越仿真环境与现实世界的鸿沟。HumanEgo通过集成Project Aria眼镜采集的真实操作数据与多模态感知管道,为机器人提供高保真的人类手-物交互轨迹,在具身智能领域具有里程碑意义,有望降低机器人部署对大规模物理演示的依赖。
当前挑战
HumanEgo所面临的挑战涵盖算法与构建两大维度。在领域问题层面,如何从零样本的自我中心视频中解析出丰富的语义信息与精准的动作轨迹,并泛化至未见过的机器人平台与操作环境,是亟需突破的核心难题。在数据集构建过程中,研究人员需克服多模态数据同步的复杂性,包括处理头戴式摄像机采集时的抖动与遮挡,以及从单一视角中鲁棒重建手部骨骼与物体空间位姿。此外,大量标注数据的手工精修成本极高,而自动化预处理流程(如MPS系统)虽能部分缓解,但仍需应对场景光照变化、干扰物伪影等现实噪声,确保训练数据的保真度与多样性。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,HumanEgo数据集以其独特的自我中心视角(egocentric view)与高效的数据采集范式脱颖而出。该数据集借助Project Aria智能眼镜采集人类日常操作视频,如倒水、浇花等服务型任务,并融合SLAM、手部追踪与视觉基础模型(如SAM 2、Grounding DINO)生成高精度关节动作标注。其经典使用场景在于仅凭数分钟的人类自我中心视频片段,即可驱动机器人进行零样本(zero-shot)的技能迁移学习,突破传统依赖大规模专家演示或遥操作数据的瓶颈,为机器人从人类第一视角视频中自主习得物理操作能力提供了标准化基准平台。
解决学术问题
HumanEgo数据集直面具身智能领域中长期存在的两大核心挑战:一是如何从非结构化、无标注的人类日常视频中高效提取具备物理可行性的机器人控制信号;二是如何弥合人类演示与机器人执行之间的形态学与运动学差异。通过引入自我中心视频与多模态基础模型的联合标注流程,该数据集解决了模仿学习在低成本数据获取上的痛点,使得机器人能够以零样本方式泛化至新任务与物体。这一工作在学术上验证了从第一视角视频直接解码机器人动作的可行性,推动了跨实体(cross-embodiment)技能迁移的理论发展,并为后续探索数据效率、泛化边界与长时域任务规划奠定了关键实证基础。
实际应用
在实际应用层面,HumanEgo数据集为家庭服务与轻工业场景中的机器人快速部署提供了切实路径。例如,在厨房助手任务中,机器人可通过观看人佩戴智能眼镜完成的几段“摆盘”视频,自主学习抓取、放置与协调动作,而无需人工编程或重复遥操作。在物流仓储中,该数据集支持人形机器人通过观察人类工人搬运与整理货物的第一视角记录,迅速适应不同包装与货架布局。此外,其零样本特性极大降低了新场景下的数据收集门槛,使得非技术用户也能通过录制日常操作来定制机器人行为,在智能家居、康复辅助与教育陪伴等交互式服务领域展现出广泛的应用前景与商业潜力。
数据集最近研究
最新研究方向
面向零样本机器人学习的自我中心视觉数据集构建与跨模态行为迁移。随着具身智能的快速发展,如何让机器人从少量人类日常活动视频中高效学习操作技能成为前沿热点。HumanEgo数据集通过采集人类佩戴Project Aria眼镜的第一人称视角录像,结合MPS同步定位与建图、手部追踪等先进技术,提供了精细化的物体交互与手部运动标注。该研究方向紧密关联大规模视觉基础模型(如SAM 2、Grounding DINO)与流匹配训练范式,探索从分钟级自我中心视频到机器人零样本策略学习的可行路径,为降低机器人技能获取成本、推动通用操作智能发展提供了重要数据支撑与方法论突破。
以上内容由遇见数据集搜集并总结生成




