遇见数据集

ego2act-bench

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Ego2Act Benchmark是一个用于评估以目标为导向的操作的自我中心视频生成基准。它要求视频模型基于单张自我中心起始帧和一个高层次目标(例如“笔记本电脑盖打开,钥匙和笔一起放在笔记本电脑左侧”)生成真实的多步操作视频。该数据集包含任务本身以及人类参考录制视频。cases子集(默认)每行对应一个任务,包含任务标识符、起始图像、目标描述、生成提示、领域(如厨房/食物准备、办公室/学习空间、家庭组织/存储、个人护理/公用设施等)、所需动作类型、动作族、物体族、涉及物体数量、人类成功录制的平均操作步数、平均时长,以及各类视频数量。人类录制视频位于human/目录下,以480p H.264格式提供,每项任务最多有3个成功和3个失败的模拟录制视频。数据集用于评估图像到视频模型作为目标导向操作模拟器的性能,以及研究自动视频评估器。数据规模小于1000个样本。许可为CC BY 4.0。

The Ego2Act Benchmark is a benchmark for evaluating goal-oriented action in egocentric video generation. It requires video models to generate realistic multi-step operation videos based on a single egocentric starting frame and a high-level goal (e.g., laptop lid open, keys and pen placed together on the left side of the laptop). The dataset contains task descriptions and human reference recordings. The cases subset (default) has one row per task, including task identifier, starting image, goal description, generation prompt, domain (e.g., kitchen/food preparation, office/study space, home organization/storage, personal care/utilities, etc.), required action type, action family, object family, number of objects involved, average number of operation steps for successful human recordings, average duration, and counts of various videos. Human recordings are in the human/ directory, provided in 480p H.264 format, with up to 3 successful and 3 failed simulated recordings per task. The dataset is used to evaluate image-to-video models as goal-oriented action simulators and to study automatic video evaluators. The data size is less than 1000 samples. License: CC BY 4.0.

创建时间:
2026-09-29
原始信息汇总

Ego2Act Benchmark 数据集概述

基本信息

  • 数据集名称:Ego2Act Benchmark
  • 许可证:CC BY 4.0(代码为 MIT 许可)
  • 语言:英语
  • 任务类别:image-to-video、video-classification
  • 标签:egocentric、video-generation、world-models、manipulation、benchmark
  • 数据规模:n<1K
  • 默认配置:cases(data/cases.parquet)

数据集简介

Ego2Act 要求视频模型从单张第一视角(egocentric)起始帧和一个高层级目标出发,执行真实的、多步骤的操作任务(例如“笔记本电脑盖子打开,钥匙和笔一起放在笔记本电脑左侧”)。本仓库包含基准测试本身,即任务与人类参考录像。模型输出及所有评分(Ego2ActJudge、基线及人工评分)位于 ego2act/ego2act-vidgen。

快速开始

python from datasets import load_dataset

cases = load_dataset("ego2act/ego2act-bench", "cases", split="train") print(cases[0]["goal"])

下载所需文件示例:

bash huggingface-cli download ego2act/ego2act-bench --repo-type dataset --include "cases/*" --local-dir ego2act

人类录像为 human/ 下的独立 480p 文件,可逐个任务下载。

子集说明

cases(默认),每行一个任务

列名 类型 描述
case_id string 任务标识符,所有文件和表共享
start_image image 提供给每个视频模型的初始第一视角场景
goal string 操作必须达成的高层级目标
prompt string 精确的生成提示(指令后接目标)
domain string Kitchen/Food Prep、Office/Study Workspace、Household Org/Storage、Personal Care/Utilities 或 Others,未标注时为空
action_types list[string] 任务所需的动词,如 open、place、attach
action_families list[string] 覆盖的动作族,如“Opening, closing and securing”
object_family list[string] 涉及物体的类别
involved_object_count int 涉及的实体物体数量
mean_observed_steps float 成功人类录像中的平均操作步骤数
mean_human_duration_s float 成功人类录像的平均时长(秒)
n_human_correct、n_human_wrong、n_generated int 该任务各类视频数量,n_generated 统计 ego2act-vidgen 中的视频
in_human_panel bool 该任务是否属于 25 任务人工评分面板

人类录像,human/metadata.csv

480p 录像索引于 human/metadata.csv,每行一条录像。

列名 类型 描述
file_name string human/ 下 480p H.264 录像路径(24 fps,无音频)
video_id string <case_id>::correct_<n> 或 <case_id>::wrong_<n>,所有评分表使用的键
case_id string 任务
label string correct 达成目标,wrong 为逼真的失败尝试
duration_s、width、height float、int 从文件中测量得出

大多数任务有三条 correct 和三条 wrong 录像,部分数量更少或更多(计数见 n_human_correct 和 n_human_wrong)。录像由作者以第一视角拍摄。有两个任务各含一对字节完全相同的副本(bottle_pot_pebble 的 wrong_2 与 wrong_3,three_spice_and_weight 的 correct_1 与 correct_2),两者均保留以使每条录像都有评分。480p 副本是每个评估器(Ego2ActJudge 及所有基线)接收的精确输入。

文件结构

路径 内容
data/cases.parquet cases 表
cases/<case_id>/ start.jpg、prompt.txt 及 metadata.json(目标、动作类型、物体、逐录像备注)
human/{correct,wrong}/<case_id>/*.mp4 480p 人类录像,以 human/metadata.csv 为索引

评分方式

Ego2ActJudge 将目标拆分为子目标,并用任务门 T1(initiation)、T2(process)、T3(end state)以及物理门 P1(continuity)、P2(causation)、P3(interaction)、P4(persistence)逐一检查,遇到首个失败即停止。Task 与 Physics 按子目标在 0–100 尺度上取平均,并组合为最终分数 S = √(T · P)。每个视频的分数位于 ego2act-vidgen。

预期用途与局限性

Ego2Act 旨在评估图像到视频模型作为目标导向操作模拟器的能力,以及研究自动视频评判器。任务是由一小组人在有限数量的家庭和办公室中录制的日常桌面操作,因此未覆盖所有环境、手部或相机设置。被录制者同意发布录像。录像仅显示手部和家用物体。

引用

bibtex @article{ego2act2026, title = {Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation}, author = {Irawan, Patrick Amadeus and Parlambang, Iskandar Muda Rizky and Maulana, Rava and Cui, Qinrong and Fuadi, Erland Hilman and Zuhri, Zayd M. K. and Absar, Nanda Ryaas and Elshabrawy, Ahmed and Mulyawan, Wilfried Ariel and Yu, Shoubin and Zhang, Yue and Bansal, Mohit and Aji, Alham Fikri}, year = {2026} }

搜集汇总
数据集介绍
ego2act-bench 数据集图片
构建方式
在具身智能与第一人称视频生成领域,任务导向的操纵能力评测长期缺乏标准化的基准。Ego2Act-Bench的构建从日常桌面操作场景中系统采集任务,每项任务由作者以第一人称录制成功与失败两类人类参考视频,同步标注高层目标、动作类型、涉及物体数量及持续时长等元信息。任务经过语义分解与动作家族归类,最终形成覆盖厨房备餐、办公学习、家庭收纳等多个领域的标准化用例集合。
使用方法
研究者可通过HuggingFace数据集接口加载cases配置获取任务表,并借助命令行工具按需下载起始图像、提示文本或指定任务的480p人类录像。模型生成结果需提交至配套的ego2act-vidgen数据集,由Ego2ActJudge自动评分并与基线及人工评分进行比对。该基准适用于图像到视频模型的模拟能力评估以及自动视频评判器的研究,但受限于录制环境与参与者范围,不宜直接外推至所有场景与拍摄条件。
背景与挑战
背景概述
在具身智能与视频生成交叉领域,以自我中心视角评估目标导向操作能力逐渐成为衡量世界模型物理理解深度的关键标尺。Ego2Act基准由Patrick Amadeus Irawan、Alham Fikri Aji等学者于2026年提出,旨在检验图像到视频模型能否从单帧自我中心起始画面与高层级目标出发,自主完成厨房备餐、办公整理等多步骤桌面操作。其核心研究问题在于:生成模型能否真正模拟连续、因果且符合物理规律的目标导向行为,而非仅合成视觉逼真的片段。该基准配备细粒度子目标分解与物理门控评判体系,为视频生成模型作为操作模拟器的能力评估提供了可复现的量化框架。
当前挑战
该基准所直面的领域难题在于:现有图像到视频模型虽能生成流畅画面,却普遍缺乏对多步骤操作中因果链、物体持久性与接触动力学的深层建模,常出现目标未达成、过程跳变或物理违例等现象。构建层面亦面临显著挑战:人类参考录制受限于少数采集者的手部形态、家居与办公环境,难以覆盖多样化操作场景与视角;正确与错误尝试的标注需精确界定成功标准与失败模式,且部分任务录制数量不均,对统计效力构成制约;评判环节则需设计任务门控与物理门控的耦合机制,以兼顾目标达成度与过程合理性,避免单一指标偏倚。
常用场景
经典使用场景
在具身智能与第一人称视频生成研究领域,Ego2Act Benchmark 的经典使用场景在于评估图像到视频模型能否依据单张自我中心起始帧与高层级语言目标,自主推演出真实且连贯的多步骤桌面操作过程。模型需接收如“打开笔记本电脑盖,并将钥匙与笔一同置于笔记本左侧”这类目标指令,生成符合物理规律与任务逻辑的操作视频。该基准通过任务门控与物理门控对生成视频的每个子目标进行解构式评判,进而以任务得分与物理得分的几何平均作为最终衡量指标,从而系统性地检验模型作为目标导向操作模拟器的能力。
解决学术问题
该数据集直面视频生成研究中长期存在的关键难题:现有模型虽能合成视觉上逼真的短片,却难以维持长时程因果连贯性、物体持久性以及任务完成的语义正确性。Ego2Act 通过构建包含明确成功与失败人类参考记录的多步骤操作任务集,为自动化视频评判器提供了可量化的基准,使得研究者能够精确诊断模型在启动、过程与结束状态各阶段的缺陷。其意义在于将视频生成评估从单纯的视觉质量维度拓展至目标达成与物理合理性维度,为构建可信的世界模型奠定了评测基础。
实际应用
在实际应用层面,Ego2Act Benchmark 可服务于机器人操作策略的仿真验证、智能家居辅助系统的操作规划,以及增强现实与虚拟现实中的交互式内容生成。借助该基准,开发者能够在无需真实机器人硬件的情况下,对视频生成模型作为操作模拟器的可靠性进行压力测试,从而筛选出适用于远程操作、自动化教学或辅助残障人士日常任务的模型方案。此外,其自动评判框架亦可迁移至工业质检或流程合规性检测等需要细粒度动作理解的场景。
数据集最近研究
最新研究方向
在以自我为中心的视频生成领域,评估模型是否能够完成真实多步骤操作任务正成为前沿焦点。Ego2Act基准通过单帧起始图像与高层目标指令,要求模型模拟目标导向的操作过程,并引入Ego2ActJudge自动评判器,从任务完成度与物理合理性两个维度进行细粒度打分。该基准紧密关联具身智能与世界模型研究热点,推动了视频生成模型作为操作模拟器的能力边界探索,为构建可理解物理交互的通用智能体提供了重要评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务