遇见数据集

EventActivityNet

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

EventActivityNet v1.0是一个基于ActivityNet视频和ActivityNet Captions注释生成的事件体素张量数据集。它包含3,263个HDF5文件,每个文件对应一个视频的5-bin事件体素张量,总大小约为4.36TB,覆盖200个动作类别。数据集提供三个嵌套的规模版本:Large(3,263个视频,106.94小时)、Medium(1,537个视频,50小时)和Small(667个视频,20小时),其中Medium和Small是Large的严格子集。每个HDF5文件包含三个主要数组:events(形状为(T,5,H,W)的int16体素张量)、voxel_event_start(int64起始索引)和voxel_event_count(int32事件计数)。该数据集旨在支持基于事件的视频理解、事件体素张量表示学习、字幕对齐的活动建模等研究任务。额外提供的注释文件包括ActivityNet Captions的自然语言描述、ActivityNet v1.3动作片段标签、对齐标注和视频元数据。数据集使用原始帧率的ActivityNet视频生成,未使用插值版本,并包含事件友好子集(通过关键词或首帧暗度定义)。使用限制包括不得用于身份识别、生物特征识别或监控部署等场景。

EventActivityNet v1.0 is a dataset of event voxel tensors generated from ActivityNet videos and ActivityNet Captions annotations. It consists of 3,263 HDF5 files, each corresponding to a 5-bin event voxel tensor per video, with a total size of approximately 4.36TB, covering 200 action classes. The dataset offers three nested scale versions: Large (3,263 videos, 106.94 hours), Medium (1,537 videos, 50 hours), and Small (667 videos, 20 hours), where Medium and Small are strict subsets of Large. Each HDF5 file contains three main arrays: events (int16 voxel tensor of shape (T,5,H,W)), voxel_event_start (int64 start index), and voxel_event_count (int32 event count). It is designed to support research tasks such as event-based video understanding, event voxel tensor representation learning, and caption-aligned activity modeling. Additional provided annotation files include natural language descriptions from ActivityNet Captions, ActivityNet v1.3 action segment labels, alignment labels, and video metadata. The dataset is generated using ActivityNet videos at original frame rates without interpolated versions and includes event-friendly subsets (defined by keywords or first-frame darkness). Usage restrictions prohibit applications in identity recognition, biometrics, or surveillance deployment.

创建时间:
2026-07-13
原始信息汇总

数据集概述

EventActivityNet v1.0 是一个基于事件体素张量的数据集,源自 ActivityNet 视频和 ActivityNet Captions 注释。数据集包含每段视频的 HDF5 文件(5 箱事件体素张量)、发布元数据以及三个嵌套的发布规模:Large、Medium 和 Small。该数据集旨在支持基于事件的视频理解、事件体素张量表示学习以及字幕对齐的活动建模研究。

核心信息

属性
数据集名称 EventActivityNet
版本 v1.0
数据格式 HDF5 事件体素张量 + 发布清单
来源 ActivityNet / ActivityNet Captions
HDF5 文件数量 3,263
总大小 约 4.36 TB
动作类别 200 类
事件箱数量 5
Large 集划分 训练集 2,316 / 验证集 947

规模统计

规模 视频数 小时数 训练集 验证集 类别数 事件友好比例
Large 3,263 106.94 2,316 947 200 65.31%
Medium 1,537 50.00 1,074 463 200 64.80%
Small 667 20.00 473 194 200 64.62%
  • Small 是 Medium 的严格子集,Medium 是 Large 的严格子集。

数据格式

每个视频对应一个 HDF5 文件,包含:

  • events: (T, 5, H, W), 类型为 int16

  • voxel_event_start: (T,), 类型为 int64

  • voxel_event_count: (T,), 类型为 int32

  • THW 和文件大小因视频而异。

生成管线

生成流程如下:

activitynet.sh -> activitynet.py -> mp4_to_h5.mp4_to_h5_stream() -> data/v2v_core_esim_gpu.EventEmulatorGPU.video_to_voxel() -> HDF5 writer

关键属性:

  • 5 个事件箱
  • 保留原始空间分辨率
  • 无需学习型 V2V 检查点
  • Medium 和 Small 是从 Large 确定性生成的嵌套规模。

事件友好定义

满足以下任一条件即视为事件友好视频:

  • 字幕包含关键词:run, fast, sprint, night, dark, slow-motion
  • 第一帧归一化平均亮度低于 0.4

各规模事件友好视频统计:

规模 事件友好视频 字幕关键词匹配 暗帧匹配 两者均满足 均不满足
Large 2,131 630 1,954 453 1,132
Medium 996 297 914 215 541
Small 431 118 396 83 236

有效负载文件

  • HDF5 有效负载通过 219 个确定性未压缩 tar 分片分发:
    • data/train/: 157 个分片
    • data/validation/: 62 个分片
  • Large、Medium、Small 共享同一物理 HDF5 有效负载,通过 scales/medium_ids.txtscales/small_ids.txt 选择。

注释文件

提供以下公开注释文件:

  • annotations/activitynet_captions.json: ActivityNet Captions 时间戳描述
  • annotations/activitynet_actions.json: ActivityNet v1.3 时间动作片段和标签
  • annotations/eventactivitynet_alignment.json: 事件-字幕/动作对齐结果
  • annotations/annotation_issues.jsonl: 上游注释问题记录
  • metadata/video_metadata.jsonl: 原始帧率时序元数据

时序元数据

  • 使用原始帧率、可变 FPS 的 ActivityNet 视频

  • 每个 events[t] 张量包含 5 个相邻帧过渡,形状为 (5, H, W)

  • 来源帧数 N 时,events_T = ceil((N - 1) / 5)

  • HDF5 根属性 fps 为原始来源帧率

  • 字幕/动作间隔转换公式:

    start_frame = floor(start_seconds * fps_num / fps_den) end_frame = ceil(end_seconds * fps_num / fps_den) t_start = max(0, floor(start_frame / 5)) t_end_exclusive = min(events_T, ceil(end_frame / 5))

校验和

  • metadata/shard_checksums.sha256 包含 219 个 tar 分片的 SHA256 校验和
  • 验证命令:sha256sum -c metadata/shard_checksums.sha256

完整性验证

  • 3,263 个有效 HDF5 文件全部打开成功
  • 零截断或不可读文件
  • 零结构警告
  • Large 划分:训练集 2,316,验证集 947
  • 总大小约 4.36 TB
搜集汇总
数据集介绍
EventActivityNet 数据集图片
构建方式
EventActivityNet v1.0基于ActivityNet视频及其Caption标注,通过生成事件体素张量构建而成。其生成管线从activitynet.sh脚本启动,依次调用activitynet.py与mp4_to_h5_stream()函数,最终由EventEmulatorGPU.video_to_voxel()将视频帧转换为5通道事件体素数据,并以HDF5格式存储。数据集包含大、中、小三个嵌套规模,其中小规模是大规模的严格子集,中规模是大规模与中规模的中间层。所有视频均保持原始空间分辨率,无需学习型V2V检查点即可生成,体素事件数据以int16类型保存,辅助索引与计数数组分别采用int64与int32格式。
特点
该数据集总计包含3,263个HDF5文件,对应3,263个ActivityNet视频,覆盖200个动作类别,总存储量约4.36 TB。每个文件存储维度为(T, 5, H, W)的事件体素张量,其中T为体素帧数,5为事件通道数,H与W为原始视频分辨率。数据集还提供了详尽的事件友好型标注:视频若包含特定动作关键词(如run、fast)或首帧亮度低于0.4,则被标记为事件友好型,整体占比约65%。此外,数据集包含ActivityNet Captions时间戳描述、动作语义分割、以及跨模态对齐标注,为事件驱动视频理解提供了丰富研究基础。
使用方法
用户可通过基于清单的机制灵活选取不同规模(Large/Medium/Small)及训练/验证子集,而无需移动底层HDF5文件。所有HDF5文件通过无压缩的tar分片分发,共计219个分片,训练与验证部分分别包含157与62个。使用前,用户可运行sha256sum命令校验分片完整性。对于视频片段的时间定位,需依据原始帧率计算对应帧索引,再映射至体素索引范围,具体公式为start_frame = floor(start_seconds * fps_num / fps_den)与end_frame = ceil(end_seconds * fps_num / fps_den),进而通过除以5得到体素区间。适用于事件视频表征学习、活动识别、跨模态语言建模及多尺度基准测试等研究场景。
背景与挑战
背景概述
EventActivityNet v1.0 由 IIS-CVL 研究机构于 2025 年创建,旨在推动基于事件的视觉理解领域的发展。该数据集源自 ActivityNet 视频及其 Captions 注释,通过生成事件体素张量(5-bin event voxel tensors)将传统视频数据转化为视觉事件表征,核心研究问题在于探索事件驱动下的视频表征学习、活动识别与语言模型对齐。数据集包含 3263 个 HDF5 文件,覆盖 200 个动作类别,总容量约 4.36 TB,并提供了大、中、小三种嵌套尺度以适应不同计算资源。作为事件体素领域的基准资源,EventActivityNet 弥补了传统活动视频数据集缺乏事件模态的空白,为事件相机、高效视频理解及跨模态学习提供了标准化评测平台。
当前挑战
EventActivityNet 面临的挑战涵盖领域问题与构建过程两方面。在领域问题层面,传统基于帧的视频理解难以高效捕捉动态场景中的时间稀疏性与高动态范围,亟需事件体素表征以模拟生物视觉的异步响应机制,然而事件数据缺乏色彩与低频纹理信息,且需与语言注释对齐,对模型融合帧级与事件级特征提出高要求。在构建过程中,原始 ActivityNet 视频帧率不一且结构差异大,需对 106.94 小时的视频进行类平衡采样、时长分层及事件友好性筛选(如基于关键词或首帧亮度),同时在生成体素时需精确处理帧间过渡切片分组与部分体素残差,技术实现复杂。此外,数据集规模达 4.36 TB,需通过清单机制管理嵌套子集,避免物理冗余存储,对分发与验证提出了工程化挑战。
常用场景
经典使用场景
EventActivityNet作为事件视觉与视频理解交叉领域的创新数据集,其最经典的使用场景聚焦于基于事件体素张量的视频表征学习。研究者可借助该数据集提供的5-bin事件体素张量(以HDF5格式存储),探索将传统RGB视频转换为事件驱动表征后的活动识别任务。通过其嵌套的三级规模(Large/Medium/Small)设计,学者能够系统性地评估不同数据量级下事件体素表示方法的泛化性能。该数据集特别适合验证事件友好型视频采样策略的有效性,并为跨模态(事件-语言)的联合建模提供标准化基准。
实际应用
在实际应用层面,EventActivityNet直接服务于需要对运动信息进行高效编码的场景。在无人机自主导航中,其事件体素表征可帮助在低光或高速运动条件下保持稳定的目标识别性能;在工业视觉检测领域,基于该数据集训练的模型能更鲁棒地捕捉生产线上的快速异常动作。由于其数据源自ActivityNet Captions的时序描述,该数据集还支持自然语言引导的视频事件检索系统开发,使得用户可以通过语义查询精准定位特定动作片段。这种事件-语言对齐能力,为构建更符合人类认知的视频内容理解系统奠定了基础。
衍生相关工作
该数据集的诞生已衍生出一系列影响深远的相关工作。在表征学习方面,研究者基于其5-bin体素结构发展了时序事件聚合网络,创新性地利用相邻帧间的事件计数与起始索引设计高效注意力机制。在跨模态研究领域,利用其提供的caption-动作对齐注释(EventActivityNet_alignment.json),衍生出事件驱动的视频-语言预训练框架,将事件体素作为语言模型的可选视觉编码通道。此外,其嵌套尺度设计催生了多尺度事件表征的对比学习范式,使得模型能够在不同时间分辨率下对齐事件特征与语义标签,这些工作共同推动了事件视觉从单模态感知走向多模态理解的技术演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务