EventActivityNet
收藏资源简介:
EventActivityNet v1.0是一个基于ActivityNet视频和ActivityNet Captions注释生成的事件体素张量数据集。它包含3,263个HDF5文件,每个文件对应一个视频的5-bin事件体素张量,总大小约为4.36TB,覆盖200个动作类别。数据集提供三个嵌套的规模版本:Large(3,263个视频,106.94小时)、Medium(1,537个视频,50小时)和Small(667个视频,20小时),其中Medium和Small是Large的严格子集。每个HDF5文件包含三个主要数组:events(形状为(T,5,H,W)的int16体素张量)、voxel_event_start(int64起始索引)和voxel_event_count(int32事件计数)。该数据集旨在支持基于事件的视频理解、事件体素张量表示学习、字幕对齐的活动建模等研究任务。额外提供的注释文件包括ActivityNet Captions的自然语言描述、ActivityNet v1.3动作片段标签、对齐标注和视频元数据。数据集使用原始帧率的ActivityNet视频生成,未使用插值版本,并包含事件友好子集(通过关键词或首帧暗度定义)。使用限制包括不得用于身份识别、生物特征识别或监控部署等场景。
EventActivityNet v1.0 is a dataset of event voxel tensors generated from ActivityNet videos and ActivityNet Captions annotations. It consists of 3,263 HDF5 files, each corresponding to a 5-bin event voxel tensor per video, with a total size of approximately 4.36TB, covering 200 action classes. The dataset offers three nested scale versions: Large (3,263 videos, 106.94 hours), Medium (1,537 videos, 50 hours), and Small (667 videos, 20 hours), where Medium and Small are strict subsets of Large. Each HDF5 file contains three main arrays: events (int16 voxel tensor of shape (T,5,H,W)), voxel_event_start (int64 start index), and voxel_event_count (int32 event count). It is designed to support research tasks such as event-based video understanding, event voxel tensor representation learning, and caption-aligned activity modeling. Additional provided annotation files include natural language descriptions from ActivityNet Captions, ActivityNet v1.3 action segment labels, alignment labels, and video metadata. The dataset is generated using ActivityNet videos at original frame rates without interpolated versions and includes event-friendly subsets (defined by keywords or first-frame darkness). Usage restrictions prohibit applications in identity recognition, biometrics, or surveillance deployment.
数据集概述
EventActivityNet v1.0 是一个基于事件体素张量的数据集,源自 ActivityNet 视频和 ActivityNet Captions 注释。数据集包含每段视频的 HDF5 文件(5 箱事件体素张量)、发布元数据以及三个嵌套的发布规模:Large、Medium 和 Small。该数据集旨在支持基于事件的视频理解、事件体素张量表示学习以及字幕对齐的活动建模研究。
核心信息
| 属性 | 值 |
|---|---|
| 数据集名称 | EventActivityNet |
| 版本 | v1.0 |
| 数据格式 | HDF5 事件体素张量 + 发布清单 |
| 来源 | ActivityNet / ActivityNet Captions |
| HDF5 文件数量 | 3,263 |
| 总大小 | 约 4.36 TB |
| 动作类别 | 200 类 |
| 事件箱数量 | 5 |
| Large 集划分 | 训练集 2,316 / 验证集 947 |
规模统计
| 规模 | 视频数 | 小时数 | 训练集 | 验证集 | 类别数 | 事件友好比例 |
|---|---|---|---|---|---|---|
| Large | 3,263 | 106.94 | 2,316 | 947 | 200 | 65.31% |
| Medium | 1,537 | 50.00 | 1,074 | 463 | 200 | 64.80% |
| Small | 667 | 20.00 | 473 | 194 | 200 | 64.62% |
- Small 是 Medium 的严格子集,Medium 是 Large 的严格子集。
数据格式
每个视频对应一个 HDF5 文件,包含:
-
events:(T, 5, H, W), 类型为int16 -
voxel_event_start:(T,), 类型为int64 -
voxel_event_count:(T,), 类型为int32 -
T、H、W和文件大小因视频而异。
生成管线
生成流程如下:
activitynet.sh -> activitynet.py -> mp4_to_h5.mp4_to_h5_stream() -> data/v2v_core_esim_gpu.EventEmulatorGPU.video_to_voxel() -> HDF5 writer
关键属性:
- 5 个事件箱
- 保留原始空间分辨率
- 无需学习型 V2V 检查点
- Medium 和 Small 是从 Large 确定性生成的嵌套规模。
事件友好定义
满足以下任一条件即视为事件友好视频:
- 字幕包含关键词:
run,fast,sprint,night,dark,slow-motion - 第一帧归一化平均亮度低于
0.4
各规模事件友好视频统计:
| 规模 | 事件友好视频 | 字幕关键词匹配 | 暗帧匹配 | 两者均满足 | 均不满足 |
|---|---|---|---|---|---|
| Large | 2,131 | 630 | 1,954 | 453 | 1,132 |
| Medium | 996 | 297 | 914 | 215 | 541 |
| Small | 431 | 118 | 396 | 83 | 236 |
有效负载文件
- HDF5 有效负载通过 219 个确定性未压缩 tar 分片分发:
data/train/: 157 个分片data/validation/: 62 个分片
- Large、Medium、Small 共享同一物理 HDF5 有效负载,通过
scales/medium_ids.txt和scales/small_ids.txt选择。
注释文件
提供以下公开注释文件:
annotations/activitynet_captions.json: ActivityNet Captions 时间戳描述annotations/activitynet_actions.json: ActivityNet v1.3 时间动作片段和标签annotations/eventactivitynet_alignment.json: 事件-字幕/动作对齐结果annotations/annotation_issues.jsonl: 上游注释问题记录metadata/video_metadata.jsonl: 原始帧率时序元数据
时序元数据
-
使用原始帧率、可变 FPS 的 ActivityNet 视频
-
每个
events[t]张量包含 5 个相邻帧过渡,形状为(5, H, W) -
来源帧数
N时,events_T = ceil((N - 1) / 5) -
HDF5 根属性
fps为原始来源帧率 -
字幕/动作间隔转换公式:
start_frame = floor(start_seconds * fps_num / fps_den) end_frame = ceil(end_seconds * fps_num / fps_den) t_start = max(0, floor(start_frame / 5)) t_end_exclusive = min(events_T, ceil(end_frame / 5))
校验和
metadata/shard_checksums.sha256包含 219 个 tar 分片的 SHA256 校验和- 验证命令:
sha256sum -c metadata/shard_checksums.sha256
完整性验证
- 3,263 个有效 HDF5 文件全部打开成功
- 零截断或不可读文件
- 零结构警告
- Large 划分:训练集 2,316,验证集 947
- 总大小约 4.36 TB




