M-VAD Names Dataset
收藏资源简介:
该数据集包含了对蒙特利尔视频标注数据集(M-VAD)的新注释集合,其中包括角色的视觉外观注释,以面部边界框轨迹的形式,以及与角色文本提及的关联。数据集通过半自动方法检测并注释了每个电影视频片段中角色的视觉外观,包含超过24,000个注释视频片段,包括63,000个视觉轨迹和34,000个文本提及,均与其角色身份关联。
This dataset comprises a new annotation collection for the Montreal Video Annotation Dataset (M-VAD), which includes visual appearance annotations of characters in the form of facial bounding box trajectories, as well as associations with textual mentions of the characters. The dataset employs a semi-automatic method to detect and annotate the visual appearances of characters in each movie video clip, encompassing over 24,000 annotated video clips, including 63,000 visual trajectories and 34,000 textual mentions, all linked to their respective character identities.
数据集概述
数据集名称: M-VAD Names Dataset
数据集描述: 该数据集包含了对Montreal Video Annotation Dataset(M-VAD)的新的注释集。数据集中的注释包括角色的视觉外观,以面部边界框轨迹的形式存在,以及与角色文本提及的关联。数据集通过半自动方法检测并注释了每个电影片段中角色的视觉外观。
数据集内容:
- 超过24,000个注释视频片段
- 包含63,000个视觉轨迹
- 包含34,000个文本提及
- 所有内容均与角色身份关联
数据集下载: 链接
数据集结构
文件格式: pickle对象,包含一个Python字典,结构如下:
mvad-names.pkl └── <MOVIE> ├── characters | └── <CHARACTER> | └── DVS<CLIP-ID> -> tracks └── videos └── DVS<CLIP-ID> └── <CHARACTER> -> tracks
其中,tracks是一个包含面部边界框的列表,格式为(frame-id, x_min, y_min, x_max, y_max)。
数据集分割
分割方式: 官方提供了训练、验证和测试集,分别包含约80%、10%和10%的视频片段。每个电影的视频片段在所有分割中都有分布,以确保算法能在训练集上学习角色的视觉外观,并在验证和测试集上应用。
分割统计:
| 总数 | 平均每部电影 | |
|---|---|---|
| 训练视频 | 19,023 | 207 |
| 验证视频 | 2,976 | 32 |
| 测试视频 | 2,836 | 31 |
数据集可视化
可视化工具: 提供了一个可视化工具来展示数据集的注释。用户可以通过命令行工具来可视化整个数据集或特定的视频片段,并可选择保存可视化结果。
精炼的M-VAD描述
描述更新: 除了M-VAD Names数据集,还发布了一个扩展版的M-VAD电影描述。新增了116个独特角色的注释,修复了1,253个M-VAD描述中的问题。
下载链接: 链接




