K600-MM
收藏资源简介:
K600-MM是一个多模态视频数据集,基于Kinetics-600构建,通过伪标签和tokenization技术额外添加了11种模态,总共包含12个对齐的模态(如RGB、深度、法线、光流、DINOv2、SigLIP、V-JEPA、目标检测、人体姿态、字幕、转写等),每个视频片段都对应这些模态的离散整数token序列。数据集规模约为392K个训练视频片段和30K个验证/测试视频片段,所有数据以WebDataset格式分片存储,每个模态独立文件夹。该数据集专为任意到任意(any-to-any)多模态视频模型的预训练和评估设计,支持跨模态理解与生成任务。数据提供预分词化格式,便于高效加载。
K600-MM is a multimodal video dataset built upon Kinetics-600, with 11 additional modalities added via pseudo-labeling and tokenization techniques, resulting in a total of 12 aligned modalities (e.g., RGB, depth, normal, optical flow, DINOv2, SigLIP, V-JEPA, object detection, human pose, caption, transcription, etc.). Each video clip corresponds to a sequence of discrete integer tokens for these modalities. The dataset comprises approximately 392K training video clips and 30K validation/test video clips, all stored in WebDataset sharded format with separate folders per modality. It is specifically designed for pre-training and evaluating any-to-any multimodal video models, supporting cross-modal understanding and generation tasks. The data is provided in a pre-tokenized format for efficient loading.
数据集概述
K600-MM 是一个用于预训练和评估 A2A-Video(一种面向视频领域的任意到任意多模态模型)的多模态视频数据集。它基于 Kinetics-600(RGB视频 + 类别标注)构建,并通过伪标注和分词技术新增了11种额外模态。
数据集规模
- 训练集:约 392K 个视频片段
- 验证/测试集:约 30K 个视频片段
- 每个片段包含 12 种对齐的模态
模态组成
每个视频片段包含以下 12 种模态(均已分词为离散整数序列):
- RGB(原始视频)
- 深度(Depth)
- 法线(Normal)
- 光流(Optical Flow)
- DINOv2 特征
- SigLIP 特征
- V-JEPA 特征
- 目标检测(Detections)
- 人体姿态(Human Poses)
- 描述字幕(Caption)
- 转录文本(Transcription)
数据格式与存储
- 预分词化:所有模态均由其各自的 VQ 分词器编码为离散整数令牌序列。
- 存储结构:每个模态独立存储为 WebDataset
.tar分片文件,目录结构为:train/<modality>/vol_00.tar ... vol_63.tar(每模态 64 个分片)test/<modality>/vol_00.tar ... vol_63.tar(每模态 64 个分片)
- 对齐方式:不同模态的文件通过相同的文件名主干(stem)进行对齐。
- 模态文件夹:共 14 个文件夹,包括 12 个模型使用的模态(
caption,class_condition,det,human_poses,rgb,tok_video_depth@128,tok_video_dinov2@224,tok_video_normal@128,tok_video_opticalflow@128,tok_video_rgb@128,tok_video_siglipv2@224,tok_video_vjepa@224)以及crop_settings和原始未分词的rgb。
使用方式
- 完整下载:使用命令
hf download EPFL-VILAB/K600-MM --repo-type dataset --local-dir /path/to/k600-mm。 - 选择性下载:可通过
snapshot_download并指定allow_patterns参数只下载所需的模态和分片。 - 与 A2A-Video 集成:在数据配置中将
data_path指向下载目录,并参考 示例数据配置 中的括号表示法。
许可与引用
- 许可证:Apache 2.0(与 A2A-Video 代码一致)。底层 Kinetics-600 数据和伪标注模型各有其自身条款。
- 引用:请参阅 A2A-Video 仓库 获取引用信息。




