遇见数据集

K600-MM

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

K600-MM是一个多模态视频数据集,基于Kinetics-600构建,通过伪标签和tokenization技术额外添加了11种模态,总共包含12个对齐的模态(如RGB、深度、法线、光流、DINOv2、SigLIP、V-JEPA、目标检测、人体姿态、字幕、转写等),每个视频片段都对应这些模态的离散整数token序列。数据集规模约为392K个训练视频片段和30K个验证/测试视频片段,所有数据以WebDataset格式分片存储,每个模态独立文件夹。该数据集专为任意到任意(any-to-any)多模态视频模型的预训练和评估设计,支持跨模态理解与生成任务。数据提供预分词化格式,便于高效加载。

K600-MM is a multimodal video dataset built upon Kinetics-600, with 11 additional modalities added via pseudo-labeling and tokenization techniques, resulting in a total of 12 aligned modalities (e.g., RGB, depth, normal, optical flow, DINOv2, SigLIP, V-JEPA, object detection, human pose, caption, transcription, etc.). Each video clip corresponds to a sequence of discrete integer tokens for these modalities. The dataset comprises approximately 392K training video clips and 30K validation/test video clips, all stored in WebDataset sharded format with separate folders per modality. It is specifically designed for pre-training and evaluating any-to-any multimodal video models, supporting cross-modal understanding and generation tasks. The data is provided in a pre-tokenized format for efficient loading.

创建时间:
2026-08-24
原始信息汇总

数据集概述

K600-MM 是一个用于预训练和评估 A2A-Video(一种面向视频领域的任意到任意多模态模型)的多模态视频数据集。它基于 Kinetics-600(RGB视频 + 类别标注)构建,并通过伪标注和分词技术新增了11种额外模态。


数据集规模

  • 训练集:约 392K 个视频片段
  • 验证/测试集:约 30K 个视频片段
  • 每个片段包含 12 种对齐的模态

模态组成

每个视频片段包含以下 12 种模态(均已分词为离散整数序列):

  1. RGB(原始视频)
  2. 深度(Depth)
  3. 法线(Normal)
  4. 光流(Optical Flow)
  5. DINOv2 特征
  6. SigLIP 特征
  7. V-JEPA 特征
  8. 目标检测(Detections)
  9. 人体姿态(Human Poses)
  10. 描述字幕(Caption)
  11. 转录文本(Transcription)

数据格式与存储

  • 预分词化:所有模态均由其各自的 VQ 分词器编码为离散整数令牌序列。
  • 存储结构:每个模态独立存储为 WebDataset .tar 分片文件,目录结构为:
    • train/<modality>/vol_00.tar ... vol_63.tar(每模态 64 个分片)
    • test/<modality>/vol_00.tar ... vol_63.tar(每模态 64 个分片)
  • 对齐方式:不同模态的文件通过相同的文件名主干(stem)进行对齐。
  • 模态文件夹:共 14 个文件夹,包括 12 个模型使用的模态(caption, class_condition, det, human_poses, rgb, tok_video_depth@128, tok_video_dinov2@224, tok_video_normal@128, tok_video_opticalflow@128, tok_video_rgb@128, tok_video_siglipv2@224, tok_video_vjepa@224)以及 crop_settings 和原始未分词的 rgb

使用方式

  • 完整下载:使用命令 hf download EPFL-VILAB/K600-MM --repo-type dataset --local-dir /path/to/k600-mm
  • 选择性下载:可通过 snapshot_download 并指定 allow_patterns 参数只下载所需的模态和分片。
  • 与 A2A-Video 集成:在数据配置中将 data_path 指向下载目录,并参考 示例数据配置 中的括号表示法。

许可与引用

  • 许可证:Apache 2.0(与 A2A-Video 代码一致)。底层 Kinetics-600 数据和伪标注模型各有其自身条款。
  • 引用:请参阅 A2A-Video 仓库 获取引用信息。
搜集汇总
数据集介绍
K600-MM 数据集图片
构建方式
K600-MM数据集的构建源于对Kinetics-600视频数据集的深度扩展,通过引入十一种额外模态进行伪标注与标记化处理,实现了从单一RGB视频到多模态时空表示的转化。每个视频片段均被对齐为十二种模态序列,包括深度、法线、光流、DINOv2、SigLIP、V-JEPA等视觉特征,以及目标检测、人体姿态、字幕与转写文本。所有模态均通过各自独立的VQ分词器离散化为整数标记序列,并以WebDataset格式按模态分片存储,共享文件名前缀以确保跨模态样本的一致性对齐。
特点
该数据集的核心特性在于其多模态全面性与预标记化的高效存储。约三十九万二千个训练片段与三万验证/测试片段构成了庞大的数据规模,每个片段均附有九种视觉模态及文本注释,实现了视觉与语言的深度融合。各模态均采用自有的VQ分词器进行离散化处理,使得数据可以直接适配于任意序列模型,无需额外的特征提取步骤。此外,数据集的目录结构设计清晰,通过文件名对齐实现了模态间的无缝关联,而Apache 2.0许可协议则保障了其在开源社区的广泛可用性。
使用方法
使用者可通过Hugging Face CLI或Python的snapshot_download函数便捷地下载整个数据集或选择性获取特定模态的分片,从而有效节省存储与带宽资源。数据集专为与A2A-Video模型协同训练而设计,通过配置data_path参数指向本地目录并采用括号标注法指定所需模态及分片范围,即可无缝集成至模型的数据加载流程中。同时,Hugging Face上的samples子集提供了交互式预览界面,便于研究者在完全下载前快速了解数据结构和内容,极大提升了数据探索的便捷性。
背景与挑战
背景概述
K600-MM数据集由瑞士洛桑联邦理工学院视觉实验室(EPFL-VILAB)于2024年创建,作为多模态视频模型A2A-Video的预训练与评估基准。该数据集基于Kinetics-600,通过伪标签与令牌化技术,为每个视频片段增添了11种额外模态,最终形成包含约392K训练片段与30K验证/测试片段、每片段12种对齐模态的大规模资源。其核心研究问题在于构建任意到任意(any-to-any)的视频多模态模型,突破传统视频理解局限于单一模态的瓶颈。K600-MM的发布推动了视频多模态学习领域的发展,为后续研究提供了高多样性与强对齐性的数据基础,并成为评估多模态视频模型性能的重要标杆。
当前挑战
K600-MM面临的挑战主要源于两个层面:领域问题方面,视频多模态学习要求模型同时理解和生成多种异构模态(如RGB、深度、光流、人体姿态等),模态间的语义鸿沟与时空对齐难题亟待解决,且现有模型往往难以泛化至未知模态组合;构建过程方面,从Kinetics-600原始视频出发,需借助多个预训练模型进行伪标签生成,确保各模态标注的准确性与一致性,同时处理大规模数据的存储与高效加载(采用WebDataset分片),并维护跨模态文件名的严格对齐,这些环节均需精密设计,以保障数据集的完整性与可用性。
常用场景
经典使用场景
K600-MM数据集作为视频领域任意到任意多模态模型A2A-Video的预训练与评估基准,其核心应用场景聚焦于多模态视频理解与生成任务。该数据集基于Kinetics-600构建,将原始RGB视频与类别标注扩展至12种对齐模态,涵盖深度、法线、光流、DINOv2特征、SigLIP特征、V-JEPA特征、目标检测结果、人体姿态以及字幕和转写文本。研究者可利用该数据集训练和验证视频描述、视频问答、跨模态检索、条件视频生成等任务,尤其适合探索视频中视觉、语言、运动与语义信息的协同建模,推动多模态学习在视频领域的前沿发展。
解决学术问题
K600-MM解决了现有视频数据集往往仅提供单一或少数模态标注,难以支撑任意到任意多模态模型训练的问题。通过伪标注与tokenization技术,该数据集为每段视频统一提供12种模态的离散token表示,实现了模态间细粒度对齐,使得研究者能够系统性地研究多模态融合、模态缺失下的鲁棒性、跨模态生成一致性等关键学术问题。其大规模样本(约392K训练片段)与完整预tokenized格式,显著降低了多模态模型训练的计算与存储开销,为视频基础模型的预训练提供了高质量、标准化的数据资源,推动了多模态学习理论的验证与模型性能的比较。
衍生相关工作
K600-MM数据集的发布直接催生了A2A-Video这一任意到任意多模态视频模型的诞生,其架构与训练策略成为后续多模态研究的参考基准。围绕该数据集,研究者进一步探索了模态间tokenizer的优化、跨模态注意力机制的设计以及基于WebDataset的规模化训练方案,衍生出多项工作,例如提升模态对齐效率的对比学习变体、增强视频理解鲁棒性的数据增强策略,以及面向特定下游任务(如动作识别、视频摘要)的微调范式。该数据集亦促进了开放科学实践,其Apache 2.0许可证与公开的伪标注流程为社区提供了可复现的基础,激励了更多利用多模态视频数据开展的基础研究与创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务