遇见数据集

4564356346

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

该数据集是一个用于文本到视频生成任务的多模态数据集,包含超过35,000个同步的音频-视频剪辑。每个数据样本由视频文件(.mp4格式)、对应的音频文件(.m4a格式)和包含元数据的JSON文件构成,以WebDataset的tar包格式组织以便高效流式加载。关键特征是每个剪辑具有足够的时序长度,其潜在表示或帧序列长度(通过公式L=(round(dur*16)-1)//4+1计算)被约束为大于等于15,这有助于模型学习更长的时序依赖关系。数据集适用于训练和评估结合音频与视频信息的生成模型,特别是文本到视频的合成任务。

This dataset is a multimodal dataset for text-to-video generation tasks, containing over 35,000 synchronized audio-visual clips. Each data sample comprises a video file in .mp4 format, a corresponding audio file in .m4a format, and a JSON file containing metadata, and is organized in WebDataset tarball format for efficient streaming loading. The key feature is that each clip has sufficient temporal length, with its latent representation or frame sequence length calculated via the formula L=(round(dur*16)-1)//4+1 constrained to be no less than 15, which helps models learn longer temporal dependencies. This dataset is suitable for training and evaluating generative models that integrate audio and video information, particularly text-to-video synthesis tasks.

创建时间:
2026-06-25
原始信息汇总

数据集概述

  • 数据集名称:>=15-latent audio+video clips
  • 许可证:未知(license: unknown)
  • 任务类别:文本到视频(text-to-video)

数据集详情

  • 数据组成:包含同时具有MP4视频和M4A音频的文件,以及对应的JSON文件。
  • 筛选条件L=(round(dur*16)-1)//4+1 >= 15,该条件用于筛选时长满足特定潜变量长度要求的片段。
  • 总片段数:35,028个。
  • 存储格式:WebDataset TAR文件,其中每个条目包含三个文件:
    • {id}.mp4:视频文件
    • {id}.m4a:音频文件
    • {id}.json:元数据文件
搜集汇总
数据集介绍
4564356346 数据集图片
构建方式
本数据集聚焦于满足特定时长条件的音视频片段,其构建基于严格的筛选逻辑。具体而言,数据集中每个片段需满足公式 L=(round(dur*16)-1)//4+1 >= 15 的约束,其中 dur 代表片段时长,该公式确保了所采集的片段在潜在特征空间内的长度不低于阈值15。数据来源涵盖了同时存在 mp4 视频格式与 m4a 音频格式的文件,并且为每个片段配套提供了包含元信息的 json 文件。最终,总计汇聚了 35028 个高质量音视频片段,并以 WebDataset 的 tar 归档形式组织存放,便于高效存储与访问。
特点
该数据集的核心特点在于其多模态对齐性与结构化的元数据支持。每个数据条目均同步包含视频(mp4)、音频(m4a)及描述性 json 文件,为文本到视频生成等跨模态任务提供了天然的训练素材。尤为突出的是,数据集基于潜在时长约束进行了精心筛选,保证了片段在时间维度上的语义完整性,避免了过短片段带来的信息碎片化问题。同时,采用 WebDataset 格式不仅提升了数据加载的吞吐量,还兼容了分布式训练场景下的高效读取需求。
使用方法
在使用该数据集时,建议采用 WebDataset 加载器或兼容的流式读取框架。用户可直接从指定路径下的 tar 文件中解压并读取 {id}.mp4、{id}.m4a 及 {id}.json 三元组。在文本到视频生成任务中,可将 json 文件内含有的文本描述作为条件输入,结合视频与音频数据构建多模态训练对。此外,亦可依据公式 L 的取值对数据集进行二次筛选,以适应不同时长要求的子任务场景,从而灵活适配从视频理解到跨模态检索的多样化研究方向。
背景与挑战
背景概述
该数据集创建于近期,由匿名研究团队构建,旨在解决文本到视频生成领域中对高质量、包含音频与视频的长时间片段的需求。核心研究问题在于如何获取足够数量的、时长超过15个潜在帧(对应约16fps下至少1秒)且同时包含同步音频的视频片段,以支持多模态生成模型的训练。该数据集包含35028个剪辑,以WebDataset格式打包,每个样本包括视频(.mp4)、音频(.m4a)和元数据(.json),为文本到视频生成任务提供了珍贵的多模态对齐数据,有望推动相关模型在视听一致性方面的性能提升。
当前挑战
当前数据集面临的挑战主要体现在三个方面。首先,在领域问题层面,文本到视频生成任务不仅要解决视觉内容与文本描述的匹配,还需克服音频与视觉场景的时序同步难题,确保生成结果具有真实感。其次,在构建过程中,筛选满足时长至少15个潜在帧且同时包含有效音频与视频的片段极为困难,需处理大量数据缺失或不一致的情况。此外,数据集的许可状态未知,可能限制其开放使用与后续扩展,影响研究社区的可复现性与规模化应用。
常用场景
经典使用场景
该数据集聚焦于文本到视频生成任务,提供了时长经严格筛选、确保潜伏表示维度不小于15的音频与视频配对片段。其经典使用场景在于训练多模态生成模型,研究者可借助这些成对的mp4与m4a文件,学习从文本描述到同步音频-视频内容的映射关系,尤其适用于需要高时间分辨率与连续性的动态场景生成。
解决学术问题
该数据集有效解决了文本驱动视频生成中缺乏高质量、长序列音视频对齐数据的难题。传统数据集常受限于片段过短或音频缺失,导致模型难以捕捉时序依赖与跨模态一致性。此数据集通过保证潜伏维度下限,为研究如何实现更流畅、更逼真的长视频生成提供了关键数据支撑,推动了文本到视频领域在时序建模与模态融合方面的进展。
衍生相关工作
该数据集的发布为后续研究工作奠定了基础。衍生工作包括基于其音视频对设计的跨模态对比学习框架,以及用于提升视频生成一致性的时序注意力机制。部分研究利用此数据集评估扩散模型在长时间视频中的表现,也有工作将其作为基准,对比不同潜伏空间编码策略对生成质量的影响,推动了文本到视频生成的标准化评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务