遇见数据集

LAION-BVD

收藏
arXiv2026-08-26 更新2026-08-27 收录
数据链接:
官方服务:

资源简介:

LAION-BVD是由图宾根大学、LAION等机构联合创建的大规模开放视频数据集,旨在为多模态预训练提供丰富的数据资源。该数据集从CommonCrawl中提取了1.3B个视频URL,成功下载了80M个视频,总时长达到1000万小时,覆盖YouTube、Vimeo、Dailymotion等平台,内容涵盖多种语言和类别。通过内容感知场景检测,生成了55M个视频剪辑片段以及300M个帧图像,并利用多模态大语言模型自动生成视频、音频和帧级描述。该数据集可用于视频-文本、音频-文本和图像-文本的对比学习与预训练,有效支持视频理解、音频理解及多模态嵌入模型的训练,显著扩展了开源多模态视频数据的规模。

LAION-BVD is a large-scale open video dataset jointly created by institutions including the University of Tübingen and LAION, aiming to provide abundant data resources for multimodal pre-training. This dataset extracts 1.3 billion video URLs from CommonCrawl, successfully downloads 80 million videos with a total duration of 10 million hours, covering platforms such as YouTube, Vimeo and Dailymotion, with content spanning multiple languages and categories. Through content-aware scene detection, it generates 55 million video clips and 300 million frame images, and automatically generates video, audio and frame-level descriptions using multimodal large language models (LLMs). This dataset can be used for contrastive learning and pre-training of video-text, audio-text and image-text pairs, effectively supporting the training of video understanding, audio understanding and multimodal embedding models, and significantly expanding the scale of open-source multimodal video datasets.

创建时间:
2026-08-26
原始信息汇总

LAION-BVD(LAION Big Video Dataset)数据集概述

数据集简介
LAION-BVD 是一个大规模开放视频数据集,旨在支持多模态学习(视频、音频和图像)。该数据集包含从 CommonCrawl 收集的 13 亿条平台特定视频 URL,并成功下载了 8000 万个视频,总时长达 1000 万小时。通过内容感知的场景检测,提取视频片段并合成生成视频和音频描述(captions),同时从视频中提取关键帧用于图像-文本预训练。

数据规模与构成

  • 视频 URL 数量:13 亿条(来自 CommonCrawl)
  • 已下载视频:8000 万个
  • 总时长:1000 万小时
  • 已标注片段:5500 万个带有合成视频描述
  • 提取帧数:3 亿帧(用于图像-文本预训练)

实验性能

  • 视频-语言基准:基于 LAION-BVD 训练的 ViCLIP 模型在标准视频-文本基准上,相比 InternVid 训练的模型最高提升 2.1%,且随着训练规模从 1000 万增加到 5000 万片段,性能持续提升。
  • 音频-语言基准:基于 LAION-BVD 训练的 CLAP 模型,在与其他大规模未筛选音频数据集对比时表现具有竞争力,利用视频中提取的多样化自然声景。
  • 图像-文本基准:基于视频帧训练的 CLIP 模型在标准检索基准上表现强劲,视频帧展现出与典型网络图像语料不同的视觉分布,可补充现有图像预训练数据。

道德与使用声明

  • 用途限制:LAION-BVD 仅用于研究目的,禁止商业使用。旨在促进大规模多模态研究的开放性和可复现性,缩小专有技术公司对高质量训练数据的垄断。
  • 数据风险提示:与大多数网络数据集类似,该数据集可能包含偏见、刻板印象以及不同语言、地区、主题的代表性不均。研究者需评估并报告这些局限。

引用信息
论文标题:LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
作者(部分):Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti 等
出处:arXiv:2608.24845(2026)

搜集汇总
数据集介绍
LAION-BVD 数据集图片
构建方式
LAION-BVD的构建依托CommonCrawl海量网络存档,通过Apache Spark与cc2dataset工具高效提取YouTube、Vimeo及Dailymotion三大平台的视频链接,经筛选获得13亿候选URL。借助由2000台虚拟服务器构成的分布式下载集群及住宅代理网络,成功获取8000万段视频,累计时长达到1000万小时。在此基础上,研究团队随机抽选240万段视频,运用PySceneDetect进行基于内容感知的场景分割,并剔除静态片段,最终生成5500万段视频片段及对应的音频段;同时,利用ffmpeg的场景检测提取3亿帧场景变换关键帧,为多模态预训练构建了丰富且高质量的数据基石。
特点
LAION-BVD以其前所未有的规模与多样性著称,涵盖10万小时视频内容,远超现有开放视频数据集。数据来源广泛,94%来自YouTube,其余来自Vimeo和Dailymotion,内容覆盖20个类别,包含57%的英语及多种其他语言,跨越近二十年的上传时间。通过自动化标注管道,为视频、音频和图像分别生成简短而精准的标题,形成多模态对齐。尤为突出的是,其提取的视频帧在视觉分布上与现有网络图像语料存在显著差异(FID=33.92),为图像-文本学习提供了互补的监督信号。实验表明,基于该数据训练的模型在视频、音频及图像检索任务上均展现出优异的性能与良好的扩展性。
使用方法
LAION-BVD作为开源资源,为多模态预训练研究提供了灵活多样的使用途径。研究者可从HuggingFace获取视频URL及部分标题,或依据条款访问原始数据。数据拆分为多个子集,如BVD-V-55M(视频-文本)、BVD-A-10M(音频-文本)及BVD-I-300M(图像-文本),适配ViCLIP、CLAP和CLIP等不同模型的训练需求。用户可根据任务需求,随机采样构建不同规模的数据集,遵循论文中的预处理与训练协议,进行视频理解、音频检索及图像-文本对比学习等实验。该数据集鼓励社区进行多模态联合建模,并支持在生成式模型及音视频同步任务中开展进一步探索。
背景与挑战
背景概述
LAION-BVD(LAION-Big Video Dataset)是由LAION组织联合德国蒂宾根大学、马克斯·普朗克智能系统研究所等多家机构于2025年推出的大型开放多模态视频数据集。其创建初衷在于弥合当前公开视频语言数据与图像文本数据之间的规模鸿沟,为视频、音频及图像模态的预训练提供前所未有的数据支撑。该数据集依托CommonCrawl爬取并过滤出13亿条视频URL,成功下载8000万段视频,总时长逾千万小时,规模远超同期数据集。核心研究聚焦于多模态预训练,其提供的场景级片段、音频及帧级图像注释预计将推动视频理解、音频检索及跨模态表示学习的发展,并为开放、可复现的基础模型研究奠定资源基础。
当前挑战
构建LAION-BVD面临多重严峻挑战。首先,海量视频的获取受制于商业平台的访问限制,需借助数千台分布式服务器与住宅代理网络,下载成功率仅为60%左右,凸显工程与网络层面的巨大开销。其次,视频内容异构性强,时长跨度从数秒到半小时不等,需设计鲁棒的场景检测与过滤策略,以剔除静态或低质量片段,确保后续多模态标注的有效性。此外,为支撑视频、音频及图像三种模态的预训练,需构建可扩展的自动化标注流水线,分别采用Qwen3-VL、Audio Flamingo 3及DeepSeek-VL2生成对应模态的文本描述,在保证标注质量与生成通量间求取平衡。最终,针对数据集分布偏移与模型偏差的潜在风险,如分类性能弱于检索性能,仍需持续的系统性分析与优化,以充分挖掘其作为多模态预训练资源的潜能。
常用场景
经典使用场景
LAION-BVD数据集以其前所未有的规模——包含1.3B视频链接、80M下载视频及总计1000万小时的时长——成为多模态预训练研究的基石。该数据集最经典的使用场景在于训练视频-语言、音频-语言及图像-文本的对比学习模型,如ViCLIP、CLAP和CLIP。研究者利用其场景级片段、合成字幕及关键帧,能够系统性地探索数据规模与模型性能之间的标度律,从而在标准基准如Kinetics-400、MSR-VTT及AudioCaps上验证模型的零样本分类与跨模态检索能力。
解决学术问题
该数据集直面开源视频-语言资源稀缺的困境,突破了以往数据集在规模上的瓶颈,解决了大规模视频数据获取与处理的技术难题。它提供了包含丰富语义对齐的视频、音频与图像三种模态数据,使得研究者能够独立或联合训练多模态模型,进而深入探究模态间交互与表征学习的机理。LAION-BVD的发布显著推进了多模态预训练研究的可复现性,为探索数据质量、规模与模型性能间的复杂关系提供了宝贵资源,对推动基础模型研究具有深远意义。
衍生相关工作
LAION-BVD衍生了一系列经典工作,包括基于其视频片段训练的ViCLIP模型,在多个视频理解基准上超越了先前InternVid训练的模型;利用其音频数据训练的CLAP模型展示了与精心整理的LAION-Audio相当的性能;通过提取关键帧并生成字幕,CLIP模型的图像-文本检索能力得到显著增强。这些工作不仅验证了数据集的广泛适用性,还促进了WiSE-FT等训练策略的探索,以及跨模态学习理论的深化,为后续研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务