LAION-BVD
收藏资源简介:
LAION-BVD是由图宾根大学、LAION等机构联合创建的大规模开放视频数据集,旨在为多模态预训练提供丰富的数据资源。该数据集从CommonCrawl中提取了1.3B个视频URL,成功下载了80M个视频,总时长达到1000万小时,覆盖YouTube、Vimeo、Dailymotion等平台,内容涵盖多种语言和类别。通过内容感知场景检测,生成了55M个视频剪辑片段以及300M个帧图像,并利用多模态大语言模型自动生成视频、音频和帧级描述。该数据集可用于视频-文本、音频-文本和图像-文本的对比学习与预训练,有效支持视频理解、音频理解及多模态嵌入模型的训练,显著扩展了开源多模态视频数据的规模。
LAION-BVD is a large-scale open video dataset jointly created by institutions including the University of Tübingen and LAION, aiming to provide abundant data resources for multimodal pre-training. This dataset extracts 1.3 billion video URLs from CommonCrawl, successfully downloads 80 million videos with a total duration of 10 million hours, covering platforms such as YouTube, Vimeo and Dailymotion, with content spanning multiple languages and categories. Through content-aware scene detection, it generates 55 million video clips and 300 million frame images, and automatically generates video, audio and frame-level descriptions using multimodal large language models (LLMs). This dataset can be used for contrastive learning and pre-training of video-text, audio-text and image-text pairs, effectively supporting the training of video understanding, audio understanding and multimodal embedding models, and significantly expanding the scale of open-source multimodal video datasets.
LAION-BVD(LAION Big Video Dataset)数据集概述
数据集简介
LAION-BVD 是一个大规模开放视频数据集,旨在支持多模态学习(视频、音频和图像)。该数据集包含从 CommonCrawl 收集的 13 亿条平台特定视频 URL,并成功下载了 8000 万个视频,总时长达 1000 万小时。通过内容感知的场景检测,提取视频片段并合成生成视频和音频描述(captions),同时从视频中提取关键帧用于图像-文本预训练。
数据规模与构成
- 视频 URL 数量:13 亿条(来自 CommonCrawl)
- 已下载视频:8000 万个
- 总时长:1000 万小时
- 已标注片段:5500 万个带有合成视频描述
- 提取帧数:3 亿帧(用于图像-文本预训练)
实验性能
- 视频-语言基准:基于 LAION-BVD 训练的 ViCLIP 模型在标准视频-文本基准上,相比 InternVid 训练的模型最高提升 2.1%,且随着训练规模从 1000 万增加到 5000 万片段,性能持续提升。
- 音频-语言基准:基于 LAION-BVD 训练的 CLAP 模型,在与其他大规模未筛选音频数据集对比时表现具有竞争力,利用视频中提取的多样化自然声景。
- 图像-文本基准:基于视频帧训练的 CLIP 模型在标准检索基准上表现强劲,视频帧展现出与典型网络图像语料不同的视觉分布,可补充现有图像预训练数据。
道德与使用声明
- 用途限制:LAION-BVD 仅用于研究目的,禁止商业使用。旨在促进大规模多模态研究的开放性和可复现性,缩小专有技术公司对高质量训练数据的垄断。
- 数据风险提示:与大多数网络数据集类似,该数据集可能包含偏见、刻板印象以及不同语言、地区、主题的代表性不均。研究者需评估并报告这些局限。
引用信息
论文标题:LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
作者(部分):Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti 等
出处:arXiv:2608.24845(2026)





