遇见数据集

BVD-RAW-Index

收藏
Hugging Face2026-08-25 更新2026-08-27 收录
官方服务:

资源简介:

LAION-BVD-RAW-Index 是 LAION-BVD 原始语料库的文件索引数据集。该数据集本身不包含任何媒体内容,而是为每个下载的原始视频(约 80M 个视频)及其关联的音频、元数据、字幕和评论文件提供对象键和大小信息。数据集包含以下字段:key(对象键,格式为 <id>/<id>.<ext>)、size(对象字节大小)、id(视频ID,例如 YouTube ID,去除了 _comments 后缀)、ext(文件扩展名,如 mp4、info.json)。数据以 Parquet 格式存储,行数在 100M 到 1B 之间,按 key 排序,且同一视频的所有对象保证位于同一分片,便于独立处理。该索引是公开的,但指向的原始媒体文件仅在研究人员通过申请获得访问权限后才能解析和获取。该数据集属于 LAION-BVD 项目,用于构建大规模视频理解数据集,是 BVD-URLs(1.3B 视频 URL)和 BVD-V-55M(55M 场景级视频片段)等子集的基础索引。

LAION-BVD-RAW-Index is a file index dataset of the LAION-BVD raw corpus. This dataset does not contain any media content itself, but provides object key and size information for each downloaded raw video (approximately 80M videos) and its associated audio, metadata, subtitles, and comment files. The dataset contains the following fields: key (object key, format <id>/<id>.<ext>), size (object byte size), id (video ID, e.g., YouTube ID, with the _comments suffix removed), ext (file extension, such as mp4, info.json). The data is stored in Parquet format, with rows between 100M and 1B, sorted by key, and all objects of the same video are guaranteed to be in the same shard for independent processing. The index is public, but the original media files it points to can only be resolved and accessed after researchers apply and obtain access permission. This dataset belongs to the LAION-BVD project, used to build a large-scale video understanding dataset, and is the base index for subsets such as BVD-URLs (1.3B video URLs) and BVD-V-55M (55M scene-level video clips).

提供机构:
LAION eV
创建时间:
2026-08-20
原始信息汇总

LAION-BVD — RAW语料库文件索引

数据集概述

  • 名称:LAION-BVD — RAW语料库文件索引(BVD-RAW-Index)
  • 许可证:cc-by-4.0
  • 语言:英语
  • 规模:1亿至10亿条记录
  • 格式:Parquet文件,分为多个分片(shard)
  • 内容:该数据集是LAION-BVD原始语料库的文件索引,包含约8000万个已下载视频的每个存储对象(视频、音频、元数据、字幕、评论)的一行记录。不包含任何媒体文件,仅包含对象键(key)和大小(size)。

数据集结构

列名 类型 描述
key 字符串 对象键,格式为 <id>/<id>.<ext>
size 整数 对象大小(字节)
id 字符串 视频ID(如YouTube ID);_comments 后缀会被去除,同一视频的所有文件共享一个 id
ext 字符串 文件名第一个点之后的内容,如 mp4info.json
  • 行按 key 排序,属于同一视频的所有对象保证位于同一分片中,单个分片可独立处理而不会跨分片丢失视频文件。

访问方式

  • 索引本身是公开的,但其指向的原始媒体文件不公开。
  • 通过单一中心访问请求表(https://forms.gle/5tXPS4gmBwSGYYbV8)申请访问权限。
  • 访问权限限于学术和非商业研究,请求将人工滚动审核。
  • 获得访问权限后,可将索引中的键解析到对象存储,详见BVD-RAW访问指南(https://projects.laion.ai/bvd/bvd-raw-access.html)。

与LAION-BVD系列的关系

发布集 描述
laion/BVD-URLs 从CommonCrawl提取的13亿视频URL
laion/BVD-RAW-Index(本数据集) 约8000万下载原始视频的文件索引(媒体按请求提供)
laion/BVD-V-55M / -URLs 5500万场景级视频片段,带字幕和时间戳
laion/BVD-A-10M / -URLs 从BVD-V-55M随机采样的1000万音频片段
laion/BVD-A-1.7M / -URLs 来自BVD-V-55M的170万音频片段(唯一源视频)
laion/BVD-I-300M / -URLs 从BVD-RAW采样的3亿关键帧
  • BVD-RAW本身(8000万视频,总计1000万小时)不通过Hugging Face分发,面向学术和非商业研究者通过上述访问请求表获取。

相关链接

  • 项目页面:https://projects.laion.ai/bvd/
  • 论文:https://arxiv.org/abs/2608.24845
  • 代码:https://github.com/LAION-AI/bvd
  • 使用条款:https://projects.laion.ai/bvd/assets/bvd_terms_of_use.pdf
  • 访问请求表:https://forms.gle/5tXPS4gmBwSGYYbV8
搜集汇总
数据集介绍
BVD-RAW-Index 数据集图片
构建方式
BVD-RAW-Index数据集作为LAION-BVD原始语料库的文件清单,详尽记录了约8000万个已下载视频所关联的每一个存储对象(包括视频、音频、元数据、字幕及评论),但不包含任何媒体内容本身,仅提供对象键与大小信息。该索引以Parquet格式组织,每一行对应一个对象,包含key、size、id及ext四个字段,其中key由视频ID与文件扩展名构成,id则统一标识同一视频的所有文件。数据按key排序,并确保同一视频的所有对象完整地存储在同一分片内,从而支持独立分片的并行处理与高效检索。
特点
该数据集的核心特征在于其作为访问原始媒体文件的导航工具,索引本身公开可获取,但所指向的原始媒体内容受到访问控制,仅限于学术及非商业研究用途。其结构设计兼顾了可扩展性与易用性,通过分片存储保证数据局部性,便于分布式处理。索引与LAION-BVD系列中的其他数据集(如BVD-V-55M、BVD-A-10M等)形成层级关联,为研究者提供从URL到原始视频再到精细化子集的完整数据链路,极大地方便了大规模视频理解与多模态学习研究。
使用方法
使用BVD-RAW-Index数据集时,研究者需先通过官方访问请求表单提交申请,经人工审核并获得权限后,方可依据索引中的对象键从对象存储中解析并获取对应的原始媒体文件。该索引作为清单,支持研究者自主选择所需视频子集进行定向下载,同时官方提供的访问指南中明确了传输清单格式与交付步骤。结合LAION-BVD项目中的其他资源(如BVD-URLs、BVD-V-55M等),研究者可构建从URL筛选、原始视频下载到场景级片段提取的完整工作流,适用于视频理解、音频处理、多模态预训练等研究场景。
背景与挑战
背景概述
BVD-RAW-Index数据集由LAION机构于2025年创建,是LAION-BVD原始语料库(约8000万个视频,总计1000万小时)的文件索引清单。该索引记录了每个对象的存储键与大小,但不包含媒体内容本身,访问权限需通过中央申请表授予学术及非商业研究人员。其核心研究问题在于为大规模视频-音频-文本多模态学习提供原始数据的有序访问基础,从而支撑后续BVD-V-55M、BVD-I-300M等子集的构建与扩展。作为LAION-BVD项目的基础组件,该索引在视频理解、跨模态检索及生成式AI领域具有重要数据基建影响力。
当前挑战
领域问题方面,BVD-RAW-Index旨在解决海量网络视频数据难以高效组织、索引与获取的挑战,为多模态模型训练提供规模化的原始数据支撑;同时需应对数据隐私与版权合规的约束,确保仅限学术研究使用。构建过程中,挑战包括从CommonCrawl中提取1.3B视频URL的清洗与去重、大规模分布式下载的稳定性与时效性,以及索引数据的高效分片存储,确保同一视频的所有文件位于同一分片以支持独立处理,同时需维持索引与原始存储之间的一致性,保障后续数据访问与流转的可靠性。
常用场景
经典使用场景
BVD-RAW-Index 作为 LAION-BVD 原始语料库的清单索引,其经典使用场景在于为大规模视频理解研究提供结构化的数据访问入口。该索引记录了约 8000 万个已下载视频的每个对象(视频、音频、元数据、字幕、评论)的键和大小,研究人员可通过解析这些键从对象存储中高效获取原始媒体文件。其按视频 ID 分片且保证同一视频的所有对象位于同一分片的特性,使得研究者能够独立并行处理单个分片而无需跨分片协调,从而极大地降低了数据预处理和分布式训练的复杂度,是构建大规模多模态数据集和开展视频基础模型研究的基石。
衍生相关工作
基于该索引,LAION 团队衍生了一系列高质量子集,极大地推动了视频与音频领域的研究进展。例如,BVD-V-55M 提供了 5500 万个带字幕和时间戳的场景级视频剪辑,成为视频-语言预训练的黄金标准;BVD-A-10M 和 BVD-A-1.7M 则专注于音频-语言及多模态对齐任务;BVD-I-300M 从原始视频中抽取 3 亿个关键帧,支撑了大规模图像-文本学习的研究。这些子集均需要借助 RAW 索引才能从原始语料中高效生成,其发布促进了如视频问答、跨模态检索、可控视频生成等方向的快速发展,并催生了多篇高引论文和开源工具链。
数据集最近研究
最新研究方向
LAION-BVD-RAW-Index数据集作为LAION-BVD项目原始语料库的清单索引,为大规模视频-音频多模态研究提供了关键的数据基础设施。其最新研究前沿聚焦于从CommonCrawl提取的1.3B视频URL到实际下载的80M视频(总计1000万小时)的规模化映射与高效检索,通过公开的行级索引(含对象键与大小)实现了对受限原始媒体的可追溯访问,推动了以BVD-V-55M场景级视频剪辑、BVD-A-10M音频剪辑及BVD-I-300M关键帧为代表的衍生数据集构建。这一索引机制不仅支持了跨模态对齐、视频理解与生成等热点研究,还通过分片独立处理的设计保障了数据完整性,为学术与非商业研究提供了透明、可扩展的数据访问范式,其影响在于降低了大尺度视频语料库的获取门槛,促进了视频-语言-音频联合模型的训练与评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务