遇见数据集

VidaForge-3M

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

VidaForge-3M是一个大规模视频预训练数据集,包含3,141,246个场景级视频片段,总时长6,475.1小时,数据量约2.385 TB。该数据集源自LLaVA-OneVision-2-Data的视频部分,通过VidaForge开源数据处理管道进行标准化、场景分割、质量评估、去重和标注处理。每个视频片段均包含四级详细程度的英文描述(从语义概要到密集重构)、结构化的相机运动标签(如运动类型、稳定性、旋转和平移)、多维度语义标签(包括领域、场景、主题、动作、风格等)、以及光学质量、运动、美学和可见文本等多类质量测量分数。数据集还提供了基于PDQ哈希的近重复检测和基于Cosmos-Embed的语义重复分组元数据,供用户自定义数据选择和采样策略。视频采用MP4容器和H.265/HEVC编码,帧率为25 fps,分辨率多样(最常见为454×256)。数据集以索引tar文件(存储视频)和Parquet文件(存储元数据)的配对分片形式发布,共445个分片,包含50个公共元数据字段。该数据集旨在支持视频生成、文本到视频预训练、视频表示与自监督学习、视频字幕、数据过滤与课程设计等研究任务。需要注意的是,数据存在源偏差,标注为机器生成可能包含错误,且未进行身份或隐私信息移除处理。数据集在Apache 2.0许可证下发布。

VidaForge-3M is a large-scale video pre-training dataset containing 3,141,246 scene-level video clips, with a total duration of 6,475.1 hours and a data volume of approximately 2.385 TB. Derived from the video subset of LLaVA-OneVision-2-Data, this dataset was standardized, scene-segmented, quality-assessed, deduplicated and annotated via the open-source VidaForge data processing pipeline. Each video clip is equipped with four levels of detailed English descriptions ranging from semantic summaries to dense reconstructions, structured camera motion labels including motion type, stability, rotation and translation, multi-dimensional semantic labels covering domains, scenes, topics, actions, styles and other categories, as well as multiple types of quality measurement scores such as optical quality, motion, aesthetics and visible text. The dataset also provides near-duplicate detection metadata based on PDQ hashing and semantic duplicate grouping metadata based on Cosmos-Embed, allowing users to customize data selection and sampling strategies. The videos are stored in MP4 containers with H.265/HEVC encoding, with a frame rate of 25 fps and diverse resolutions, the most common being 454×256. The dataset is released in the form of paired shards of index tar files storing videos and Parquet files storing metadata, totaling 445 shards and containing 50 public metadata fields. This dataset is intended to support research tasks including video generation, text-to-video pre-training, video representation and self-supervised learning, video captioning, data filtering and curriculum design. It should be noted that the data contains source biases, the annotations are machine-generated and may contain errors, and no identity or privacy information removal has been conducted. The dataset is released under the Apache 2.0 license.

创建时间:
2026-07-20
原始信息汇总

VidaForge-3M 数据集详情

数据集概览

VidaForge-3M 是一个大规模视频预训练数据集,由 VidaForge 数据处理流水线生成。该数据集包含 3,141,246 个标注完整的视频片段,总时长 6,475.1 小时。每个片段均提供四级英文描述、结构化摄像机标签、语义标签、媒体属性、质量测量值,以及基于 PDQ 和 Cosmos-Embed 的重复分组元数据。

属性 数值
片段数量 3,141,246
总时长 6,475.1 小时
平均/中位数时长 7.42 秒 / 9.70 秒
时长范围 1.0–10.0 秒
视频数据量 2.385 TB (2.169 TiB)
视频容器格式 MP4
视频编码格式 H.265 / HEVC
帧率 25 fps
含音频片段 365,673 (11.64%)
视频分片数量 445 个未压缩 tar 文件
元数据分片数量 445 个 Parquet 文件
公开元数据列数 50
描述语言 英语

最常见的分辨率为 454×256 (73.63%)、1280×720 (11.64%) 和 340×256 (8.68%)。

数据来源与处理流程

  • 源视频: 来源于 LLaVA-OneVision-2-Data 中的约 80 万个视频。
  • 处理流程: 经 VidaForge 流水线标准化、分割为场景级片段,并生成新的片段级标注。流程包括:媒体探测及 H.265/MP4 标准化(25 fps)→ 场景检测与短片段提取 → 光学、运动、美学及可见文本测量 → PDQ 近重复和 Cosmos-Embed 语义重复分组 → 摄像机标注 → 四级描述标注 → 结构化语义标签 → 配对 tar/Parquet 分片发布。

标注信息

多级描述

每个片段包含四个不同详细程度的英文描述:

字段 详细程度
caption_level_0 少于 30 词的语义要点
caption_level_1 约 50-100 词的简洁事件描述
caption_level_2 约 100-200 词的详细时序描述
caption_level_3 约 200-400 词的密集重构描述
  • 标注模型: Captions 和 Tags 使用 Qwen3.6-27B-FP8,Camera 使用 Gemma-4-E4B-it。
  • 输入上下文: 基于有序采样帧(和摄像机标签),未使用音频。

摄像机标签

camera_json 字段包含结构化 JSON 对象,记录运动类型、稳定性、速度、场景动态、效果、旋转、平移、变焦等属性。

语义标签

提供低基数标签,用于分布分析、采样和课程构建:

  • tag_domain: 真实世界、动画、游戏、屏幕录制、合成渲染、混合、未知。
  • tag_scene: 室内、室外、城市、自然、驾驶、体育、食物、产品、肖像、屏幕、其他、未知。
  • tag_subjects: 多标签可见主体。
  • tag_actions: 多标签可见行为和运动。
  • tag_style: 视觉外观风格。
  • tag_text: 可见文本的语义角色。
  • tag_watermark: 水印或标志类别。

关键分布统计:真实世界域占 94.22%;场景中食物占 29.84%、一般室内 18.78%、产品 15.13%;风格中纪录片占 75.29%;主体中人物占 81.64%;行为中物体操作占 63.13%。

质量与去重元数据

保留原始测量值而非通过/拒绝决策:

  • 光学质量(曝光、对比度)、运动测量(VMAF 运动及场景变化信号)、美学评分、可见文本测量。
  • PDQ 哈希近重复组Cosmos-Embed 语义重复组,包含组内大小及最佳代表标识。

元数据模式(共50列)

分组 列名
身份与来源 clip_id, video_id, source
存储 tar_path, clip_path, tar_offset, filesize_bytes, sha256
媒体属性 duration_sec, width, height, codec, fps, bit_rate, has_audio
源时间线 start_sec, end_sec, clip_index, split_index
光学质量 optical_score, optical_json
运动 motion_score, motion_json
美学 aesthetic_score, aesthetic_json
可见文本 text_score, text_json
PDQ 去重 pdq_group_id, pdq_group_size, pdq_is_best_clip_in_group, pdq_best_clip_id_in_group, pdq_quality_mean, pdq_frame_count
Cosmos 去重 cosmos_group_id, cosmos_group_size, cosmos_is_best_clip_in_group, cosmos_best_clip_id_in_group, cosmos_frame_count
摄像机 camera_json
描述 caption_level_0, caption_level_1, caption_level_2, caption_level_3
标签 tag_domain, tag_scene, tag_subjects, tag_actions, tag_style, tag_text, tag_watermark
  • video_id 用于标识源自同一源视频的片段,构建数据集分割时应基于 video_id 而非 clip_id,以避免训练集与验证集之间的时间泄露。

数据下载与使用

  • 仅下载元数据: hf download VidaForge/VidaForge-3M --repo-type dataset --include "meta/*.parquet" --local-dir ./VidaForge-3M
  • 下载配对分片: hf download VidaForge/VidaForge-3M data/shard-00000.tar meta/shard-00000.parquet --repo-type dataset --local-dir ./VidaForge-3M
  • 读取片段: 可使用 Python 通过 tar_offsetfilesize_bytes 直接从 tar 文件中定位并读取 MP4 文件。
  • 定义自定义选择规则: 示例代码展示了如何结合美学评分、运动评分、光学评分、文本评分和去重最优标识进行筛选。

数据存储结构

text VidaForge-3M/ ├── README.md ├── viewer/ │ └── preview.parquet ├── data/ │ ├── shard-00000.tar │ ├── shard-00001.tar │ └── ... └── meta/ ├── shard-00000.parquet ├── shard-00001.parquet └── ...

  • data/shard-XXXXX.tarmeta/shard-XXXXX.parquet 构成精确配对,采用索引式 tar + Parquet 发布格式。

预期用途

适用于以下研究方向:

  • 视频生成与文本到视频预训练
  • 视频表征与自监督学习
  • 视频描述与视频-语言预训练
  • 数据过滤、去重、课程设计与采样
  • 摄像机运动感知或标签条件训练
  • 视频数据配方的实证研究

局限性与责任使用

  • 源偏差: 所有片段源于 LLaVA-OneVision-2-Data,不代表所有线上或真实世界视频。
  • 机器生成标注: 描述、摄像机标签、语义标签可能存在遗漏、分类错误或幻觉。
  • 仅视觉描述: 未使用音频生成描述。
  • 重复保留: PDQ 和 Cosmos 重复元数据提供,但未自动移除重复组内成员。
  • 文本与水印保留: 片段可能包含字幕、可见文本、标志或平台水印。
  • 内容安全: 可能存在敏感、冒犯性或不良内容,用户应自行应用安全过滤。
  • 编解码器支持: 所有片段使用 HEVC 编码,下游环境需支持 HEVC 解码。
  • 无身份或隐私保证: 未进行人脸匿名化、说话者匿名化或个人信息移除。

许可证与出处

  • 上游数据集 LLaVA-OneVision-2-Data 使用 Apache License 2.0,本衍生数据集沿用该许可证。
  • VidaForge 流水线代码另行使用 MIT License 发布。
搜集汇总
数据集介绍
VidaForge-3M 数据集图片
构建方式
在视频基础模型预训练领域,高质量、大规模且结构化的视频数据是推动模型性能跃升的关键基石。VidaForge-3M正是基于此理念构建,它源自LLaVA-OneVision-2-Data中约80万段源视频,经由VidaForge这一开放数据流水线进行标准化处理与场景级分割,最终产出约314万段视频片段,总时长逾6475小时。其构建流程严谨而系统:首先对源视频进行媒体探测和H.265/MP4标准化处理,并统一帧率为25fps;随后通过场景检测算法提取短片段;接着对每一片段的光学质量、运动特征、美学评分及可见文本进行量化测量;在此基础上,利用PDQ哈希与Cosmos-Embed方法进行近重复与语义重复分组;最后,借助视觉语言模型生成相机标签、四级级联描述文本和结构化语义标签,将所有元数据以Parquet列式格式与MP4视频载荷以配对分片形式封装发布,从而形成了这一兼具规模性与可探索性的预训练数据集。
特点
VidaForge-3M最显著的特征在于其丰富的元数据结构与开放的设计哲学。每段视频片段均配备了四级英文描述文本,从30词以内的语义主旨到200-400词的密集重建式叙述,层级分明、覆盖全面。相机运动标签则以精细的JSON对象呈现,涵盖运动类型、稳定性、旋转与平移等多个维度,为研究相机运动感知任务提供了优质支持。此外,数据集还包含领域、场景、主体、动作、风格及水印等低基数语义标签,便于进行分布分析、采样和课程学习设计。尤为关键的是,VidaForge-3M刻意不预设最终筛选策略,而是将光学质量、运动评分、美学得分、可见文本测量值以及PDQ和Cosmos重复分组的元数据悉数公开,赋予用户根据自身训练目标自定义筛选与采样策略的完全自由。这种“测量而非裁决”的设计理念,使其成为研究视频数据配方的理想实验平台。
使用方法
使用VidaForge-3M时,用户可以根据研究需求灵活访问数据。若仅需探索元数据,可通过HuggingFace CLI仅下载Parquet文件,即可获取文本描述、标签和评分等丰富信息。对于完整的视频数据,数据集采用索引式tar与Parquet配对的分片结构,每个Parquet行精确记录了对应MP4视频在tar文件中的字节偏移量和文件大小,支持直接随机访问而无需解压整个归档。用户也可通过标准tar命令提取完整分片,随后利用clip_path字段直接定位视频文件。数据集的灵活设计鼓励用户自定义筛选策略,例如可结合美学评分、运动评分、光学质量及去重标志等字段,构建符合特定训练目标的子集。需要特别注意的是,数据集未提供官方训练/验证/测试划分,用户应在视频级别(video_id)而非片段级别进行数据拆分,以避免源视频信息泄露问题。
背景与挑战
背景概述
VidaForge-3M是由上海交通大学GAIR-NLP实验室联合多位研究者于2026年发布的大规模视频预训练数据集,旨在为视频基础模型的研究提供高质量、结构化的数据资源。该数据集包含超过314万个场景级视频片段,总时长逾6475小时,覆盖了丰富的视觉内容与多级字幕标注。其核心研究问题在于如何通过系统化的数据流水线,将原始视频素材转化为可供视频生成、表征学习及多模态预训练任务直接使用的标准化数据资产。作为VidaForge数据流水线的首个公开产物,该数据集为学术界探索视频数据配方、去重策略与标注质量控制提供了重要基座,其透明化的元数据结构与可定制筛选机制使其成为视频理解与生成领域极具影响力的基准资源。
当前挑战
当前数据集面临的挑战多维且深刻。领域层面,现有视频预训练数据普遍面临来源偏差、标注噪声与语义冗余问题。VidaForge-3M尝试以开源流水线应对这些难题,但同样受限于上游LLaVA-OneVision-2-Data的视频来源,无法代表全网络或真实世界的视频分布,且机器生成的注释(包括字幕、相机标签与语义标签)难免存在遗漏或幻觉。构建过程中,研究者需攻克视频标准化(统一至25fps与HEVC编码)、场景边界精确分割、多级字幕的细粒度生成及大规模数值重复匹配(PDQ与Cosmos-Embed)等技术瓶颈。此外,数据集仍保留含敏感内容、水印或可见文本的片段,而用户需自行定义安全过滤策略与样本选择方案,这对下游应用的适配性提出了更高要求。
常用场景
经典使用场景
在视频基础模型预训练的探索中,VidaForge-3M 凭借其超过300万场景级视频片段及多层次文本描述,成为视频文本对齐学习的理想语料库。研究者可借助其四级字幕体系——从简洁语义梗概到密集重建描述——构建从粗粒度到细粒度的视频语言联合表示模型。该数据集特别适用于文本到视频生成、视频自监督表征学习以及视频内容理解等经典任务,为模型捕捉时空动态与语义关联提供了丰富的监督信号。
衍生相关工作
VidaForge-3M 的发布催生了系列围绕视频数据管线和预训练策略的前沿探索。其衍生工作主要包括:基于该数据集验证的摄影机感知条件生成模型,通过利用摄影机标签提升生成视频中镜头运动的合理性与多样性;受其重复片段分组启发,研究者发展出更为鲁棒的视频副本检测与去重算法;此外,利用其多级字幕与多标签语义标注,学界进一步探究了视频语言预训练中标注粒度与下游任务性能之间的关联规律。
数据集最近研究
最新研究方向
在当前视频基础模型预训练数据生态中,VidaForge-3M数据集的出现标志着从粗粒度视频收集向精细化、可审计数据管线的关键转型。该数据集聚焦于场景级视频剪辑的多层次描述生成与质量度量,其最新研究方向紧密围绕视频生成与自监督学习的预训练数据配方优化。具体而言,研究者正利用其提供的314万条带有多级字幕、相机标签、语义标签及重复组元数据的剪辑,探索如何基于客观质量信号(如美学得分、运动度量)与去重分组(PDQ和Cosmos-Embed)定制化采样策略,以提升文本到视频生成模型的语义对齐性与视觉连贯性。此外,该数据集强调决策透明化——不预设过滤阈值,而是公开测量结果,这推动了数据筛选从经验性筛选向可复现、可比较的实验范式发展,为视频基础模型在多样化下游任务中的鲁棒性训练提供了方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务