VidaForge-3M
收藏资源简介:
VidaForge-3M是一个大规模视频预训练数据集,包含3,141,246个场景级视频片段,总时长6,475.1小时,数据量约2.385 TB。该数据集源自LLaVA-OneVision-2-Data的视频部分,通过VidaForge开源数据处理管道进行标准化、场景分割、质量评估、去重和标注处理。每个视频片段均包含四级详细程度的英文描述(从语义概要到密集重构)、结构化的相机运动标签(如运动类型、稳定性、旋转和平移)、多维度语义标签(包括领域、场景、主题、动作、风格等)、以及光学质量、运动、美学和可见文本等多类质量测量分数。数据集还提供了基于PDQ哈希的近重复检测和基于Cosmos-Embed的语义重复分组元数据,供用户自定义数据选择和采样策略。视频采用MP4容器和H.265/HEVC编码,帧率为25 fps,分辨率多样(最常见为454×256)。数据集以索引tar文件(存储视频)和Parquet文件(存储元数据)的配对分片形式发布,共445个分片,包含50个公共元数据字段。该数据集旨在支持视频生成、文本到视频预训练、视频表示与自监督学习、视频字幕、数据过滤与课程设计等研究任务。需要注意的是,数据存在源偏差,标注为机器生成可能包含错误,且未进行身份或隐私信息移除处理。数据集在Apache 2.0许可证下发布。
VidaForge-3M is a large-scale video pre-training dataset containing 3,141,246 scene-level video clips, with a total duration of 6,475.1 hours and a data volume of approximately 2.385 TB. Derived from the video subset of LLaVA-OneVision-2-Data, this dataset was standardized, scene-segmented, quality-assessed, deduplicated and annotated via the open-source VidaForge data processing pipeline. Each video clip is equipped with four levels of detailed English descriptions ranging from semantic summaries to dense reconstructions, structured camera motion labels including motion type, stability, rotation and translation, multi-dimensional semantic labels covering domains, scenes, topics, actions, styles and other categories, as well as multiple types of quality measurement scores such as optical quality, motion, aesthetics and visible text. The dataset also provides near-duplicate detection metadata based on PDQ hashing and semantic duplicate grouping metadata based on Cosmos-Embed, allowing users to customize data selection and sampling strategies. The videos are stored in MP4 containers with H.265/HEVC encoding, with a frame rate of 25 fps and diverse resolutions, the most common being 454×256. The dataset is released in the form of paired shards of index tar files storing videos and Parquet files storing metadata, totaling 445 shards and containing 50 public metadata fields. This dataset is intended to support research tasks including video generation, text-to-video pre-training, video representation and self-supervised learning, video captioning, data filtering and curriculum design. It should be noted that the data contains source biases, the annotations are machine-generated and may contain errors, and no identity or privacy information removal has been conducted. The dataset is released under the Apache 2.0 license.
VidaForge-3M 数据集详情
数据集概览
VidaForge-3M 是一个大规模视频预训练数据集,由 VidaForge 数据处理流水线生成。该数据集包含 3,141,246 个标注完整的视频片段,总时长 6,475.1 小时。每个片段均提供四级英文描述、结构化摄像机标签、语义标签、媒体属性、质量测量值,以及基于 PDQ 和 Cosmos-Embed 的重复分组元数据。
| 属性 | 数值 |
|---|---|
| 片段数量 | 3,141,246 |
| 总时长 | 6,475.1 小时 |
| 平均/中位数时长 | 7.42 秒 / 9.70 秒 |
| 时长范围 | 1.0–10.0 秒 |
| 视频数据量 | 2.385 TB (2.169 TiB) |
| 视频容器格式 | MP4 |
| 视频编码格式 | H.265 / HEVC |
| 帧率 | 25 fps |
| 含音频片段 | 365,673 (11.64%) |
| 视频分片数量 | 445 个未压缩 tar 文件 |
| 元数据分片数量 | 445 个 Parquet 文件 |
| 公开元数据列数 | 50 |
| 描述语言 | 英语 |
最常见的分辨率为 454×256 (73.63%)、1280×720 (11.64%) 和 340×256 (8.68%)。
数据来源与处理流程
- 源视频: 来源于 LLaVA-OneVision-2-Data 中的约 80 万个视频。
- 处理流程: 经 VidaForge 流水线标准化、分割为场景级片段,并生成新的片段级标注。流程包括:媒体探测及 H.265/MP4 标准化(25 fps)→ 场景检测与短片段提取 → 光学、运动、美学及可见文本测量 → PDQ 近重复和 Cosmos-Embed 语义重复分组 → 摄像机标注 → 四级描述标注 → 结构化语义标签 → 配对 tar/Parquet 分片发布。
标注信息
多级描述
每个片段包含四个不同详细程度的英文描述:
| 字段 | 详细程度 |
|---|---|
caption_level_0 |
少于 30 词的语义要点 |
caption_level_1 |
约 50-100 词的简洁事件描述 |
caption_level_2 |
约 100-200 词的详细时序描述 |
caption_level_3 |
约 200-400 词的密集重构描述 |
- 标注模型: Captions 和 Tags 使用 Qwen3.6-27B-FP8,Camera 使用 Gemma-4-E4B-it。
- 输入上下文: 基于有序采样帧(和摄像机标签),未使用音频。
摄像机标签
camera_json 字段包含结构化 JSON 对象,记录运动类型、稳定性、速度、场景动态、效果、旋转、平移、变焦等属性。
语义标签
提供低基数标签,用于分布分析、采样和课程构建:
tag_domain: 真实世界、动画、游戏、屏幕录制、合成渲染、混合、未知。tag_scene: 室内、室外、城市、自然、驾驶、体育、食物、产品、肖像、屏幕、其他、未知。tag_subjects: 多标签可见主体。tag_actions: 多标签可见行为和运动。tag_style: 视觉外观风格。tag_text: 可见文本的语义角色。tag_watermark: 水印或标志类别。
关键分布统计:真实世界域占 94.22%;场景中食物占 29.84%、一般室内 18.78%、产品 15.13%;风格中纪录片占 75.29%;主体中人物占 81.64%;行为中物体操作占 63.13%。
质量与去重元数据
保留原始测量值而非通过/拒绝决策:
- 光学质量(曝光、对比度)、运动测量(VMAF 运动及场景变化信号)、美学评分、可见文本测量。
- PDQ 哈希近重复组 和 Cosmos-Embed 语义重复组,包含组内大小及最佳代表标识。
元数据模式(共50列)
| 分组 | 列名 |
|---|---|
| 身份与来源 | clip_id, video_id, source |
| 存储 | tar_path, clip_path, tar_offset, filesize_bytes, sha256 |
| 媒体属性 | duration_sec, width, height, codec, fps, bit_rate, has_audio |
| 源时间线 | start_sec, end_sec, clip_index, split_index |
| 光学质量 | optical_score, optical_json |
| 运动 | motion_score, motion_json |
| 美学 | aesthetic_score, aesthetic_json |
| 可见文本 | text_score, text_json |
| PDQ 去重 | pdq_group_id, pdq_group_size, pdq_is_best_clip_in_group, pdq_best_clip_id_in_group, pdq_quality_mean, pdq_frame_count |
| Cosmos 去重 | cosmos_group_id, cosmos_group_size, cosmos_is_best_clip_in_group, cosmos_best_clip_id_in_group, cosmos_frame_count |
| 摄像机 | camera_json |
| 描述 | caption_level_0, caption_level_1, caption_level_2, caption_level_3 |
| 标签 | tag_domain, tag_scene, tag_subjects, tag_actions, tag_style, tag_text, tag_watermark |
video_id用于标识源自同一源视频的片段,构建数据集分割时应基于video_id而非clip_id,以避免训练集与验证集之间的时间泄露。
数据下载与使用
- 仅下载元数据:
hf download VidaForge/VidaForge-3M --repo-type dataset --include "meta/*.parquet" --local-dir ./VidaForge-3M - 下载配对分片:
hf download VidaForge/VidaForge-3M data/shard-00000.tar meta/shard-00000.parquet --repo-type dataset --local-dir ./VidaForge-3M - 读取片段: 可使用 Python 通过
tar_offset和filesize_bytes直接从 tar 文件中定位并读取 MP4 文件。 - 定义自定义选择规则: 示例代码展示了如何结合美学评分、运动评分、光学评分、文本评分和去重最优标识进行筛选。
数据存储结构
text VidaForge-3M/ ├── README.md ├── viewer/ │ └── preview.parquet ├── data/ │ ├── shard-00000.tar │ ├── shard-00001.tar │ └── ... └── meta/ ├── shard-00000.parquet ├── shard-00001.parquet └── ...
data/shard-XXXXX.tar和meta/shard-XXXXX.parquet构成精确配对,采用索引式 tar + Parquet 发布格式。
预期用途
适用于以下研究方向:
- 视频生成与文本到视频预训练
- 视频表征与自监督学习
- 视频描述与视频-语言预训练
- 数据过滤、去重、课程设计与采样
- 摄像机运动感知或标签条件训练
- 视频数据配方的实证研究
局限性与责任使用
- 源偏差: 所有片段源于 LLaVA-OneVision-2-Data,不代表所有线上或真实世界视频。
- 机器生成标注: 描述、摄像机标签、语义标签可能存在遗漏、分类错误或幻觉。
- 仅视觉描述: 未使用音频生成描述。
- 重复保留: PDQ 和 Cosmos 重复元数据提供,但未自动移除重复组内成员。
- 文本与水印保留: 片段可能包含字幕、可见文本、标志或平台水印。
- 内容安全: 可能存在敏感、冒犯性或不良内容,用户应自行应用安全过滤。
- 编解码器支持: 所有片段使用 HEVC 编码,下游环境需支持 HEVC 解码。
- 无身份或隐私保证: 未进行人脸匿名化、说话者匿名化或个人信息移除。
许可证与出处
- 上游数据集 LLaVA-OneVision-2-Data 使用 Apache License 2.0,本衍生数据集沿用该许可证。
- VidaForge 流水线代码另行使用 MIT License 发布。




