遇见数据集

ramanv-video-raw

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

ramanv-video-raw 是一个原始视频数据集,专为 Wan 2.2 视频 LoRA 训练而构建。数据来源于 WebVid-10M 数据集(遵循 CC-BY-4.0 许可),经过筛选下载后共包含 47,879 个视频,另有 2,138 个视频因 URL 失效未能获取。所有视频均为 480p 分辨率的 H.264 编码 MP4 格式,时长范围在 2 秒至 120 秒之间。数据集以 WebDataset 格式组织,共分为 1816 个 tar 分片(shard),每个分片包含约 50 个视频,每个视频对应一个 MP4 文件、一个 TXT 文本文件和一个 JSON 元数据文件。元数据信息额外以 JSONL 文件形式存放在 metadata 目录中,每个分片对应一个 JSONL 文件。该数据集适用于视频生成模型(如 Wan 2.2)的 LoRA 微调训练,提供原始视频素材及配套文本描述。

The ramanv-video-raw dataset is a raw video corpus specifically constructed for Wan 2.2 video LoRA training. Originating from the WebVid-10M dataset (licensed under CC-BY-4.0), after undergoing screening and downloading procedures, the dataset includes a total of 47,879 valid videos, while an additional 2,138 videos could not be obtained due to invalid URLs. All videos are H.264-encoded MP4 files with 480p resolution, and their durations range from 2 to 120 seconds. The dataset is organized in WebDataset format, split into 1816 tar shards, each containing approximately 50 videos. Each video is paired with one MP4 file, one TXT text file, and one JSON metadata file. Additionally, all metadata is stored in JSONL format under the metadata directory, with one JSONL file corresponding to each shard. This dataset is suitable for LoRA fine-tuning of video generation models such as Wan 2.2, providing raw video materials and accompanying text descriptions.

创建时间:
2026-07-27
原始信息汇总

数据集概述

本数据集为 ramanv-video-raw,是一个用于 Wan 2.2 视频 LoRA 训练 的原始视频数据集。

数据统计

  • 数据来源: WebVid-10M(许可协议:CC-BY-4.0)
  • 视频数量: 共下载 47,879 个视频;另有 2,138 个链接失效或无法访问
  • 视频格式: 480p 分辨率,H.264 编码的 MP4 文件
  • 视频时长: 每个视频时长介于 2 秒至 120 秒之间
  • 数据分片: 共 1,816 个 tar 存档,每个存档包含 50 个视频

数据结构

数据集采用 WebDataset 格式组织,主要包含两类文件:

  • webdataset/ 目录:存放 1,816 个 tar 归档文件(如 shard_00000.tarshard_00001.tar 等)。每个归档内包含每个视频对应的 {id}.mp4(视频文件)、{id}.txt(文本描述)和 {id}.json(元数据)。
  • metadata/ 目录:存放每个分片对应的 JSONL 元数据文件(如 shard_00000.jsonl),记录了对应分片的元信息。

构建信息

数据集构建日期为 2026年8月1日

搜集汇总
数据集介绍
ramanv-video-raw 数据集图片
构建方式
本数据集源自WebVid-10M大规模视频语料库,遵循CC-BY-4.0许可协议,经过系统化下载与筛选流程构建而成。具体而言,共获取47,879个视频样本,其中2,138个因链接失效或访问受限被剔除,最终形成高质量的原始视频集合。所有视频统一编码为480p分辨率的H.264格式MP4文件,时长跨度从2秒至120秒不等,以适应不同训练需求。数据以WebDataset格式组织,划分为1816个tar归档文件,每个归档包含50个视频及其对应的文本描述和元数据JSON文件,同时另设独立的元数据JSONL文件,实现数据与注解的高效解耦存储。
特点
该数据集的核心特点在于其原始性与规模性的精妙平衡,专为Wan 2.2视频LoRA训练量身定制。得益于WebVid-10M源数据的多样性,涵盖了广泛的主题、场景与动作,为模型提供了丰富的视觉语义基础。统一的技术规格(480p、H.264)确保了训练过程中的计算效率与一致性,而2至120秒的时长范围则赋予模型学习动态时序特征的能力。尤为重要的是,每个视频均配有文本提示与结构化元数据,为多模态对齐和条件生成提供了不可或缺的监督信号,显著提升了数据集的实用价值与学术严谨性。
使用方法
使用本数据集时,建议采用WebDataset标准加载流程,通过tar归档批次读取视频、文本及元数据,以支持高效流式训练。具体而言,研究人员可依据元数据JSONL文件进行数据筛选或加权采样,如按时长、类别或特定场景过滤样本。每个视频对应的txt文件包含自然语言描述,可直接作为条件文本输入。为适配LoRA训练,推荐将视频解码为帧序列,并按需进行分辨率归一化或数据增强。该数据集可直接用于微调视频生成模型的低秩适配层,亦可用于跨模态检索或视频字幕生成等下游任务,其规范的存储结构简化了与现有深度学习框架的集成流程。
背景与挑战
背景概述
随着视频生成模型(如Wan 2.2)的快速发展,高质量、大规模的视频数据成为训练视频LoRA(Low-Rank Adaptation)模型的关键资源。ramanv-video-raw数据集于2026年8月1日构建,源自WebVid-10M(CC-BY-4.0许可),由研究团队筛选并下载了47,879个视频,剔除了2,138个失效链接,最终以480p H.264 MP4格式(时长2至120秒)存储,并封装为1,816个tar归档文件(每个含50个视频及其元数据)。该数据集旨在为视频生成模型的微调提供原始视频素材,填补了现有公开数据集中针对LoRA训练的高质量视频数据空白,对推动视频生成领域的发展具有重要意义。
当前挑战
该数据集面临的挑战主要体现在两方面。领域上,视频生成模型训练需要多样化的动态场景、运动模式和时空一致性,而原始视频数据往往包含噪声、低分辨率和冗余内容,如何确保数据多样性与质量平衡是核心难题。构建中,从WebVid-10M海量数据中下载耗时且受网络稳定性影响,导致2,138个链接失效;同时需处理视频格式统一(H.264、480p)、时长裁剪(2-120秒)和元数据关联(文本、JSON),并确保tar分片的可靠存储与快速读取。此外,许可合规性(CC-BY-4.0)和版权问题也是数据发布前需严格审查的环节。
常用场景
经典使用场景
该数据集作为原始视频语料库,专为视频生成模型(如Wan 2.2)的LoRA微调而设计。其采用WebDataset格式存储,每份样本包含视频文件、文本描述及元数据JSON,便于高效的数据流式加载与分布式训练。经典使用范式包括:利用其大规模、多时长(2-120秒)的短视频样本,对视频扩散模型进行参数高效的局部微调,以增强模型对特定内容风格、运动模式或场景语义的生成能力;同时,文本与视频的配对结构支持多模态对齐学习,可应用于视频-语言联合表征的优化。
衍生相关工作
基于该类原始视频数据集,衍生出一系列经典工作。在方法层面,推动了LoRA(低秩适应)技术在视频生成模型中的扩展,例如针对时间维度和运动动态的参数高效微调策略;同时促进了数据集蒸馏与子集选择算法的研究,以提升训练效率。在应用层面,衍生出视频编辑、视频补全、文本驱动视频生成等任务的改进模型,以及多模态对齐与评测基准的构建。上游的WebVid-10M数据集本身催生了多个视频-语言预训练模型,而本数据集的精细切分与元数据完备性,为后续的可复现研究与公平对比提供了重要资源。
数据集最近研究
最新研究方向
基于WebVid-10M构建的ramanv-video-raw原始视频数据集,为视频生成模型Wan 2.2的LoRA微调提供了高质量、大规模的训练资源。该数据集包含近4.8万个短视频,覆盖多样化的视觉内容,其结构化分片存储设计便于高效加载与分布式训练。当前,视频生成领域正朝着高保真、长时序和可控生成方向演进,此类原始视频数据集的构建对于推动视频扩散模型、多模态理解及个性化视频合成等前沿研究具有关键支撑作用,尤其为低资源场景下的参数高效微调提供了坚实的数据基础,有望加速视频AI在影视制作、虚拟现实等领域的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务