遇见数据集

i2v

收藏
魔搭社区2026-07-01 更新2026-07-19 收录
官方服务:

资源简介:

# Wan2.2-FLF2V 数据集 (Fine-grained Large-scale Filtered Video Dataset) ## 1. 数据集简介 **Wan2.2-FLF2V** 是一款专为超大规模视频生成模型(如 Wan2.1/2.2, Sora 类架构)深度定制的高质量微调数据集。本项目针对视频生成任务中常见的核心痛点——**语义理解不精准**、**动作流畅度差**以及**视觉伪影多**等问题,进行了系统性的数据清洗与标注重构。 FLF2V 代表了“细粒度(Fine-grained)”、“大规模(Large-scale)”与“深度过滤(Filtered)”。通过对 15 万以上的原始视频对进行多维度评估,我们为开源社区提供了一套极具训练价值的视觉资产。 ## 2. 数据处理与技术细节 ### 2.1 自动化过滤管线 (Filtering Pipeline) 数据入库前经过了四重严苛筛选: 1. **美学评分过滤**:利用 Aesthetic Scorer 剔除低对比度、构图混乱及视觉噪声过大的画面。 2. **运动连贯性检测**:计算视频帧间的光流位移,剔除转场频繁、画面剧烈晃动或接近静态的样本。 3. **内容安全扫描**:确保所有数据符合合规性要求,移除硬水印及低质量合成痕迹。 4. **分辨率均衡**:确保视频素材分布在合理的宽高比范围内,以适应多尺度位置编码训练。 ### 2.2 深度语义重写 (Caption Refinement) 我们摒弃了传统的短标签标注,采用了基于 **Qwen-VL-Max** 的端到端描述生成方案: - **主体解耦**:细化描述视频中的主角(人物、动物或物体)的外貌特性。 - **动作解构**:描述动作的起始、过程与环境互动,增强生成模型的动态模拟能力。 - **环境渲染**:提供光影、天气及空间布局的背景描述

提供机构:
maas
创建时间:
2026-02-08
二维码
社区交流群
二维码
科研交流群
商业服务