遇见数据集

ERCBench-Wan2.2-T2V-A14B-400

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集包含由 Wan2.2 T2V A14B 模型(Mixture-of-Experts 文本到视频生成模型)生成的 400 个视频片段(episodes),用于 EEC-Bench 基准测试的冻结队列。每个视频片段的分辨率为 832×480(480P),每段单镜头视频包含 81 帧(约 5.06 秒,16 fps),采用 UniPC 求解器、40 步采样、shift=12、引导尺度 [3.0, 4.0],BF16 精度(未量化)。数据集按 episode 组织,每个 episode 包含:单镜头视频(individual shot videos)、拼接后的多镜头视频(concatenated episode video)以及完整的生成元数据(包括随机种子、每镜头提示词、源哈希和时间戳)。数据格式为视频剪辑。该数据集适用于视频生成模型的评估、基准测试以及多镜头视频生成的研究。

This dataset contains 400 episodes generated by the Wan2.2 T2V A14B model (a Mixture-of-Experts text-to-video generation model) for the frozen queue of the EEC-Bench benchmark. Each video clip has a resolution of 832×480 (480P), and each single-shot video consists of 81 frames (approximately 5.06 seconds at 16 fps), generated using the UniPC solver, 40 sampling steps, shift=12, guidance scale [3.0, 4.0], with BF16 precision (non-quantized). The dataset is organized by episode, where each episode includes: individual shot videos, a concatenated episode video, and complete generation metadata (including random seeds, per-shot prompts, source hashes, and timestamps). The data format is video clips. This dataset is suitable for evaluation, benchmarking, and research on multi-shot video generation with video generation models.

创建时间:
2026-09-29
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Wan2.2 T2V A14B generations for EEC-Bench (400 episodes)
  • 数据集地址:https://huggingface.co/datasets/BlueSourceJY/ERCBench-Wan2.2-T2V-A14B-400
  • 语言:英语(en)
  • 许可证:other

标签

  • video-generation
  • wan2.2
  • multi-shot
  • eec-bench

数据集内容

该数据集为冻结的 EEC-Bench 基准队列中全部 400 个剧集(episodes)提供的官方 Wan2.2-T2V-A14B 生成结果。

规格参数

  • 模型:MoE 文本到视频模型
  • 分辨率:832x480(480P)
  • 帧数:每个镜头 81 帧(按 16 fps 计算约 5.06 秒)
  • 采样:UniPC 求解器,40 步,shift=12,guide_scale=[3.0, 4.0]
  • 精度:BF16 官方转换,未量化
  • 格式:按镜头的视频片段,以及拼接后的剧集视频

组织结构

每个剧集通过其规范标识进行索引:

  • 单个生成的镜头视频
  • 拼接的多镜头视频
  • 完整的生成元数据,包括随机种子(seeds)、每镜头提示词(per-shot prompts)、源哈希(source hashes)和时间信息
搜集汇总
数据集介绍
ERCBench-Wan2.2-T2V-A14B-400 数据集图片
构建方式
该数据集依托于EEC-Bench基准测试框架,采用Wan2.2-T2V-A14B混合专家文本到视频模型对全部400个剧集进行官方生成。每个剧集被分解为多个镜头,逐一生成832x480分辨率、81帧的视频片段,采样过程使用UniPC求解器,迭代40步,并设定shift=12及引导尺度[3.0, 4.0],以BF16精度未量化方式推理。生成后的单镜头视频按剧情顺序拼接为完整剧集,并同步记录种子、逐镜头提示、源哈希与耗时等元数据,形成结构化的多镜头视频语料库。
特点
数据集聚焦多镜头视频生成任务,涵盖400个剧集,每个镜头时长约5.06秒(16帧率下81帧),画面分辨率统一为480P。其核心特点在于保留完整的生成溯源信息,包括随机种子与逐镜头提示文本,为可复现性研究提供基础。数据以单镜头片段和拼接剧集两种粒度组织,兼顾镜头级分析与长视频连贯性评估需求,且使用官方未量化模型生成,保证了输出质量的一致性与基准测试的公平性。
使用方法
使用者可通过剧集标识符索引对应目录,获取单镜头视频、拼接后的多镜头视频及完整生成元数据。该数据集适用于文本到视频生成模型的性能评测、多镜头一致性分析以及视频生成可复现性验证。研究人员可基于逐镜头提示与种子信息复现生成过程,或利用拼接视频进行长时序视频理解任务。所有视频文件与元数据均按标准目录结构组织,便于直接加载至视频处理流水线或基准测试框架中。
背景与挑战
背景概述
视频生成领域近年来因扩散模型与大规模预训练而迅猛发展,但多镜头叙事连贯性评估长期缺乏标准化基准。2023年,EEC-Bench作为冻结式多镜头视频生成评测队列被提出,旨在系统检验模型在跨镜头场景中的语义一致性与时序逻辑。Wan2.2-T2V-A14B作为采用混合专家架构的文生视频模型,其官方生成结果覆盖该基准全部400个剧集,以832x480分辨率、81帧每镜头的规格提供了可复现的参考输出。该数据集由模型开发团队构建,核心研究问题在于多镜头长程视频生成中角色、场景与事件逻辑的跨镜头保持能力,为后续研究树立了可比较的基线,并推动了视频生成评估从单镜头向叙事化多镜头范式的转变。
当前挑战
该数据集所应对的领域问题在于多镜头文本到视频生成中的叙事连贯性建模,即模型需在多个离散镜头间维持角色身份、场景布局、事件因果与视觉风格的一致性,而现有单镜头指标难以有效衡量此类长程依赖。在构建过程中,挑战亦不容忽视:Wan2.2-T2V-A14B作为混合专家模型,其推理调度与专家路由在批量生成中易引入随机性,需通过固定种子与采样参数(如UniPC求解器、40步、shift=12)来确保可复现性;同时,81帧单镜头拼接为多镜头剧集时,镜头边界处的时序对齐、运动连续性与光照稳定性均需人工校验与后处理。此外,400个剧集的完整生成涉及大量计算资源,元数据(如源哈希、逐镜头提示、时序信息)的规范化记录亦对工程管理提出较高要求。
常用场景
经典使用场景
在视频生成研究领域,多镜头叙事连贯性评估一直缺乏统一的基准。ERCBench-Wan2.2-T2V-A14B-400作为EEC-Bench基准的官方生成结果集,为研究者提供了标准化的多镜头文本到视频输出,其经典使用场景在于:通过对比同一提示下不同模型的生成质量,系统评估视频生成模型在镜头切换、时序一致性和语义对齐方面的性能。该数据集包含400个完整剧集,每集由多个镜头片段及拼接视频构成,并附带种子、逐镜头提示等元数据,使得可复现的基准测试成为可能。
衍生相关工作
围绕该数据集,已衍生出多项经典工作。例如,EEC-Bench基准本身即建立在此类生成结果之上,用于系统评测视频生成模型的镜头一致性与叙事连贯性。一些研究利用该数据集分析不同采样策略对多镜头视频质量的影响,另一些工作则基于其元数据探索提示工程对生成结果的调控作用。此外,该数据集还激发了针对视频生成评估指标的改进研究,推动了自动化评估工具的发展,为多镜头视频生成领域的持续进步提供了重要基础。
数据集最近研究
最新研究方向
在视频生成领域,多镜头叙事连贯性与长视频合成一直是核心挑战。ERCBench-Wan2.2-T2V-A14B-400数据集基于Wan2.2混合专家文本到视频模型,为EEC-Bench基准中全部400个剧集提供官方生成视频,采用832x480分辨率、81帧每镜头及UniPC采样策略,实现了从单镜头到多镜头剧集的端到端生成。该数据集推动了多镜头一致性、时序连贯性及提示词泛化等前沿研究,为评估视频生成模型在复杂叙事场景下的表现提供了标准化资源,对内容创作、影视预演及多模态理解具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务