AVGen-Bench
收藏资源简介:
AVGen-Bench Generated Videos 数据集是一个用于评估文本到音视频(T2AV)系统的基准数据集,而非训练数据集。数据集包含由不同模型生成的视频,这些视频基于共享的提示集生成,并按模型目录和视频类别进行组织。数据集包含235个提示,覆盖11个类别,如广告、动物、烹饪等。每个生成的项目通常是一个.mp4文件,包含模型生成的视频和合成的音频。数据集还包含一个元数据文件(metadata.parquet),用于索引每个视频的相关信息,如文件名、模型、类别、提示内容等。数据集旨在用于T2AV系统的基准测试、错误分析和定性演示,但不适用于训练通用视频生成模型或作为真实事件的证据。数据集已知的局限性包括输出是合成的,可能包含生成模型的偏见和故障模式,且某些类别的提示可能因模型的安全策略而被拒绝生成。
AVGen-Bench Generated Videos is a benchmark dataset designed for evaluating text-to-audio-visual (T2AV) systems, rather than a training dataset. The dataset contains videos generated by diverse models, which are produced based on a shared prompt set and organized by model directories and video categories. It includes 235 prompts spanning 11 categories such as advertisements, animals, cooking, and others. Each generated item typically takes the form of an .mp4 file that holds both the model-generated video and synthesized audio. Additionally, the dataset provides a metadata file (metadata.parquet) that indexes relevant information for each video, including filename, associated model, category, prompt content, and more. This dataset is intended for benchmarking, error analysis, and qualitative demonstrations of T2AV systems, and is not suitable for training general video generation models or serving as evidence of real-world events. Known limitations of the dataset include that all outputs are synthetic, which may contain biases and failure modes from the underlying generative models, and that prompts for certain categories may be rejected during the generation process due to the safety policies of the generative models.
AVGen-Bench 数据集概述
数据集基本信息
- 数据集名称: AVGen-Bench Generated Videos
- 发布者: microsoft
- 许可证: mit
- 存储库地址: https://huggingface.co/datasets/microsoft/AVGen-Bench
- 代码仓库: https://github.com/microsoft/AVGen-Bench
数据集目的与性质
- 本数据集旨在用于文本到音视频(T2AV)系统的基准测试和定性/定量评估。
- 它不是一个训练数据集。
- 每个数据项都是一个模型根据
prompts/*.json中定义的提示词生成的视频。
数据集内容与结构
组织方式
数据集按以下层级组织:
- 模型目录
- 视频类别
- 生成的
.mp4文件
典型顶层结构
AVGen-Bench/ ├── Kling_2.6/ ├── LTX-2/ ├── LTX-2.3/ ├── MOVA_360p_Emu3.5/ ├── MOVA_360p_NanoBanana_2/ ├── Ovi_11/ ├── Seedance_1.5_pro/ ├── Sora_2/ ├── Veo_3.1_fast/ ├── Veo_3.1_quality/ ├── Wan_2.2_HunyuanVideo-Foley/ ├── Wan_2.6/ ├── metadata.parquet ├── prompts/ └── reference_image/ # 可选,取决于生成流程
模型目录内部结构
在每个模型目录下,视频按类别分组,例如:
Veo_3.1_fast/ ├── ads/ ├── animals/ ├── asmr/ ├── chemical_reaction/ ├── cooking/ ├── gameplays/ ├── movie_trailer/ ├── musical_instrument_tutorial/ ├── news/ ├── physical_experiment/ └── sports/
提示词覆盖范围
- 提示词定义存储在
prompts/*.json中。 - 当前提示词集包含 235个提示词,涵盖 11个类别:
| 类别 | 提示词数量 |
|---|---|
ads |
20 |
animals |
20 |
asmr |
20 |
chemical_reaction |
20 |
cooking |
20 |
gameplays |
20 |
movie_trailer |
20 |
musical_instrument_tutorial |
35 |
news |
20 |
physical_experiment |
20 |
sports |
20 |
提示词JSON条目内容
通常包含:
content: 用于命名或索引的简短内容描述符。prompt: 完整的生成提示词。
数据实例格式
- 每个生成的项通常是一个单独的
.mp4文件。 - 包含模型生成的视频,以及当模型/流程支持时,合成的音频。
- 存储在
<model>/<category>/路径下。 - 文件名通常源自提示词的
content字段经过清理后的内容。
标准输出路径模式
<model>/<category>/<safe_filename(content)>.mp4
元数据索引
为支持数据集查看器索引,metadata.parquet 文件为每个导出的视频存储一行数据,包含以下字段:
file_name:.mp4文件的相对路径。model: 模型目录名称。category: 基准测试类别。content: 提示词短名称。prompt: 完整的生成提示词。prompt_id: 在prompts/<category>.json中的索引。
数据生成方式
- 视频是通过在不同的T2AV系统上运行共享的基准测试提示词集生成的。
- 所有系统都针对相同的类别结构进行评估。
- 输出是模型生成的,而非人工录制的。
- 不同模型可能暴露不同的生成设置、分辨率或条件机制。
- 根据底层模型的不同,某些流程可能额外使用首帧或参考图像输入。
预期用途
- 对T2AV生成系统进行基准测试。
- 运行AVGen-Bench评估脚本。
- 比较不同模型的失败模式。
- 定性演示素材整理。
- 按类别或提示词类型进行错误分析。
非预期用途
- 不应用于训练通用视频生成模型。
- 不应用于将模型输出视为真实世界事件的证据。
- 不应用于在没有额外测试的情况下对模型进行安全认证。
- 不应用于声称基准测试性能完全代表下游部署质量。
已知局限性
- 输出是合成的,继承了生成模型的偏见和失败模式。
- 某些类别强调基准压力测试,而非自然真实世界的频率。
- 如果生成作业失败、超时或被过滤,不同模型间的文件可用性可能不同。
- 不同的模型提供商执行不同的安全和审核策略;某些提示词可能在提供商端审核中被拒绝,这可能导致即使提示词存在于基准测试中,特定模型也缺少相应视频。
风险与负责任使用
由于这些是生成的视频:
- 视觉真实感并不意味着事实正确性。
- 音频可能包含伪影、可懂度失败或误导性的同步问题。
- 生成的内容可能反映刻板印象、不合理的因果结构或继承自上游模型的不安全输出。
- 任何重新分发结果的人都应明确将其标记为合成模型输出。




