遇见数据集

FilmBench

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

FilmBench 是一个专业电影级视频生成基准数据集,旨在评估文本到视频(T2V)和参考图像到视频(R2V)生成模型在电影内容创作方面的性能。该数据集由与北京电影学院合作设计的三级评估分类法支持,涵盖指令跟随、时间连续性和美学质量三个主要维度(L1),下分12个组件(L2)和30至38个细粒度子指标(L3),所有评分均采用0-100分制。数据集包含1,169个提示,其中T2V任务515个,R2V任务654个(每个R2V提示附带一个参考图像),共生成9,213个视频样本(T2V: 4,635个,R2V: 4,578个),覆盖20种电影类型(如中国剧情片、国际动作片等)。数据涉及10个主流视频生成模型,包括Seedance 2.0、HappyHorse 1.1、Kling 3.0等。数据集主要文件包括:1) filmbench_videos.csv:视频清单文件,包含每个视频的唯一ID(uid)、任务类型(t2v/r2v)、模型名称、电影类型、中英文提示文本、视频文件路径和参考图像路径(R2V任务)等字段;2) machine_scores_en.jsonl:机器评分结果文件,为每个视频提供从L3到L1的详细评分数据,包括总体分数(machine_overall)和各维度分数;3) video/目录:按模型文件夹组织的生成视频文件(MP4格式);4) r2v_reference_image/目录:R2V任务的参考图像(PNG格式)。该数据集适用于视频生成模型的基准测试、性能评估和细粒度质量分析,尤其关注电影领域的专业要求。

FilmBench is a professional film-level video generation benchmark dataset designed to evaluate the performance of text-to-video (T2V) and reference image-to-video (R2V) generation models in film content creation. The dataset is supported by a three-level evaluation taxonomy developed in collaboration with the Beijing Film Academy, covering three main dimensions (L1): instruction following, temporal continuity, and aesthetic quality, with 12 components (L2) and 30 to 38 fine-grained sub-indicators (L3), all scored on a 0-100 scale. The dataset contains 1,169 prompts, including 515 for T2V tasks and 654 for R2V tasks (each R2V prompt comes with a reference image), generating a total of 9,213 video samples (T2V: 4,635, R2V: 4,578), covering 20 film genres (e.g., Chinese drama, international action films). The data involves 10 mainstream video generation models, including Seedance 2.0, HappyHorse 1.1, Kling 3.0, etc. The main files of the dataset include: 1) filmbench_videos.csv: a video manifest file containing unique ID (uid), task type (t2v/r2v), model name, film genre, prompt text in both Chinese and English, video file path, and reference image path (for R2V tasks) for each video; 2) machine_scores_en.jsonl: a machine scoring result file providing detailed scoring data from L3 to L1 for each video, including overall score (machine_overall) and dimension scores; 3) video/ directory: generated video files (MP4 format) organized by model folders; 4) r2v_reference_image/ directory: reference images for R2V tasks (PNG format). This dataset is suitable for benchmarking, performance evaluation, and fine-grained quality analysis of video generation models, with a particular focus on professional requirements in the film domain.

创建时间:
2026-07-21
原始信息汇总

FilmBench 数据集概述

FilmBench 是一个用于评估视频生成模型的电影级基准数据集,涵盖文本到视频(T2V)参考图像到视频(R2V) 两种任务,覆盖 20 种电影类型,包含中文电影和国际电影。


1. 评估框架

采用与北京电影学院联合设计的三级评估体系:

层级 数量 描述
L1(轴) 3 指令遵循、时间连续性、美学质量
L2(组件) 12 镜头、角色与表演、场景、空间连续性、时间连续性、角色连续性、音频连续性、基本质量、镜头剪辑、表演、音频质量、视觉跟随(仅R2V)
L3(子指标) 30–38 细粒度评分维度(如镜头景别、摄像机运动、构图、角色外观、场景保真度等)
  • 分数自下而上聚合:L3 → L2 → L1 → 总体(各级算术平均)
  • 所有分数范围为 0–100

2. 数据集统计

项目 数量
总提示数 1,169(T2V: 515, R2V: 654)
总视频数 9,213
T2V 视频 515 提示 × 9 个模型 = 4,635
R2V 视频 654 提示 × 7 个模型 = 4,578
R2V 参考图像 654(每个R2V提示一张)
电影类型 20
模型数 10

模型名称与文件夹映射

显示名称 文件夹名称 参与任务
Seedance 2.0 Seedance2-0 T2V, R2V
HappyHorse 1.1 HappyHorse1-1 T2V, R2V
HappyHorse 1.0 HappyHorse1-0 T2V, R2V
Kling 3.0 KlingV3 T2V
Kling 3.0 Omni KlingV3Omni T2V, R2V
Vidu Q3 Pro ViduQ3Pro T2V
Veo 3.1 Veo3-1 T2V, R2V
Grok Imagine Video GrokImagineVideo T2V, R2V
Vidu Q2 Pro ViduQ2Pro R2V
Hailuo 2.3 Hailuo2-3 T2V

3. 总体排名

排名基于所有提示的 machine_overall 分数的平均值。

总体排名(所有模型)

排名 模型 平均分 任务 视频数
1 Seedance 2.0 87.66 T2V, R2V 1,169
2 HappyHorse 1.1 86.35 T2V, R2V 1,169
3 HappyHorse 1.0 85.82 T2V, R2V 1,169
4 Kling 3.0 85.80 T2V 515
5 Kling 3.0 Omni 82.90 T2V, R2V 1,169
6 Vidu Q3 Pro 80.94 T2V 515
7 Veo 3.1 79.38 T2V, R2V 1,169
8 Grok Imagine Video 78.67 T2V, R2V 1,169
9 Vidu Q2 Pro 71.45 R2V 654
10 Hailuo 2.3 68.94 T2V 515

4. 目录结构

filmbench/ ├── video/ # 生成的视频,按模型组织 │ └── <模型文件夹>/ │ └── <模型文件夹>_<uid>.mp4 ├── r2v_reference_image/ # R2V任务的参考图像 │ └── <uid>.png ├── filmbench_videos.csv # 视频清单(每行对应一个模型×提示) ├── machine_scores_en.jsonl # 每个视频的机器评分结果(英文字段) └── README.md

命名规则:

  • uid: <task>-<row_id>,例如 r2v-405, t2v-1
  • 视频文件名: <模型文件夹>_<uid>.mp4,例如 Seedance2-0_r2v-405.mp4
  • 参考图像: <uid>.png,例如 r2v-405.png(仅R2V)

5. filmbench_videos.csv 列说明

列名 描述
uid 唯一提示ID,例如 r2v-405, t2v-1
task 任务类型:t2vr2v
model 模型显示名称,例如 Seedance 2.0
movie_type 电影类型(37种之一),例如 Chinese Drama, International Action
movie_name 电影名称参考(中文)
reference_type R2V参考类型:scene, character, 或 prop。T2V为空。
zh_prompt 中文提示文本
en_prompt 英文提示文本
video_path 视频文件的相对路径,例如 video/Seedance2-0/Seedance2-0_t2v-1.mp4
image_path 参考图像的相对路径(仅R2V),例如 r2v_reference_image/r2v-405.png
en_movie_type movie_type的英文翻译,例如 Chinese Drama, International Action
en_movie_name movie_name的英文翻译,例如 Let the Bullets Fly - Episode 1

6. machine_scores_en.jsonl 字段说明

每行是一个JSON对象,代表一个视频在所有评估维度上的机器评分结果。所有字段名为英文。

字段 类型 描述
video_filename string 视频文件名,例如 Seedance2-0_t2v-1.mp4
uid string 提示ID,例如 t2v-1
task string t2vr2v
model string 模型显示名称,例如 Seedance 2.0
movie_type string 电影类型,例如 Chinese Drama, International Action
reference_type string R2V参考类型:scene, character, 或 prop(T2V为空)
machine_overall float 总体分数(0–100),所有L1轴的平均值
machine_L1_dims dict L1轴分数。键:Instruction Following, Temporal Continuity, Aesthetic Quality
machine_L2_dims dict L2组件分数。键:Shot, Character & Performance, Scene, Spatial Continuity, Temporal Continuity, Character Continuity, Audio Continuity, Basic Quality, Shot Editing, Performance, Audio Quality, Visual Following (仅R2V), Audio (仅R2V)
machine_L3_dims dict L3子指标分数(30–38个键,取决于任务)。键格式:<L3名称>-<L2名称>-<L1名称>,例如 Shot Scale-Shot-Instruction Following

示例: json { "video_filename": "Seedance2-0_t2v-1.mp4", "uid": "t2v-1", "task": "t2v", "model": "Seedance 2.0", "movie_type": "Chinese Drama", "reference_type": "", "machine_overall": 85.50, "machine_L1_dims": { "Instruction Following": 98.44, "Temporal Continuity": 85.71, "Aesthetic Quality": 72.35 }, "machine_L2_dims": { "Shot": 96.88, "Character & Performance": 100.0, "Scene": 100.0, "Spatial Continuity": 83.33, "Temporal Continuity": 100.0, "Character Continuity": 50.0, "Audio Continuity": 100.0, "Basic Quality": 84.72, "Shot Editing": 37.5, "Performance": 56.25, "Audio Quality": 100.0 }, "machine_L3_dims": { "Foreground-Background-Scene-Instruction Following": 100.0, "Scene-Scene-Instruction Following": 100.0, "Shot Scale-Shot-Instruction Following": 100.0, "...": "..." } }


7. 相关链接

  • 论文: https://arxiv.org/abs/2607.24241v1
  • GitHub: https://github.com/Neo-yk/FilmOps

8. 引用

bibtex @misc{wang2026filmbenchfilmgradebenchmarkcinematic, title={FilmBench: A Film-Grade Benchmark for Cinematic Video Generation}, author={Shengyi Wang and Niantong Li and Guangzheng Hu and Hong Qi and Fei Ding and Weixu Qiao and Jinlin Wang and Xiaotong Lv and Peng Han and Zimeng Li and Fanshu Ding and Yushu Wang and Han Wu and Jingjing Chen and Chongxiao Wang and Yanhao Wu and Chenglong Huang and Xiaoqian Zhu and Jie Tian and Hua Li and Jingjing Fan and Mingshuang Tang and Zhong Li and Hengxia Qiang and Weibin Chen and Jinyang Zhen and Bing Zhao and Lin Qu and Jing Li and Hu Wei}, year={2026}, eprint={2607.24241}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2607.24241}, }

搜集汇总
数据集介绍
FilmBench 数据集图片
构建方式
FilmBench是一个专为评估视频生成模型而设计的电影级基准数据集。其构建过程紧密围绕文本到视频(T2V)和参考图像到视频(R2V)两大任务展开,共计包含1169个精心设计的提示,其中T2V任务515个、R2V任务654个,每个R2V提示均配有对应的参考图像。数据集覆盖20种电影类型,横跨中国电影与国际电影两大市场。在视频生成环节,研究团队使用10个前沿视频生成模型对每个提示进行生成,最终汇集了9213段视频,其中T2V视频由9个模型生成,R2V视频由7个模型生成,从而构建出一个多元且具有代表性的评测库。
使用方法
使用FilmBench进行模型评估时,用户可直接访问HuggingFace下载数据集,其中包含按模型文件夹组织的视频文件、R2V参考图像以及一份完整的视频清单CSV文件。通过加载`filmbench_videos.csv`,用户可获取每个视频对应的提示文本、生成模型、电影类型等元数据。更深入的评测可借助`machine_scores_en.jsonl`文件,该文件每行记录一个视频在三级评价体系下的所有自动打分结果。研究者既可以直接使用这些开箱即用的评分进行模型排名与性能分析,也可以基于提供的视频和提示进行人工或自定义的二次评测。
背景与挑战
背景概述
FilmBench是由北京电影学院专家团队联合主导,于2026年推出的电影级视频生成评估基准。该数据集聚焦于评测视频生成模型在电影质感层面的表现,覆盖文本到视频(T2V)与参考图像到视频(R2V)两大任务,包含1169条提示词及9213段生成视频,横跨20种中西方电影类型。其核心研究问题在于建立一套符合电影工业标准的精细化评估体系,通过三级递进式评分指标(从宏观轴、中观组件到微观子指标)量化模型在指令遵循、时间连续性与美学质量三个维度的表现。FilmBench的诞生填补了通用视频生成评测领域缺乏专业电影视角的空白,为模型研发与电影制作实践之间搭建了关键桥梁。
当前挑战
FilmBench所面对的领域问题在于,现有视频生成评测多聚焦于视觉保真度或文本匹配度等基础指标,难以评估生成内容在电影叙事、镜头语言和艺术表现力上的专业水准。构建过程中,研究团队需将电影学院的抽象美学理论转化为可量化的三层评价体系,这在定义指标边界(如角色连续性、音频质量与剪辑节奏)时面临主观性与客观性的协调难题。此外,跨模型的视频生成需统一提示词语种(中英文)、电影类型及参考图像类型(场景/角色/道具),确保不同模型间的比较公平性,数据处理与标注的复杂性构成了显著技术挑战。
常用场景
经典使用场景
FilmBench作为首个电影级视频生成评估基准,其最经典的使用场景在于对文生视频(Text-to-Video)与参考图生视频(Reference-to-Video)两大任务的模型性能进行系统化测评。该基准覆盖了515条文本提示与654条带参考图像的提示,横跨中国电影与国际电影共20种电影类型,通过三级评估体系(L1轴、L2组件、L3子指标)细致衡量生成视频在指令遵循、时间连续性与美学品质三个维度的表现。研究者借助FilmBench能够对Seedance 2.0、HappyHorse等十余种主流视频生成模型进行客观量化对比,从而甄别不同模型在电影级画面中的优势与短板。
解决学术问题
FilmBench解决了视频生成领域长期缺乏专业化电影级评估标准的学术困境。既往基准多聚焦于自然场景或简单动作生成,未能充分涵盖电影语言中的景别调度、角色一致性、场景保真度等复杂维度。FilmBench通过与北京电影学院专家联合设计的评估体系,将剧作、镜头、剪辑等电影学核心概念引入计算评估框架,为量化解析生成视频的叙事逻辑与艺术表现力提供了可靠工具。该基准的发布推动了视频生成研究从技术指标关注向美学与语义理解的深层跨越,显著提升了评估结果的可解释性与行业参考价值。
实际应用
在实际应用中,FilmBench为影视制作、广告创意与虚拟内容生产等领域提供了高效的模型选型与质量监控工具。制作团队可利用其对不同视频生成引擎的成片效果进行横向比对,结合影片类型(如中国剧情片、国际动作片)与参考对象类型(场景、角色、道具)精准筛选适配的生成方案。视频平台与内容审核机构亦可参照其多级评分体系,自动化检测生成视频在时间连续性、角色保真度等关键指标上的缺陷,从而辅助人工编辑决策,降低创作迭代成本。
数据集最近研究
最新研究方向
FilmBench作为首个面向电影级视频生成的专业评估基准,近期在视频生成领域引发了广泛关注。该数据集与北京电影学院联合设计的三级评估体系,从指令遵循、时间连续性和美学质量三大维度,对文本到视频及参考图像到视频两种任务进行精细化评测,涵盖20种电影类型。当前研究热点集中于利用该基准对Seedance 2.0、HappyHorse等主流模型进行系统性比较,揭示不同模型在镜头语言、角色一致性、场景保真度等细粒度指标上的性能差异。FilmBench的发布标志着视频生成评估从技术指标向电影艺术标准的范式转变,为构建具备专业审美水准的生成式视频模型提供了重要参考框架,推动了AIGC在影视工业中的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务