EntityBench
收藏资源简介:
EntityBench是一个用于长范围多镜头视频生成的基准测试,包含140个剧集(2,491个镜头),源自真实叙事媒体,具有明确的每镜头实体调度,跟踪角色、对象和位置,分为简单/中等/困难三个层级,支持最多50个镜头、13个跨镜头角色、8个跨镜头位置、22个跨镜头对象,以及最多48个镜头的重复间隔。
EntityBench is a benchmark for long-span multi-shot video generation. It comprises 140 episodes (2,491 shots) derived from real-world narrative media, featuring explicit per-shot entity scheduling that tracks characters, objects and locations. The benchmark is categorized into three difficulty tiers: simple, medium and hard, and supports scenarios with up to 50 shots, 13 cross-shot characters, 8 cross-shot locations, 22 cross-shot objects, as well as a maximum repeat interval of 48 shots.
EntityBench 数据集概述
EntityBench 是一个面向多镜头视频生成中实体一致性评估的基准数据集,旨在衡量长序列视频生成中角色、物体和地点跨镜头的一致性。
数据集规模与结构
- 总集数:140 集
- 总镜头数:2,491 个镜头
- 难度划分:分为 easy / medium / hard 三个等级
- 数据来源:源自真实叙事媒体,包含明确的每镜头实体调度表
实体覆盖范围
数据集在实体维度上具备以下特征:
| 维度 | 覆盖范围 |
|---|---|
| 跨镜头角色 | 最多 13 个 |
| 跨镜头地点 | 最多 8 个 |
| 跨镜头物体 | 最多 22 个 |
| 单集最大镜头数 | 50 个 |
| 实体重现间隔 | 最长 48 个镜头 |
评估体系
EntityBench 配备了三支柱评估框架:
- 支柱一(Pillar 1):镜头内视觉质量评估
- 支柱二(Pillar 2):提示遵循对齐度评估
- 支柱三(Pillar 3):跨镜头实体一致性评估
- 包含 fidelity gate,仅对准确出现的实体进行交叉镜头评分
发布内容
data/scripts/:140 个 JSON 文件,包含每镜头的完整实体调度表和注册提示data/splits/:easy / medium / hard 等级划分eval/:评估代码(单 GPU 评估器、多 GPU 启动器、方法对比工具)examples/run_eval_example.sh:启动脚本示例
基线方法
论文提出 EntityMem 系统,一种记忆增强生成方法,在生成开始前将已验证的每实体视觉参考存储在持久记忆库中,使视频骨干网络能够跨镜头检索每个实体的外观。
论文引用
bibtex @article{he2026entitybench, title = {EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation}, author = {He, Ruozhen and Meng, Wei and Yang, Ziyan and Ordonez, Vicente}, journal = {Preprint}, year = {2026}, }




