PersonaShot
收藏资源简介:
PersonaShot是由上海交通大学、腾讯优图实验室和浙江大学联合创建的首个以人物为中心的多镜头视频叙事连贯性基准数据集。该数据集包含约1000个多镜头片段,总计超过5000个标注镜头,并涵盖物理连续性、情感动态和电影语法三大维度的16项细粒度指标。数据集采用视频优先范式,基于CineDance-1M和OpenHumanVid语料库,通过自动三阶段处理流程(序列分割、人脸质量过滤、跨镜头关系挖掘)构建,并辅以层级化文本标注。该基准旨在系统评估视频生成模型在跨镜头叙事中的人物状态一致性,解决现有基准仅关注单镜头质量或粗粒度情感而忽视人物物理重置、情感突变和电影语法断裂等问题。
PersonaShot is the first person-centric benchmark dataset for multi-shot video narrative coherence, jointly developed by Shanghai Jiao Tong University, Tencent YouTu Lab, and Zhejiang University. This dataset comprises approximately 1,000 multi-shot segments, totaling over 5,000 annotated shots, and includes 16 fine-grained metrics across three core dimensions: physical continuity, emotional dynamics, and cinematic grammar. Constructed using a video-first paradigm based on the CineDance-1M and OpenHumanVid corpora, the dataset is built through an automated three-stage processing pipeline encompassing sequence segmentation, face quality filtering, and cross-shot relationship mining, and is supplemented with hierarchical text annotations. This benchmark aims to systematically evaluate the character state consistency of video generation models in cross-shot narrative scenarios, addressing the shortcomings of existing benchmarks that only focus on single-shot quality or coarse-grained emotions while neglecting issues such as character physical state reset, emotional shifts, and cinematic grammar discontinuity.
PersonaShot 数据集详情
数据集概述
PersonaShot 是首个以人物为中心的多镜头视频生成叙事连续性基准测试集,旨在评估视频生成模型在跨镜头条件下的人物物理状态、情感动态和电影语法的连贯性。
核心规模
- 1,000+ 多镜头片段
- 5,000+ 已标注镜头
- 16 细粒度评估指标
- 3 叙事维度
- 5.3 平均每片段镜头数
- ρ = 0.73 与人类判断的对齐度
三大叙事维度
1. 因果物理连续性
- 空间布局
- 对象状态持久性
- 几何比例
2. 情感动态
- 表情自然度
- 面部动作时间连贯性
- 情感-叙事对齐
- 情感弧线
3. 电影语法
- 镜头转换
- 转换节奏
- 180° 规则
- 视线匹配
- 导演叙事排序
数据来源与处理流程
- 数据来源:CineDance-1M 和 OpenHumanVid
- 三阶段处理管线:
- 阶段1:序列分割与人物连续性(TransNetV2,每片段2-15个镜头)
- 阶段2:人脸可见性与质量筛选(RetinaFace + CLIP-IQA)
- 阶段3:跨镜头关系选择(基于Qwen的多模态推理)
评估框架
- 使用 Qwen3.5-397B 大模型作为教师模型,通过蒸馏将推理能力转移到轻量级专家评估器(Qwen3.5-4B + LoRA)
- 物理连续性:训练时使用标注,推理时严格隔离输入
- 情感动态:采用 OpenFace 的帧级动作单元信号,基于面部动作编码系统(FACS)
- 电影语法:两阶段流程,CineCap 提取专业电影语言描述,推理器通过 TransNetV2 镜头边界评估
主要发现
- 感知质量 ≠ 叙事连续性:ShotStream 视觉保真度最高(VF=0.994),但综合排名仅第7
- 叙事推理比提示粒度更重要:Seedance 综合领先(0.793)
- 物理和情感状态传播仍是主要挑战
- 电影语法普遍建模不足:多数系统在转换适切性、180°规则和视线匹配上失败
- 长时间电影控制存在显著差距:Seedance(DNS=0.865)远超开源模型 LTX-2.3(0.624)和 VGoT(0.535)
人工验证
- 实验设置:10位领域专家,25个多镜头序列,每序列4位标注者,Krippendorffs α = 0.76
- 最强对齐指标:叙事排序(DNS,ρ=0.74)和对象状态持久性(OSP,ρ=0.74)




