遇见数据集

PersonaShot

收藏
arXiv2026-08-17 更新2026-08-19 收录
官方服务:

资源简介:

PersonaShot是由上海交通大学、腾讯优图实验室和浙江大学联合创建的首个以人物为中心的多镜头视频叙事连贯性基准数据集。该数据集包含约1000个多镜头片段,总计超过5000个标注镜头,并涵盖物理连续性、情感动态和电影语法三大维度的16项细粒度指标。数据集采用视频优先范式,基于CineDance-1M和OpenHumanVid语料库,通过自动三阶段处理流程(序列分割、人脸质量过滤、跨镜头关系挖掘)构建,并辅以层级化文本标注。该基准旨在系统评估视频生成模型在跨镜头叙事中的人物状态一致性,解决现有基准仅关注单镜头质量或粗粒度情感而忽视人物物理重置、情感突变和电影语法断裂等问题。

PersonaShot is the first person-centric benchmark dataset for multi-shot video narrative coherence, jointly developed by Shanghai Jiao Tong University, Tencent YouTu Lab, and Zhejiang University. This dataset comprises approximately 1,000 multi-shot segments, totaling over 5,000 annotated shots, and includes 16 fine-grained metrics across three core dimensions: physical continuity, emotional dynamics, and cinematic grammar. Constructed using a video-first paradigm based on the CineDance-1M and OpenHumanVid corpora, the dataset is built through an automated three-stage processing pipeline encompassing sequence segmentation, face quality filtering, and cross-shot relationship mining, and is supplemented with hierarchical text annotations. This benchmark aims to systematically evaluate the character state consistency of video generation models in cross-shot narrative scenarios, addressing the shortcomings of existing benchmarks that only focus on single-shot quality or coarse-grained emotions while neglecting issues such as character physical state reset, emotional shifts, and cinematic grammar discontinuity.

创建时间:
2026-08-17
原始信息汇总

PersonaShot 数据集详情

数据集概述

PersonaShot 是首个以人物为中心的多镜头视频生成叙事连续性基准测试集,旨在评估视频生成模型在跨镜头条件下的人物物理状态、情感动态和电影语法的连贯性。

核心规模

  • 1,000+ 多镜头片段
  • 5,000+ 已标注镜头
  • 16 细粒度评估指标
  • 3 叙事维度
  • 5.3 平均每片段镜头数
  • ρ = 0.73 与人类判断的对齐度

三大叙事维度

1. 因果物理连续性

  • 空间布局
  • 对象状态持久性
  • 几何比例

2. 情感动态

  • 表情自然度
  • 面部动作时间连贯性
  • 情感-叙事对齐
  • 情感弧线

3. 电影语法

  • 镜头转换
  • 转换节奏
  • 180° 规则
  • 视线匹配
  • 导演叙事排序

数据来源与处理流程

  • 数据来源:CineDance-1M 和 OpenHumanVid
  • 三阶段处理管线
    • 阶段1:序列分割与人物连续性(TransNetV2,每片段2-15个镜头)
    • 阶段2:人脸可见性与质量筛选(RetinaFace + CLIP-IQA)
    • 阶段3:跨镜头关系选择(基于Qwen的多模态推理)

评估框架

  • 使用 Qwen3.5-397B 大模型作为教师模型,通过蒸馏将推理能力转移到轻量级专家评估器(Qwen3.5-4B + LoRA)
  • 物理连续性:训练时使用标注,推理时严格隔离输入
  • 情感动态:采用 OpenFace 的帧级动作单元信号,基于面部动作编码系统(FACS)
  • 电影语法:两阶段流程,CineCap 提取专业电影语言描述,推理器通过 TransNetV2 镜头边界评估

主要发现

  1. 感知质量 ≠ 叙事连续性:ShotStream 视觉保真度最高(VF=0.994),但综合排名仅第7
  2. 叙事推理比提示粒度更重要:Seedance 综合领先(0.793)
  3. 物理和情感状态传播仍是主要挑战
  4. 电影语法普遍建模不足:多数系统在转换适切性、180°规则和视线匹配上失败
  5. 长时间电影控制存在显著差距:Seedance(DNS=0.865)远超开源模型 LTX-2.3(0.624)和 VGoT(0.535)

人工验证

  • 实验设置:10位领域专家,25个多镜头序列,每序列4位标注者,Krippendorffs α = 0.76
  • 最强对齐指标:叙事排序(DNS,ρ=0.74)和对象状态持久性(OSP,ρ=0.74)
搜集汇总
数据集介绍
PersonaShot 数据集图片
构建方式
PersonaShot数据集采用视频优先的构建范式,从CineDance-1M和OpenHumanVid两个大规模语料库中获取原始素材,通过三阶段自动化流程筛选出多镜头片段。首先利用TransNetV2检测镜头边界并分割出包含2至15个镜头的连续序列,确保至少有一个重复出现的角色贯穿多个镜头;其次通过RetinaFace进行人脸检测,要求置信度不低于0.85且人脸面积占帧的5%以上,并利用CLIP-IQA剔除模糊或退化的面部图像;最后借助Qwen多模态推理验证相邻镜头间是否具备物理连续性、情感动态或电影语法所需的关联证据。经过严格筛选,最终保留1000个多镜头片段,共计5000余个带标注的镜头,并辅以分层级的文本注释和多模态条件输入。
特点
PersonaShot作为首个以人物为中心的多镜头视频生成叙事连续性基准,其独到之处在于构建了三维度的评价体系:物理连续性、情感动态和电影语法。物理连续性跨越镜头边界跟踪角色位置、物体状态及几何尺度的一致性,情感动态则利用面部动作单元(AU)进行细粒度的表情自然度、时间连贯性和叙事对齐度评估,电影语法覆盖180度规则、视线匹配和剪辑节奏等内容。该基准包含16项细粒度指标,并创新性地采用教师蒸馏技术训练轻量级专业评估器,每种评估器都基于特定视觉、时序或关系证据,与专家人工评判的高度一致性(Spearman相关系数最高达0.78)验证了其可靠性。
使用方法
PersonaShot为多镜头视频生成模型提供了一套统一的测评协议。使用时,生成模型可依据镜头级或全局提示条件生成视频序列,评估框架从序列中抽取五个代表性镜头,分别从镜头内状态、跨镜头过渡和序列级轨迹三个时间层次进行分析。传统的视觉质量指标(如DOVER、MUSIQ)与三个专业评估器相结合,针对物理状态、面部情感和电影结构进行细粒度打分。所有子指标分数经过校准、归一化至[0,1]区间,并依据四维度等权重(各0.25)聚合成综合PersonaShot分数。此外,基准还包含人机对齐验证协议,通过专家评分和统计相关性分析,确保自动评估结果能够准确反映人类对叙事连贯性的主观判断。
背景与挑战
背景概述
随着视频生成技术由单镜头片段向多镜头叙事演进,人物作为叙事核心的连贯性评估成为关键议题。然而,既有基准多聚焦于视觉质量或单镜头表现,难以衡量跨剪辑的物理与情感状态一致性。为填补这一空白,上海交通大学、腾讯优图实验室及浙江大学的研究团队于2026年推出PersonaShot,首个以人物为中心的多镜头视频叙事连贯性基准。该基准包含约1000个多镜头片段及16项指标,覆盖物理连续性、情感动态与电影语法三大维度,并通过多模态教师蒸馏出轻量级专家评估器,与人类专家判断高度对齐。PersonaShot系统揭示了现有模型在跨镜头叙事连贯性上的显著缺口,为多镜头视频生成研究提供了严谨的评测基准与诊断工具。
当前挑战
PersonaShot所面临的挑战多维且深刻。在领域问题层面,跨镜头物理连续性要求角色位置、物体状态及几何尺度在剪辑边界保持一致,而现有物理基准主要评估单镜头内的合理性,导致瞬移与状态突变未被充分惩罚。情感动态的评估需超越粗粒度分类标签,捕捉细微面部变化与连续情绪轨迹,但AU级别的微表情分析极具难度。电影语法则涉及180度规则、视线匹配与转场逻辑,这些关系性约束无法通过孤立镜头评估。在基准构建层面,数据筛选需在规模与质量间权衡,从CineDance-1M与OpenHumanVid中提取多镜头片段并确保人物重复出现与视觉证据充分性,同时人工标注与专家验证的代价高昂。这些挑战共同凸显了多镜头叙事评估的复杂性与基准构建的严谨性。
常用场景
经典使用场景
PersonaShot作为首个以人物为中心的多镜头视频生成叙事连续性基准,其经典使用场景在于系统性地评估生成视频中人物角色在镜头切换间的物理状态、情感动态和电影语法的连贯性。该基准通过约1000个多镜头片段和16项细粒度指标,构建了从镜头内状态、跨镜头过渡到序列级轨迹的三层评估体系,为多镜头视频生成模型提供了统一、可复现的测试平台。研究人员可利用该基准对不同模型进行标准化比较,诊断其在空间布局连续性、对象状态持久性、表情自然度、情感弧线一致性以及180度原则符合度等维度的具体表现,从而深入理解现有模型的优势与不足。
实际应用
在实际应用中,PersonaShot为多镜头视频生成模型的迭代优化提供了可靠、可解释的诊断工具。视频生成系统的开发者可利用该基准自动评估并定位模型在物理状态重置、情感突变和电影语法违规等方面的具体缺陷,从而有针对性地调整模型架构或训练策略。此外,该基准的专家评估器可作为实时反馈模块,辅助交互式故事板创作和自动化视频剪辑,提升影视预可视化、虚拟角色演出和广告内容生成等场景中多镜头叙事的质量与连贯性,为影视制作和内容创作行业提供高效的质检与优化方案。
衍生相关工作
PersonaShot的出现催生了一系列相关研究工作。其提出的三层评估体系和细粒度指标框架被后续研究广泛采纳,例如用于开发更精细的视频生成评估工具或扩展到音频-视觉一致性评估。该基准的教师-学生蒸馏方法启发了轻量级专家评估器在视频质量评估、情感识别和电影语法分析等领域的应用,推动了评估模型从通用型向任务特化型发展。同时,PersonaShot所揭示的物理状态传播和情感轨迹保持难题,促使研究者探索显式状态跟踪模块、叙事规划器以及电影语法约束生成等新方法,进而推动了多镜头视频生成模型在长时叙事控制和跨镜头连贯性方面取得显著进步,形成了一个以叙事连贯为核心的活跃研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务