遇见数据集

KlingTeam/UnityShotsBench

收藏
Hugging Face2026-06-24 更新2026-07-22 收录
官方服务:

资源简介:

UnityShots Benchmark 是一个多语言、多文化的 k-shot 叙事基准数据集,用于评估多镜头音频-视频生成。每个案例是一个短篇电影故事,由多个镜头讲述,具有一致的演员阵容,其身份、声音和世界必须在每个镜头切换中保持一致。该数据集包含200个故事序列(从story_001到story_200),涉及430个命名角色,每个角色都有参考身份和声音。每个故事包含3到6个镜头(平均5.0个),覆盖13种语言(包括普通话、粤语、英语、德语、西班牙语、阿拉伯语、印地语、孟加拉语、斯瓦希里语、约鲁巴语、波斯语、葡萄牙语和越南语)和6个文化区域(东亚、欧洲、南亚/东南亚、非洲、拉丁美洲、中东)。数据集支持三种输入模式:文本到视频(T2V)、图像到视频(I2V)和参考到视频(R2V),旨在公平评估跨镜头身份保持、声音/音色一致性、口型同步、场景连续性和音频-文本对齐。数据集结构包括索引文件、序列列表、参考身份肖像、参考语音剪辑和每镜头首帧锚点。数据集仅用于学术和非商业研究。

A multilingual, multi-cultural k-shot storytelling benchmark for evaluating multi-shot audio-video generation. Each case is a short cinematic story told across several shots, with a consistent cast whose identity, voice, and world must persist across every cut. The dataset includes 200 story sequences (from story_001 to story_200), featuring 430 named characters with reference identity and voice. Each story contains 3 to 6 shots (mean 5.0), covering 13 languages (Mandarin, Cantonese, English, German, Spanish, Arabic, Hindi, Bengali, Swahili, Yoruba, Persian, Portuguese, Vietnamese) and 6 cultural regions (East Asia, Europe, South/SE Asia, Africa, Latin America, Middle East). It supports three input modes: Text-to-Video (T2V), Image-to-Video (I2V), and Reference-to-Video (R2V), designed for fair evaluation of cross-shot identity preservation, voice/timbre consistency, lip-sync, scene continuity, and audio–text alignment. The dataset structure includes an index file, sequence list, reference identity portraits, reference voice clips, and per-shot first-frame anchors. It is intended for academic, non-commercial research only.

提供机构:
KlingTeam
搜集汇总
数据集介绍
KlingTeam/UnityShotsBench 数据集图片
构建方式
UnityShotsBench 是一个专为多镜头音视频生成设计的多语言、多文化基准数据集,其构建基于200个短篇电影故事,每个故事包含3至6个镜头,平均5个镜头,涉及430个带有身份与语音参考的命名角色。数据集覆盖13种语言,包括普通话、粤语、英语、德语等,并分布于东亚、欧洲、南亚/东南亚、非洲、拉丁美洲和中东六个文化区域。每个故事以结构化JSON格式记录,包含全局描述、角色信息(年龄、性别、语言、声音与外貌)以及每个镜头的详细脚本(时长、过渡类型、字幕、对话与音频)。此外,数据集提供了参考身份肖像、参考语音片段及镜头首帧锚点,分别用于参考到视频(R2V)、文本到视频(T2V)和图像到视频(I2V)三种条件生成模式。
特点
该数据集最显著的特点在于其多语言、多文化覆盖与跨镜头一致性的评估能力。它通过200个精心设计的叙事案例,要求生成的音视频在角色身份、语音音色和世界背景上保持连续,从而精准衡量模型在身份保持、音色一致性、唇形同步、场景连续性和音频-文本对齐方面的表现。数据集支持多种条件输入模式,包括文本驱动、图像驱动和参考驱动,为多镜头生成任务提供了公平且全面的评估框架。其规模虽小(少于1000个案例),但结构紧凑、标注丰富,尤其适合学术研究中的非商业用途,参考身份与语音均来源于公共领域或AI生成,确保了研究的可复现性。
使用方法
使用UnityShotsBench进行评估时,研究者首先根据需求选择条件模式:若仅依赖文本字幕,则采用T2V模式,以每个镜头的shot_caption作为输入;若使用图像驱动,则加载refs_first_frame目录下对应镜头的首帧图像作为I2V输入;若需完整身份与语音参考,则使用R2V模式,从refs_id和refs_audio中调用角色的肖像与语音片段。所有数据均通过index.json文件中的sequence_id及角色索引映射至相应参考文件。评估焦点包括跨镜头的身份与音色保持、场景连贯性以及音视频同步质量,该基准专为学术研究设计,需遵守CC BY-NC 4.0许可协议,仅限非商业用途。
背景与挑战
背景概述
UnityShotsBench是由JIA-Lab研究团队于2026年发布的创新性多镜头音视频生成评估基准,旨在解决跨镜头故事生成中角色身份、声音与场景一致性的核心难题。该数据集收录了200个多语言、多文化背景的短篇故事,涵盖13种语言与6个文化区域,包含430个命名角色及其参考身份肖像与语音样本,每个故事由3至6个镜头组成。通过提供文本到视频、图像到视频及参考到视频三种条件生成模式,该基准为评估音视频生成模型在身份保持、语音一致性、唇形同步及场景连续性等方面的性能提供了标准化测试平台,对推动多镜头叙事生成领域的发展具有重要意义。
当前挑战
该数据集所应对的核心领域挑战在于多镜头故事生成中跨镜头身份、声音与环境的持续性保持,这是现有文本到视频方法难以解决的瓶颈。构建过程中面临的挑战包括:如何设计涵盖多元文化背景的多语言故事以确保评估的泛化性;如何为每个角色收集并标注一致性的身份肖像与语音参考;如何定义不同镜头间的过渡逻辑与叙事连贯性;以及如何确保生成的音视频在跨镜头切换时保持角色外观、音色和场景元素的稳定性。这些挑战的解决对于推动多镜头音视频生成模型从单镜头片段生成迈向完整故事叙述具有关键作用。
常用场景
经典使用场景
UnityShotsBench作为跨镜头音视频生成领域的标杆性评测基准,其核心应用场景聚焦于多镜头叙事性音视频内容的生成与评估。该数据集精心构建了200个涵盖13种语言、6大文化区域的短篇电影故事,每个故事包含3至6个连续镜头,要求生成的音视频在角色身份、声线特征、场景连续性以及音频与文本对齐等多个维度上保持高度一致性。研究者通常借助该基准,在文本到视频、图像到视频以及参考到视频三种条件模式下,系统性地衡量模型在身份保持、唇形同步、跨镜头场景连贯性等方面的表现,从而为多镜头叙事生成技术的进步提供公正且可复现的评测标准。
衍生相关工作
围绕UnityShotsBench,已衍生出一系列具有深远影响的经典工作。首先,伴随该基准发布的UnityShots模型本身,其提出的记忆驱动生成与边界感知门控机制,成为后续研究者在处理跨镜头一致性难题时的重要方法论基石。该基准的构建理念也启发了一系列多模态评测体系的建立,如针对视频中角色面部表情与语音韵律联合保持的细化研究,以及探索文化特异性叙述风格的生成方法。此外,许多后续工作以此为基础,拓展了参考条件视频生成在不同领域(如远程会议、虚拟主播)的边界,推动了学术界与工业界对叙事性视频生成统一框架的深入探讨。
数据集最近研究
最新研究方向
UnityShotsBench的提出标志着多模态音视频生成领域迈入了一个以记忆驱动与跨镜头一致性为核心的新阶段。该基准聚焦于多镜头叙事中的身份、语音和场景的持续连贯性,通过涵盖13种语言和6个文化区域的200条故事序列,深入探索了文本到视频、图像到视频及参考到视频三种条件模式下的生成能力。这一研究紧密关联当前AIGC领域对长视频叙事、跨文化表达和细粒度控制的前沿追求,其边界感知门控机制为破解多镜头生成中的身份漂移与语境断裂难题提供了关键路径,对推动影视自动化创作与全球化内容生产具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务