遇见数据集

Reframed

收藏
arXiv2026-08-10 更新2026-08-12 收录
官方服务:

资源简介:

Reframed是由爱丁堡大学信息学院构建的高质量音频描述生成数据集,旨在解决电影中何时描述以及描述什么内容的联合决策问题。该数据集包含来自206部电影的2,023个视频片段,涵盖3,302个场景,并提供了专业的美式与英式音频描述转录、对话字幕、听觉障碍者字幕以及对齐的剧本等多模态数据。创建过程中,训练数据通过自动语音识别和自监督对齐流水线生成,而评估数据则采用专业人工转录与帧级时间编码,确保高精度。该数据集主要应用于电影音频描述自动化研究,旨在帮助视障人士理解电影叙事,同时为多模态大语言模型在视频理解与生成任务中提供新的基准与挑战。

Reframed is a high-quality audio description generation dataset developed by the School of Informatics, University of Edinburgh, aiming to address the joint decision-making problem of when and what to describe in films. This dataset comprises 2,023 video clips from 206 films, spanning 3,302 scenes, and provides multi-modal data including professional American and British audio description transcripts, dialogue subtitles, subtitles for the hard of hearing, and aligned screenplays. During its development, the training data was generated through an automatic speech recognition and self-supervised alignment pipeline, while the evaluation data was produced via professional manual transcription and frame-level time coding to ensure high accuracy. This dataset is primarily applied to research on automated audio description for films, aiming to assist visually impaired people in understanding film narratives, while also providing new benchmarks and challenges for multimodal large language models in video understanding and generation tasks.

创建时间:
2026-08-10
搜集汇总
数据集介绍
Reframed 数据集图片
构建方式
Reframed数据集源于对电影无障碍描述(AD)生成任务的重新定义,旨在解决现有方法将AD生成简化为片段级视频描述的问题。其构建过程融合了多源数据:从Rotten Tomatoes获取未经水印的原始电影片段,从AudioVault获取英美两个版本的AD音轨,并采用专业的ASR系统(Speechmatics)进行转录与说话人识别,实现了低至2.9%的词错误率。所有数据均经过交叉相关时间对齐,并利用Vecalign将85部电影的场景与剧本进行高精度对齐。此外,构建流程中还训练了RoBERTa模型用于AD分割和场景边界检测,而评估数据则全部采用人工专业转录,确保金标准质量。最终,数据集包含2,023个视频片段,覆盖206部电影、3,302个场景,并配套提供专业对话字幕、SDH字幕和多个AD参考版本。
特点
Reframed数据集的核心特色在于其对AD生成的现实性模拟,要求模型同时决策描述内容与插入时机,这区别于以往仅关注内容的简化评估。数据集提供了丰富的平行数据流,包括英美双版本的AD转录、专业字幕及对齐剧本,为研究叙事上下文建模提供了坚实基础。尤其值得关注的是,其挑战集包含10部完整电影,每部配备2-3个人工转录的AD参考,并标注了精确的场景边界和AD-场景标签,支持多参考评估。此外,数据集还验证了现有AD数据集普遍存在的噪声问题,并提供了高精度的对齐和分割工具,其构建管道中每个环节均经过量化验证,确保了数据质量的可控性和可靠性。
使用方法
Reframed数据集适用于训练和评估AD生成模型,使用方法遵循其提出的新任务设定:输入视频、对话字幕及对话间隙的时间跨度,模型需输出每个间隙中是否插入描述以及描述的具体内容。评估协议包括基于对话间隙的词汇相似度指标(CIDEr、METEOR)、基于对齐的SODA-M和SODA-T(后者衡量时间对齐)、以及基于问答的QEval和QEval-T(后者额外要求回答的时间定位准确)。此外,挑战集支持多参考评估,可将生成的AD与多个专业参考版本进行对比。数据集还提供了基线代码和评估工具,便于研究者复现实验并拓展至新模型。
背景与挑战
背景概述
Reframed数据集由爱丁堡大学信息学院的研究团队于2026年构建,主要研究人员包括Igor Sterner、Mirella Lapata、Alex Lascarides和Frank Keller。该数据集聚焦于电影音频描述(Audio Description, AD)的自动生成,旨在解决现有方法将AD简化为片段级视频字幕生成的问题。研究团队重新定义了AD生成任务,要求模型同时决定描述内容(what to describe)和描述时机(when to describe),更贴近真实场景中的编辑决策。数据集包含2,023个视频片段、206部电影的3,302个场景,并提供专业双版本AD文本(美式与英式)、字幕及对齐的剧本,为视频理解与多模态叙事分析提供了高质量基础。该工作发表于COLM 2026,其创新任务设定和丰富数据资源显著推动了电影级视频理解与无障碍技术研究。
当前挑战
Reframed数据集面临多重挑战。核心领域挑战在于AD生成需在长时视频中识别叙事显著元素(如角色、动作、空间转换),并精确插入对话间隙,这要求模型具备跨场景的叙事理解与时间规划能力,远超传统视觉语言任务。现有模型在内容选择、时机把握及实现简洁描述方面均与专业人工差距显著,尤其在需要推断角色意图和长距离依赖时表现不佳。构建过程中,数据收集面临对齐与转写噪声问题:自动语音识别(ASR)对AD的转写错误率高,旧数据集转录质量未经评估;视频场景与完整AD轨道的对齐也需克服PAL/NTSC帧率差异。此外,构建双版本AD、剧本场景对齐、专业字幕获取及人工标注基准集均需大量资源与精细校验,确保数据质量与多参考一致性,为训练与评估带来严峻考验。
常用场景
经典使用场景
Reframed数据集的核心应用场景在于重构电影音频描述(AD)的生成范式,将其从传统的片段级视频字幕生成任务提升为联合决策问题,即模型需自主判断何时以及如何插入描述。该数据集包含2,023个视频片段、3,302个场景,源自206部电影,并提供英美双版本的专业AD转录、对话字幕、SDH字幕及对齐的剧本,为训练和评估具备长时叙事理解与时空精准定位能力的多模态模型提供了高质量数据支撑。
解决学术问题
该数据集有效解决了现有AD生成研究中任务设定简化、数据质量噪声高及缺乏叙事上下文建模等核心学术难题。通过引入双重专业AD参考和手工精标注的挑战集,Reframed支持对描述内容选择、时间放置及语言实现的联合评估,为衡量多模态大语言模型在复杂电影场景中的零样本生成能力设立了严苛基准,推动视频理解从短时描述向长时叙事推理的关键跨越。
衍生相关工作
基于Reframed,研究者已衍生出多项经典工作,包括对自动语音识别(ASR)转录质量的系统评估、场景与剧本的对齐算法优化、AD分割与场景边界预测模型的训练,以及针对不同国家AD风格差异的对比研究。这些工作不仅提升了数据集本身的构建精度,也催生了诸如基于对话间隙的评估指标(SODA-M、QEval-T)等新的评测范式,为后续长视频描述生成研究提供了方法论参考和可复现的实验基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务