遇见数据集

MultiVSR2LRS3 (MV2LRS3)

收藏
arXiv2026-06-05 更新2026-06-09 收录
官方服务:

资源简介:

MultiVSR2LRS3是由帝国理工学院和都柏林三一学院联合构建的音频-视觉语音识别评估数据集,旨在严格评估现有模型的真实泛化性能。该数据集从大规模MultiVSR语料库的英语验证集中精心采样,包含与经典LRS3测试集在声学、视觉和人口统计学等七个关键维度上严格匹配的分布,数据规模与LRS3测试集相当(约0.9小时视频)。其构建过程采用多维k近邻匹配策略,通过加权特征向量实现分布对齐,确保评估的严谨性。该数据集主要应用于揭示音频-视觉语音识别模型在分布匹配条件下的泛化缺陷,为解决当前模型过度适应特定基准、缺乏鲁棒性的核心问题提供关键评估工具。

MultiVSR2LRS3 is an audio-visual speech recognition evaluation dataset jointly constructed by Imperial College London and Trinity College Dublin, aiming to rigorously evaluate the true generalization performance of existing models. It is meticulously sampled from the English validation subset of the large-scale MultiVSR corpus, and its data distribution strictly matches that of the classic LRS3 test set across seven key dimensions including acoustics, vision and demographics. The scale of this dataset is comparable to that of the LRS3 test set, containing approximately 0.9 hours of video. The dataset is built using a multi-dimensional k-nearest neighbor matching strategy, which achieves distribution alignment via weighted feature vectors to ensure the rigor of the evaluation. This dataset is primarily used to reveal the generalization flaws of audio-visual speech recognition models under distribution-matched conditions, providing a critical evaluation tool to address the core issue that current models overly adapt to specific benchmarks and lack robustness.

创建时间:
2026-06-05
原始信息汇总

数据集名称: MultiVSR2LRS3 (MV2LRS3)

所属论文: Assessing True Generalisability of Audio-Visual Speech Recognisers(Interspeech 2026 长文)

核心用途: 评估语音识别模型真实泛化能力的音视频语音数据集。

数据来源与构建: 从 MultiVSR 数据集中严格筛选子样本,使其分布与 LRS3 测试集分布完全一致。

数据集下载与结构:

  • 下载地址:https://drive.google.com/file/d/1jmH1srv_27M19cC0JblvV9CuuW9WxjeS/view?usp=drive_link
  • 目录结构:
    • data/:原始媒体文件,包含裁剪嘴部区域的视频(mp4格式)和对应音频(wav格式)。
    • manifest/:评估子集文件,包含6个TSV文件:
      • subset_v1.tsvsubset_v5.tsv:5个不同随机选择的受控子集。
      • 10x.tsv:10倍缩放集。
  • TSV 文件内容:包含转录文本及所有元数据(时长、年龄、性别、表观肤色、头部姿态、信噪比、语速)。

评估方法: 推荐在全部5个子集上运行推理,并报告平均性能指标和标准差。

与 LRS3 测试集的对比: 提供了核心统计对比图,证明 MV2LRS3 的分布与 LRS3 测试集严格一致。

伦理声明: 人口统计元数据通过自动化工具生成,属于算法推断,非自我报告身份,研究者应谨慎使用这些标签。

搜集汇总
数据集介绍
MultiVSR2LRS3 (MV2LRS3) 数据集图片
构建方式
当前音频-视觉语音识别(AVSR)模型在标准LRS3基准测试中表现近乎完美,引发了对其是否真正具备泛化能力的质疑。为系统性评估这一能力,研究者从大规模MultiVSR数据集中精心构建了一个高度受控且未经见过的评估子集——MultiVSR2LRS3(MV2LRS3)。构建过程摒弃了简单复制LRS3数据创建流程的方法,转而采用多维k近邻匹配策略。首先,将LRS3测试集设为参考分布,并将MultiVSR英语验证集视为候选池。通过为每个视频提取声学、视觉及人口统计学等七个维度的特征向量,并引入经验性特征加权以优化协变量平衡,对LRS3测试集中每个样本在候选池中寻找五个最近邻,再从中均匀随机抽取一个样本。该随机过程重复五次,生成五个分布严格对齐的MV2LRS3变体,从而确保子集与LRS3测试集在声学、视觉及人口统计学分布上高度一致。
特点
MV2LRS3数据集的核心特点在于其严格受控的分布对齐性质。它并非简单的跨领域基准,而是精确匹配LRS3测试集在时长、年龄、性别、肤色、头部姿态、信噪比及语速等七项关键属性上的分布。这种多维度的严格匹配使得性能下降可归因于模型对LRS3特定分布的自适应过拟合,而非简单的领域差异。令人瞩目的是,评估涵盖从全监督端到端模型到集成大语言模型的前沿架构,所有模型在此受控集上均遭遇性能崩溃,字错误率从低于1%激增至14%以上,线性拟合斜率高达10.4,远超图像分类或视觉语音识别领域的1.0至2.0范围,揭示了AVSR模型对基准测试分布异常的敏感性。此外,该数据集揭示了词汇偏差:模型在LRS3共享词汇上表现显著优于新词汇,以及模态融合的悖论——多数模型在加入视觉信息后性能反而劣于纯音频设定。
使用方法
MV2LRS3数据集为AVSR领域的泛化性评估提供了严谨的基准工具。研究者可直接使用发布的数据集及其元数据,对现有或新开发的模型进行标准化测试,通过比较在LRS3与MV2LRS3上的字错误率差异,定量评估模型的过拟合程度。更深入的分析可采用留一属性分析法:排除某一特定匹配因子构建新子集,观察性能变化以隔离该因子的独立影响。例如,放开时长约束可揭示模型对上下文窗口的依赖程度,而分析不同头部角度区间可检验视觉编码器的鲁棒性。词汇层面,可依据LRS3测试集词表将MV2LRS3词汇划分为共享与差异部分,计算个体字错误率以量化词汇过拟合。模态对比分析则通过比较音频-视觉、纯音频及纯视频设定下的性能,评估视觉信息的真实贡献。这些方法共同构建了一个结构化框架,超越简单字错误率比较,实现了对模型泛化失败根源的可解释诊断。
背景与挑战
背景概述
在音频-视觉语音识别领域,近年来模型在LRS3基准上取得了近乎完美的性能,词错误率甚至低于1%,但这引发了学界对其真正泛化能力的深刻质疑。为系统性地评估这一问题,Zhaofeng Lin等研究者于2026年从大规模MultiVSR数据集中精心构建了一个高度可控的未见评价集MV2LRS3。该数据集由都柏林圣三一大学与帝国理工学院联合创建,其核心研究问题在于探索当前顶尖模型是否仅仅过度适应了LRS3的特定分布,而非具备鲁棒的多模态语音识别能力。MV2LRS3严格匹配了LRS3测试集在声学、视觉及人口统计学等七个维度的分布,为评估模型在严格对齐条件下的泛化性能提供了前所未有的严谨基准,对推动AVSR领域的健康发展具有深远影响力。
当前挑战
MV2LRS3数据集所揭示的核心挑战在于,当前最优的音频-视觉语音识别模型普遍存在严重的性能崩塌现象,即便在严格匹配LRS3分布的条件下,词错误率也骤升至14%至23.5%,远高于基准上的不到1%。这一挑战根植于领域内长期存在的评估瓶颈:1)LRS3测试集规模过小(仅0.9小时),导致模型极易陷入适应性过拟合与词汇偏差,从而丧失对未见数据的真正泛化能力;2)在构建过程中,研究者面临巨大挑战,包括从庞大的MultiVSR候选池中通过多维k近邻匹配策略精准对齐七项关键属性(如时长、头部姿态、信噪比),并需应对未知混杂变量(如口音、说话风格)的干扰,最终揭示出多模态优势的消失成为领域内最令人警醒的难题。
常用场景
经典使用场景
在视听语音识别(AVSR)领域,主流模型在LRS3基准上已近乎饱和,其真实泛化能力却备受质疑。MultiVSR2LRS3(MV2LRS3)数据集正是为系统评估这一核心问题而生,它从大规模多语种数据集MultiVSR中精心筛选,构建出一个与LRS3测试集在声学、视觉及人口统计特征上严格匹配的未见评估子集。研究者借此可在精确控制分布偏移的条件下,检验模型面对相同分布的新样本时的表现,从而剥离因数据特异导致的性能假象,为AVSR模型的鲁棒性提供更客观的试金石。
实际应用
在实际应用中,MV2LRS3数据集的价值体现在为AVSR系统的可靠性验证提供了严苛标尺。工业界的语音助手、智能字幕生成或人机交互设备常面临来自不同演讲者、噪声环境及视觉姿态的挑战,而该数据集精准复现了这些复杂因素的分布。通过在此基准上测试,开发者可以识别模型在年龄、肤色、头部偏转角等真实场景变量上的脆弱性,从而针对性优化视觉编码器的抗干扰能力或后端语言模型的补偿机制,推动视听融合技术从实验室理想条件向多样化的现实部署环境迈进。
衍生相关工作
MV2LRS3数据集的诞生激发了一系列批判性反思与创新工作。受其揭示的词汇偏差启发,研究者开始探索去偏训练策略,如引入基于频率的词汇采样或条件化语言模型,以缓解模型对高频词汇的依赖。针对视觉模态在分布外环境中拖累性能的现象,衍生工作致力于设计更鲁棒的多模态融合机制,例如自适应门控网络或反事实学习框架。此外,该数据集对时长因素的敏感度分析直接促成了上下文感知的语音分割技术,以及针对短时片段进行知识蒸馏的模型轻量化方案,这些工作共同拓展了AVSR系统可靠性与可解释性的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务