遇见数据集

RoomReader-AV

收藏
arXiv2026-09-09 更新2026-09-11 收录
官方服务:

资源简介:

RoomReader-AV是都柏林圣三一大学推出的多条件音视频语音识别基准,旨在评估模型在非广播场景下的泛化能力。该数据集包含10324条自发多人在线会议语音片段,涵盖118位发言人的真实对话,总时长约6.5小时。数据收集自30场Zoom辅导课,经人工校正转写并保留语气词与填充停顿,预处理后提供标准化的音视频ROI裁剪与统一格式。该数据集主要应用于音视频语音识别系统的鲁棒性评估,尤其针对摄像角度、说话人发音风格及自发对话等挑战性条件,以揭示当前模型在受控广播数据之外的性能退化问题。

RoomReader-AV is a multi-condition audio-visual speech recognition benchmark developed by Trinity College Dublin, aimed at evaluating the generalization ability of models in non-broadcast scenarios. This dataset contains 10,324 spontaneous multi-party online meeting speech segments, covering real dialogues from 118 speakers, with a total duration of approximately 6.5 hours. The data was collected from 30 Zoom tutoring sessions, with manually corrected transcriptions that retain filler words and filled pauses, and standardized audio-visual ROI cropping and unified formats are provided after preprocessing. This dataset is mainly applied to the robustness evaluation of audio-visual speech recognition systems, especially under challenging conditions such as camera angles, speakers' pronunciation styles and spontaneous dialogues, to reveal the performance degradation of current models beyond controlled broadcast datasets.

创建时间:
2026-09-09
原始信息汇总

Lipreading Data Guide 数据集概述

项目简介

一个用于将主流唇读和音视频语音识别数据集预处理为统一标准化格式的综合工具包。自动化预处理步骤包括人脸跟踪、嘴部 ROI 提取和转录对齐,以简化模型训练工作流。与 AV-HuBERT 和 Auto-AVSR 兼容。

支持的数据集

数据集 状态 描述 规模 主要特征
LRS2 ✅ Ready Lip Reading Sentences 2 ~140k utterances BBC 广播,野外场景
LRS3 ✅ Ready Lip Reading Sentences 3 ~150k utterances TED 演讲,高质量
LRS_Combined ✅ Ready LRS2 + LRS3 合并 ~290k utterances 统一语料库
TCD-TIMIT ✅ Ready TCD-TIMIT 音视频语料库 ~27k utterances 高清视频,受控环境,2 个摄像机角度
GRID ✅ Ready 音视频语音语料库 ~34k utterances 受控词汇,34 位说话人
LombardGrid ✅ Ready Lombard 效应语音 ~5.4k utterances 噪声条件,54 位说话人
RoomReader ✅ Ready 多方对话 ~322 videos 在线会议,118 位参与者
Candor ✅ Ready 自然对话 ~1,656 conversations 无脚本双人对话
VoxCeleb2 🔄 Planned 说话人识别数据集 ~1M utterances 计划使用 Whisper 转录流程
WildVSR ✅ Ready Wild VSR 测试集 Test set 泛化基准
AVCocktail ✅ Ready 鸡尾酒会语音 Challenge dataset 多说话人,噪声
Muavic ⚠️ Experimental 多语言音视频 9 languages 语音识别 + 翻译
MultiVSR 🔄 Planned 大规模多语言 VSR ~1,400 hours 20+ 种语言

状态说明

  • ✅ Ready:已完整测试并可投入生产
  • ⚠️ Experimental:可用但未完全测试
  • 🔄 Planned:计划未来支持(可能提供下载说明)

实用工具

  • Phones:音素转换和映射工具,用于音素级模型训练
  • webData:将 Auto-AVSR 预处理数据转换为 WebDataset 和 Hugging Face 兼容格式的工具

快速开始

每个数据集文件夹包含全面的文档,提供数据获取、预处理和准备的分步说明。导航至特定数据集目录可查看详细设置指南和处理工作流。

路线图

计划通过增加对多语言和多方对话数据集的支持,将工具包扩展到以英语为中心的基准之外,包括 MultiVSR、MARC、MISP、MLD-VC、CI-AVSR、RUSAVIC、KMSAV、VISPER、Friends-MMC、AVSD、HAVRUS、ViCocktail、OLKAVS、F2F-JF 和 Seamless Interaction。这些数据集可有效转换为统一格式,使其可用于 AVSR 和 VSR 研究,并实现跨多种语言和对话场景的更全面、标准化的基准测试。

社区贡献

该工具包设计为社区驱动项目而非封闭框架。欢迎贡献以增加对新数据集的支持、改进数据集转换方案或引入标准化评估协议。目标是构建统一且可扩展的 AVSR 研究基础设施,实现跨多样化数据集的一致训练和评估。

数据集参考文献

  1. LRS2:Afouras, T., Chung, J. S., Senior, A., Vinyals, O., & Zisserman, A. (2018). Deep Audio-Visual Speech Recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence. https://www.robots.ox.ac.uk/~vgg/data/lip_reading/lrs2.html
  2. LRS3:Afouras, T., Chung, J. S., & Zisserman, A. (2018). LRS3-TED: a large-scale dataset for visual speech recognition. arXiv preprint arXiv:1809.00496. https://www.robots.ox.ac.uk/~vgg/data/lip_reading/lrs3.html
  3. TCD-TIMIT:Harte, N., & Gillen, E. (2015). TCD-TIMIT: An audio-visual corpus of continuous speech. IEEE Transactions on Multimedia, 17(5), 603-615. https://sigmedia.tcd.ie/TCDTIMIT/
  4. WildVSR:Djilali, Y. A. D., Narayan, S., LeBihan, E., Boussaid, H., Almazrouei, E., & Debbah, M. (2024). Do VSR Models Generalize Beyond LRS3? Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 6635-6644. https://github.com/YasserdahouML/VSR_test_set
  5. VoxCeleb2:Chung, J. S., Nagrani, A., & Zisserman, A. (2018). VoxCeleb2: Deep Speaker Recognition. Interspeech 2018. https://www.robots.ox.ac.uk/~vgg/data/voxceleb/vox2.html
  6. AVCocktail & AVYT:Nguyen, T.-B., Pham, N.-Q., Waibel, A. (2025). Cocktail-Party Audio-Visual Speech Recognition. Proc. Interspeech 2025, 1828-1832. https://arxiv.org/abs/2506.02178
  7. MuAViC:Anwar, A., Shi, B., Goswami, V., Hsu, W. N., Pino, J., & Wang, C. (2023). MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation. arXiv preprint arXiv:2303.00628. https://github.com/facebookresearch/muavic
  8. GRID:Cooke, M., Barker, J., Cunningham, S., & Shao, X. (2006). An audio-visual corpus for speech perception and automatic speech recognition. The Journal of the Acoustical Society of America, 120(5), 2421-2424. https://zenodo.org/records/3625687
  9. Lombard GRID:Alghamdi, N., Maddock, S., Marxer, R., Barker, J., & Brown, G. J. (2018). A corpus of audio-visual Lombard speech with frontal and profile views. The Journal of the Acoustical Society of America, 143(6), EL523-EL529. https://zenodo.org/records/3228148
  10. RoomReader:Reverdy, J., OConnor Russell, S., Duquenne, L., Garaialde, D., Cowan, B. R., & Harte, N. (2022). RoomReader: A Multimodal Corpus of Online Multiparty Conversational Interactions. Proceedings of the Thirteenth Language Resources and Evaluation Conference, 2517-2527. https://aclanthology.org/2022.lrec-1.268/
  11. MultiVSR:Prajwal, K. R., Hegde, S., & Zisserman, A. (2025). Scaling Multilingual Visual Speech Recognition. ICASSP 2025 - IEEE International Conference on Acoustics, Speech and Signal Processing, 1-5. https://github.com/Sindhu-Hegde/multivsr
  12. Candor:Reece, A., Cooney, G., Bull, P., & Chung, C. (2023). The CANDOR corpus: Insights from a large multimodal dataset of naturalistic conversation. Science Advances, 9, eadf3197. https://www.science.org/doi/10.1126/sciadv.adf3197 | https://candor.usc.edu/

代码库参考文献

AV-HuBERT

Shi, B., Hsu, W.-N., Lakhotia, K., & Mohamed, A. (2022). Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction (AV-HuBERT). 论文:https://arxiv.org/abs/2201.02184 GitHub:https://github.com/facebookresearch/av_hubert

Auto-AVSR

Ma, P., Haliassos, A., Fernandez-Lopez, A., Chen, H., Petridis, S., & Pantic, M. (2023). Auto-AVSR: Audio-Visual Speech Recognition with Automatic Labels. 论文:https://arxiv.org/abs/2303.14307 GitHub:https://github.com/mpc001/auto_avsr

搜集汇总
数据集介绍
RoomReader-AV 数据集图片
构建方式
在视听语音识别研究长期受限于广播语料库的背景下,RoomReader-AV的构建源于对真实场景泛化能力的深刻追问。该数据集以RoomReader多模态语料库为基础,经由一套统一的数据预处理流水线转化而来,采用RetinaFace与68点面部关键点检测提取嘴部感兴趣区域,生成96×96像素的唇部裁剪图像;音频统一下采样至16 kHz单声道,转录文本去除标点并转换为小写。针对自发对话特性,预处理特意保留反馈词与填充停顿,以维系会话的自然流畅感。最终生成与AV-HuBERT和Auto-AVSR框架直接兼容的数据清单,形成名为RoomReader-AV的标准化基准。
特点
RoomReader-AV的鲜明特征在于其真实自发多方言视频会议场景,涵盖30场Zoom辅导会话与118名参与者,语音完全即兴且具有高度会话性。数据集提供会话级音频与个体独立音频双流,并支持仅以个体流评估含噪单说话人Zoom语音。其发言轮次常极为简短,为此按2秒阈值划分出RR-AV Easy与RR-AV Hard两个子集,后者平均仅2.3词,对识别构成严峻挑战。作为自发多人对话的域外基准,该数据集有效暴露出当前视听语音识别系统在受控广播语料之外泛化能力的显著鸿沟。
使用方法
RoomReader-AV采用严谨的多条件评估范式,研究者可依托公开的预处理流水线,将GRID、LombardGrid、TCD-TIMIT等异构数据集统一转换为兼容AV-HuBERT与Auto-AVSR的格式,实现跨数据集的公平比较。评估时分别在视觉单模态、音频单模态与视听双模态三种设置下计算词错误率,解码参数严格遵循各模型官方实现并保持恒定。借助预设的测试分区以及公开的检查点与代码资源,研究者能够便捷地将该基准用于新型语音识别系统的系统评测,推动对域外泛化瓶颈的深入探索。
背景与挑战
背景概述
音频-视觉语音识别(AVSR)在LRS2与LRS3等广播语料基准上已取得低于2%的词错误率,学界一度认为该任务渐趋饱和。然而,这种近乎完美的表现是否源于模型对受控广播域的真实泛化能力,抑或仅是领域适配的假象,尚未得到系统检验。都柏林圣三一学院Sigmedia团队于2026年提出RoomReader-AV,作为面向自发多人视频会议对话的AVSR基准。该数据集依托RoomReader语料构建,涵盖30场Zoom辅导会话、118名参与者、6.49小时带词级边界标注的语音数据,并配套发布统一预处理管线,将GRID、LombardGrid、TCD-TIMIT等异构语料转化为与主流框架兼容的格式,为多条件AVSR评估提供了标准化基础设施。
当前挑战
RoomReader-AV所应对的核心难题在于自发对话语音的视觉识别失稳与领域泛化瓶颈。其领域挑战体现为:视觉单模态在广播域外性能急剧坍缩,词错误率可逾300%;极端侧脸视角下视觉特征失效,多模态系统实则依赖声学回退;说话人发音清晰度对视觉识别的影响远超轻微镜头偏移;基于大语言模型的解码器在域外短话语上易产生幻觉与重复,且推理显存开销高达17.91 GB。构建层面的挑战则包括:Zoom场景中参与者视线偏离摄像头导致嘴部感兴趣区域质量下降;短回合话语(低于2秒)占据相当比例,可提供的时序上下文极为有限;不同来源语料的格式差异迫使研究者投入大量非标准化的清洗与解码工程,方可实现跨数据集的公平比较。
常用场景
经典使用场景
在音视频语音识别领域,RoomReader-AV作为一项新颖的基准,其经典使用场景聚焦于自发多人视频会议对话的评测。该数据集通过采集Zoom教程会话中118名参与者的自发交谈,并以人工校正的词级边界转录,模拟了真实会议中语速多变、存在填充词与背景重叠的复杂声学环境。研究中常将其与GRID、LombardGrid、TCD-TIMIT等数据集联合使用,在视觉仅、音频仅与音视频融合三种模态下,系统评估Auto-AVSR、AV-HuBERT及Llama-AVSR等主流架构的跨域泛化能力,尤其针对非正面视角、非专业发音及短时话语等挑战性条件展开深入分析。
解决学术问题
该数据集直面音视频语音识别研究中长期存在的泛化性评估难题。既往研究多依赖LRS2与LRS3等广播语料,其受控场景下的极低词错误率掩盖了模型在真实环境中的脆弱性。RoomReader-AV的引入,使学界得以系统探究视觉编码器在自发对话、非专业发音及极端头部姿态下的性能衰减规律,并揭示了音视频融合机制在域外场景中可能产生的负面效应。其意义在于推动领域从狭窄的基准饱和迈向对真实鲁棒性的严谨审视,为构建适应复杂现实条件的识别系统提供了关键的评测基石与实证依据。
衍生相关工作
RoomReader-AV的发布催生了一系列围绕跨域泛化与多条件评测的后续研究。基于该基准,研究者进一步探讨了视觉编码器对广播语音的过拟合现象,以及音视频融合在非受控环境中的失效机制。与之相呼应,LRS-VoxMM、ViCocktail及多说话人鸡尾酒会基准等衍生工作,共同拓展了真实噪声、混响与重叠语音条件下的评测维度。此外,该数据集推动了对大语言模型解码器在域外场景中幻觉问题的系统分析,并激励学界重新审视发音清晰度与相机视角对识别性能的相对影响,为下一代鲁棒音视频语音识别架构的设计提供了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务