遇见数据集

Candor-LR

收藏
arXiv2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

Candor-LR是一个面向自然对话场景的双人音频-视觉语音识别基准数据集,由都柏林圣三一大学Sigmedia研究组基于CANDOR语料库构建。该数据集汇集1,656场自发式视频会议对话,总计787,670条话语(约783.7小时),其中训练集占713.5小时,验证集10.1小时,测试集60.1小时,涵盖1,554位多样化说话人。创建过程采用定制化流水线:通过Speechmatics获得词级精细时间戳,实施说话人-视频映射与短语级分割(2-5秒),结合RetinaFace进行面部检测及嘴部ROI提取,并经过文本归一化与多重质量过滤,最终以说话人无重叠方式划分数据。该数据集旨在挑战现有AVSR模型在真实对话中的泛化能力,特别针对重叠语音、自发话轮转换与非脚本词汇等复杂条件,推动音频-视觉语音识别从广播化评估迈向更贴近实际应用的对话范式。

Candor-LR is a two-party audio-visual speech recognition (AVSR) benchmark dataset designed for natural conversational scenarios, developed by the Sigmedia Research Group at Trinity College Dublin based on the CANDOR corpus. This dataset contains 1,656 spontaneous video conference conversations, totaling 787,670 utterances (approximately 783.7 hours). The data is split into training, validation, and test sets with durations of 713.5 hours, 10.1 hours, and 60.1 hours respectively, covering 1,554 diverse speakers. The construction of this dataset follows a customized pipeline: word-level fine-grained timestamps are obtained through Speechmatics; speaker-video mapping and phrase-level segmentation (2–5 seconds per segment) are implemented; facial detection and mouth region of interest (ROI) extraction are performed using RetinaFace; followed by text normalization and multi-stage quality filtering. Finally, the dataset is split in a non-overlapping speaker-wise manner. This dataset aims to challenge the generalization capabilities of existing AVSR models in real-world conversational scenarios, particularly under complex conditions such as overlapping speech, spontaneous turn-taking, and unscripted vocabulary. It seeks to advance audio-visual speech recognition from broadcast-style evaluation toward more practical conversational paradigms that align with real-world applications.

创建时间:
2026-09-10
搜集汇总
数据集介绍
Candor-LR 数据集图片
构建方式
当前音视频语音识别基准多囿于朗读式、脚本化的洁净语音,难以反映自然对话中交叠话轮、即兴用语与多变声学环境的真实复杂性。Candor-LR的构建即针对这一缺口,以CANDOR语料库中1656段自然双人视频会议为源数据,借助Speechmatics系统生成的词级时间对齐转写,通过自研管线完成从原始录制到AVSR就绪格式的转化。该管线以词级毫秒时间戳驱动分段,将长时对话切分为2至5秒的单说话人短语片段,并依次实施说话人—视频通道映射、RetinaFace人脸检测与嘴部感兴趣区域提取、逐说话人音轨的同步抽取以及文本归一化与质量过滤,最终按说话人感知策略划分出713.5小时训练集、10.1小时验证集与60.1小时测试集。
使用方法
Candor-LR以标准AVSR框架可直接消费的格式组织,每条样本包含经归一化的转写文本、16kHz单声道音频与96×96像素、25帧率的嘴部区域视频,并随附规范的训练、验证与测试划分ID文件,确保结果可复现。研究者可将其作为零样本跨域评测基准,在不经微调的条件下检验预训练模型对自然对话的泛化能力;亦可将其纳入多数据集联合训练,以提升模型在洁净与噪声条件下的跨域鲁棒性。噪声鲁棒性实验可通过在训练或推理阶段按不同信噪比混入 babble 噪声来开展,从而系统考察视听模态在声学退化中的补偿效应与模型对真实对话的适应边界。
背景与挑战
背景概述
音频-视觉语音识别领域的基准长期由LRS2、LRS3等脚本化语料所主导,此类数据以专业播音员在受控声学环境下录制的朗读式语音为特征,缺失交叠话语、自发话轮转换与真实声场变化,致使模型的高基准表现难以迁移至日常对话场景。为弥合这一鸿沟,都柏林圣三一学院Sigmedia团队于2026年提出Candor-LR,该数据集脱胎于包含1,656组自然双人视频会议会话的CANDOR语料库,经定制化处理流程生成了713.5小时训练集、10.1小时验证集与60.1小时测试集,并开源全部流程以保障可复现性。该工作将音频-视觉语音识别的研究重心由朗读式语音转向自然对话范式,为评估模型在真实交互条件下的鲁棒性树立了严苛而极具影响力的基准。
当前挑战
Candor-LR所应对的核心难题在于自然对话语音固有的复杂属性,包括交叠话语、无脚本词汇、频繁头部运动及平台诱发的声学畸变,这些因素共同导致预训练音频-视觉语音识别模型在音频单模态下错误率急剧攀升,视觉线索虽可部分弥补但增益幅度受限。构建过程同样面临多重技术障碍:原始CANDOR语料缺乏词级时间戳,需借助Speechmatics自动语音识别系统生成毫秒级对齐;说话人视频以用户标识命名而转录文本以音频通道编号索引,须通过通道映射元数据完成跨模态匹配;面向广播单说话人场景的现成预处理工具无法直接适配对话数据,迫使研究者自行设计涵盖短语切分、人脸检测、嘴部感兴趣区域提取、音频同步及质量过滤的完整流程;此外,说话人感知的数据划分策略要求严格隔离测试集说话人,以避免身份泄露对评估有效性的干扰。
常用场景
经典使用场景
在音频-视觉语音识别领域,Candor-LR的经典用法是作为对话式AVSR的基准测试平台。研究者利用其713.5小时训练集微调或从头训练AVSR模型,以评估模型在真实双人视频会议场景下的识别性能。其60.1小时测试集包含大量话轮转换、自发打断和重叠语音,能够精确测量模型对非脚本化连续对话的适应能力。同时,该数据集也被用于跨域泛化实验,检验在LRS2/LRS3等脚本化数据上预训练的模型迁移至自然对话时的鲁棒性,并借助视觉模态补偿语音清晰度下降带来的性能损失。
解决学术问题
Candor-LR有效解决了当前AVSR研究中基准数据集过于理想化、难以反映自然对话复杂性的学术难题。传统基准如LRS3以专业朗读、无重叠、声学条件稳定为特征,导致模型在真实对话中性能骤降。该数据集通过引入自发话轮、非脚本词汇和真实房间声学,弥合了受控实验与真实场景之间的鸿沟。其意义在于揭示视觉信息在对话式识别中的关键补偿作用,并证实在此数据上训练可显著提升模型在干净与噪声条件下的跨域鲁棒性,推动AVSR从广播范式向对话理解范式转型。
实际应用
在实际应用层面,Candor-LR直接服务于视频会议、远程协作和智能会议转录等场景。其双人会话数据模拟了Zoom、Teams等平台中常见的音频串扰、网络压缩失真和用户自发交互行为,为开发高鲁棒性的实时字幕和会议纪要系统提供了训练与评测资源。此外,该数据集可用于构建说话人感知的语音增强与识别联合框架,帮助听力辅助设备和实时翻译工具在嘈杂家居或办公环境中更准确地捕获目标语音,提升人机交互的自然度和可访问性。
数据集最近研究
最新研究方向
在音视频语音识别领域,长期以LRS3等脚本化基准为主导的评价范式正面临深刻反思,真实对话场景中重叠语音、自发轮替与多变声学条件所构成的复杂性,促使研究者将目光投向更具生态效度的对话式基准构建。Candor-LR以CANDOR语料库中1,656段自然二元视频会议为根基,经由定制化处理流程生成713.5小时训练集与60.1小时测试集,系统揭示了预训练模型在会话语音上的显著性能衰减,并证实视觉线索在声学退化条件下对识别鲁棒性的补偿效应随噪声加剧而愈发关键。该基准的开源发布不仅为跨域泛化与噪声鲁棒性研究提供了严苛而可复现的评估平台,更推动音视频语音识别从广播式朗读范式向真实对话理解范式转型,其人口统计学上的年龄与性别均衡特性亦为公平性研究开辟了新的空间。
相关研究论文
  • 1
    Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition都柏林圣三一大学·工程学院·Sigmedia研究组 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务