遇见数据集

ai-coustics/dawn_chorus_en

收藏
Hugging Face2026-06-18 更新2026-04-05 收录
官方服务:

资源简介:

dawn_chorus_en 是一个开源评估数据集,用于准确的前景说话人转录。该数据集针对混合条件设计,其中前景语音通常可被语音转文本系统转录,而背景语音则明显被视为背景。它提供约90分钟的前景-背景语音混合,由录制和合成的语音组成,并包含真实的前景语音和相应的转录文本。数据集包含450对等长的mix和speech音频对,总时长为01:31:19,采样率为16kHz,单声道,16位。前景语音来源分布为65%的录制语音(19位说话人)和35%的合成语音(7位说话人)。语音性别分布为44%女性声音和56%男性声音。传输通道分布为67% GSM、16.5% WhatsApp和16.5% Telegram。数据集旨在评估在抑制背景语音的同时保留前景说话人的模型性能,适用于背景语音抑制基准测试、语音转文本鲁棒性评估、前景说话人隔离/目标说话人提取系统比较等用途。

An open-source evaluation dataset for accurate foreground speaker transcription. The dataset targets mixture conditions where foreground speech remains generally transcribable by speech-to-text systems, while background speech is distinctly perceived as background. It provides around 90 minutes of foreground–background speech mixtures composed of recorded and synthesized foreground speech, along with ground truth foreground speech and corresponding transcripts. The dataset contains 450 mix and speech pairs of equal length with a sum duration of 01:31:19, with a 16 kHz sampling rate, 16-bit, mono. Foreground speech source distribution: 65% recorded speech (19 speakers), 35% synthesized speech (7 speakers). Voice gender distribution: 44% female-sounding voices, 56% male-sounding voices. Transmission channels distribution: 67% GSM, 16.5% WhatsApp, 16.5% Telegram. It is intended for evaluation of models that suppress background speech while preserving a primary/foreground speaker in conditions relevant to downstream speech-to-text systems.

提供机构:
ai-coustics
搜集汇总
数据集介绍
ai-coustics/dawn_chorus_en 数据集图片
构建方式
dawn_chorus_en 数据集专为评估前景说话人语音转写任务而设计,其构建过程融合了真实录音与合成技术。前景语音分为两类:约65%由专业录音棚内使用Schoeps MK4电容麦克风采集的真人语音,经降噪与口腔杂音清理后保留自然音色;其余35%通过文本转语音模型合成,以增强韵律多样性。背景语音选自非消声环境的公共领域退化语音,涵盖对话、叙述及音乐噪声等类目,模拟真实竞争说话人场景。混合阶段,前景语音经人工嘴在近场播放,分别通过三星S22(免提模式)经GSM网络或WhatsApp通话传输至谷歌Pixel 6A,以及MacBook Pro M4经Telegram通话传输至同一接收设备,同时利用沉浸式扬声器系统同步录制背景语音,最终形成450对16kHz采样、时长约90分钟的混合与纯净前景音频对,并配备由专业语言学家人工标注的高精度转录文本。
特点
此数据集的核心特色在于其高度现实主义的混合条件设计。与单纯依赖合成退化的方案不同,它通过真实通信信道(GSM、WhatsApp、Telegram)引入传输畸变,使得前景语音虽受背景干扰但仍能被语音转写系统大致辨识,从而精准衡量背景抑制与前景失真之间的权衡。数据集记录了每一样本的说话人身份、会话类型(互动式或叙述式)、语音来源(人声或机器合成)及传输通道等元数据,支持多维度的细粒度分析。此外,其多样的说话人性别分布(44%女性感知音色)、语音时长跨度及丰富的背景类别,为评估模型在现实多说话人场景中的鲁棒性提供了坚实基准。
使用方法
该数据集专为面向下游语音转写系统的背景语音抑制模型评估而设计。用户可直接加载HuggingFace上的parquet格式数据,使用`mix`字段作为模型输入,对比模型输出与`speech`字段的纯净前景音频,或计算处理后音频与`transcript`文本之间的词错误率。典型应用包括:评估背景语音抑制强度对转写准确率的影响、验证目标说话人提取系统的分离效果、以及比较不同增强模型在抑制噪声与保留前景语音清晰度之间的性能平衡。数据集内建的`conversation_type`和`speech_source`等属性,使用户能够按场景或语音类型进行分组评测,从而深入理解模型在不同真实通信条件下的表现差异。
背景与挑战
背景概述
在语音处理领域,从嘈杂多说话人环境中准确地分离和转录前景说话人是一项具有挑战性的任务。2026年,由ai-coustics GmbH的Leonardo Nerini、Butch Warns、Joschka Wohlgemuth、Luis Küffner和Théo Fuhrmann等研究人员创建的dawn_chorus_en数据集,专注于前景说话人转录的评估。该数据集包含约90分钟的前景-背景语音混合音频,其中65%为真实录音,35%为合成语音,并通过GSM、WhatsApp和Telegram等真实传输信道采集,确保了场景的现实性。受DAPS数据集启发,dawn_chorus_en强调时间对齐的参考信号和实际录制条件,旨在为下游语音转文本系统提供可靠的评估基准,对语音增强和目标说话人提取研究具有重要影响力。
当前挑战
dawn_chorus_en数据集面临的核心挑战在于多说话人混合场景中前景语音的精确转录。具体挑战包括:1)领域问题方面,语音转文本系统在背景语音干扰下,如何有效区分前景与背景语音,减少干扰同时避免前景语音失真,实现鲁棒的字错误率评估;2)构建过程中,需在人工嘴和沉浸式扬声器设置下同步录制混合音频,确保时间对齐精度;同时,数据集需平衡真实与合成语音的比例、性别分布以及不同传输信道的影响,覆盖对话式和叙述式等多种语音交互类型,以评估模型在现实复杂环境中的泛化能力。
常用场景
经典使用场景
在语音增强与分离研究领域,dawn_chorus_en数据集专为评估主说话人转录准确性而设计,其核心使用场景聚焦于前背景语音混合条件下的目标说话人提取与鲁棒语音识别。研究者可将混合音频与纯净前景语音作为输入-输出对,藉由计算词错误率(WER)等指标,系统性地衡量降噪模型在抑制背景语音与保真前景语音间的权衡表现。该数据集涵盖对话式与叙述式两种交互模式,融合人类录制与文本转语音合成的前景语音,并引入GSM、WhatsApp及Telegram等多种真实通信信道,为评估模型在复杂通信环境下的鲁棒性提供了标准化基准。约90分钟、450对等长音频样本,配合专业语言学家标注的高质量转录文本,使其成为语音分离与增强领域不可或缺的评测工具。
解决学术问题
该数据集系统性地解决了多说话人混合场景中前景说话人语音可懂度与转录准确性的学术评估难题。传统语音增强数据集多聚焦于噪声抑制,但鲜少针对背景语音(而非环境噪声)这一颇具挑战性的干扰源,提供包含高质量前景语音、转录文本及精细元数据(如说话人身份、会话类型、语音来源)的标准评测资源。dawn_chorus_en填补了这一空白,使研究者能够量化评估语音增强模型在保持下游自动语音识别(ASR)系统鲁棒性方面的表现。其重要意义在于推动了从单纯的信噪比(SNR)优化向任务导向的语音质量评估范式转变,为语音预处理模块在真实通信场景中的有效性验证提供了方法论支撑,进而促进了语音交互系统在嘈杂环境中的实用化进程。
衍生相关工作
受DAPS数据集的启发,dawn_chorus_en推动了多项后续研究工作。其一,研究者开发了面向STT系统的背景语音抑制评价协议,将WER与感知语音质量评估(如PESQ、STOI)相结合,形成了更全面的增强模型对比框架。其二,基于该数据集中不同通信信道(GSM、VoIP)的差异化失真特性,衍生出信道自适应语音分离方法,通过显式建模传输路径畸变来提升目标说话人提取的保真度。其三,该数据集的前景语音源(人类/合成)和会话类型(交互/叙述)标注,激发了语音增强模型在异质性说话风格上的泛化性研究,催生了跨域迁移学习方案。此外,其公开的录音设置(人工嘴与多设备采集流程)为构建具有真实声学混响和传输效应的多模态语音数据集提供了可复现的工程范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务