遇见数据集

synthetic_speech_da

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

Synthetic Danish Speech 是一个丹麦语合成语音数据集,专门为文本转语音(TTS)和自动语音识别(ASR)任务的预训练提供基准数据。数据集包含69,868个合成语音片段,总时长为320.6小时。所有音频通过丹麦TTS微调模型克隆经过许可审核的参考声音生成,并经过ASR模型的严格质量验证,确保字符错误率(CER)不超过0.10、通过语音活动检测和时长检查、无循环重复和严重削波失真。数据集按参考声音来源细分:voxpopuli-ul贡献310.1小时,yodas贡献7.2小时,commonvoice贡献1.9小时,fleurs贡献1.4小时,所有参考声音均为丹麦语。数据集包含13个字段,如音频(24kHz单声道FLAC格式)、说话人ID、书面文本(非规范化)、口语文本(规范化)、转录和转录形式、文本特征标签(JSON格式)、声音来源、许可证、语言、时长、CER和WER、TTS模型和生成参数、样本哈希。适用于丹麦语TTS模型训练、ASR模型预训练、多说话人语音合成研究和合成语音质量评估。音频为合成生成,参考声音来自允许语音合成的许可来源,数据集在CC-BY-4.0许可证下发布。转录文本是源语料库的原始文本,非人工转录。

Synthetic Danish Speech is a Danish synthetic speech dataset specifically designed to provide benchmark data for pre-training in text-to-speech (TTS) and automatic speech recognition (ASR) tasks. The dataset contains 69,868 synthetic speech segments with a total duration of 320.6 hours. All audio is generated by cloning licensed reference voices using a Danish TTS fine-tuned model and undergoes rigorous quality validation via an ASR model, ensuring a character error rate (CER) not exceeding 0.10, passing voice activity detection and duration checks, and having no loop repetitions or severe clipping distortion. The dataset is subdivided by reference voice source: voxpopuli-ul contributes 310.1 hours, yodas 7.2 hours, commonvoice 1.9 hours, and fleurs 1.4 hours, all reference voices are in Danish. It includes 13 fields, such as audio (24kHz mono FLAC format), speaker ID, written text (non-normalized), spoken text (normalized), transcript and transcript form, text feature labels (JSON format), voice source, license, language, duration, CER and WER, TTS model and generation parameters, and sample hash. It is suitable for Danish TTS model training, ASR model pre-training, multi-speaker speech synthesis research, and synthetic speech quality evaluation. The audio is synthetically generated, with reference voices sourced from licensed origins permitting speech synthesis, and the dataset is released under the CC-BY-4.0 license. The transcript text is the original text from the source corpus, not manually transcribed.

创建时间:
2026-06-30
原始信息汇总

数据集概述:Synthetic Danish Speech

数据集名称:Synthetic Danish Speech
标识符Biorrith/synthetic_speech_da
许可证:CC-BY-4.0
语言:丹麦语(da)
任务类别:文本转语音(TTS)、自动语音识别(ASR)


数据集规模

  • 音频片段总数:73,627 条
  • 总语音时长:339.5 小时
  • 各参考语音来源时长分布
    • VoxPopuli (ul):328.3 小时
    • YODAS:7.8 小时
    • Common Voice:2.0 小时
    • FLEURS:1.4 小时
  • 参考语音语言:全部为丹麦语(da),共 339.5 小时

数据生成与质量控制

  • 所有语音为合成语音,由丹麦语 TTS 微调模型(coral-chatterbox)生成,克隆了经许可证审核的参考语音。
  • 使用 ASR 模型 syvai/hviske-v5.3 进行质量验证。
  • 通过全部质量门控的片段才被收录:
    • 字符错误率(CER)≤ 0.10(相对口语文本)
    • 通过了 VAD(语音活动检测)与时长校验
    • 无循环重复或严重截断

数据列说明

列名 说明
audio 24 kHz 单声道 FLAC 格式音频
speaker_id 克隆参考语音的身份标识(可用于按说话人划分数据)
written_text 非归一化文本(保留数字/缩写,如 121kg
spoken_text 归一化文本(数字/缩写已拼写),为实际输入 TTS 并被朗读的内容,用于计算 CER/WER
transcript / transcript_form 数据集标注:80% 为书面形式,20% 为口语形式;transcript_form 记录具体形式
features JSON 标签(数字/缩写/专有名词/疑问/感叹)
voice_sourcevoice_licenselang 克隆参考语音的来源、许可证、语言
duration_scerwer 音频时长及验证分数
tts_modelgen_params 合成模型 ID 及生成参数(JSON)
sample_hash 由 (spoken_text, voice, params) 生成的稳定唯一标识

许可证与归属

  • 参考语音仅从获准用于语音合成的来源选取。
  • 需归因的来源(CC-BY):
    • FLEURS (google/fleurs, da_dk) — CC-BY-4.0
    • YODAS (espnet/yodas-granary) — CC-BY-3.0
  • 无需归因的来源(CC0 / 公共领域):
    • VoxPopuli 未标注数据、Common Voice 17、LibriVox
  • 整体数据集以 CC-BY-4.0 许可证发布。
  • 转录文本来源于原始语料文本,非人工对合成音频的转写。
搜集汇总
数据集介绍
synthetic_speech_da 数据集图片
构建方式
该数据集的构建立足于丹麦语语音合成与识别领域的实际需求,通过将丹麦语文本到语音(TTS)微调模型`coral-chatterbox`与经许可的参考语音相结合,生成合成语音片段。随后,利用`syvai/hviske-v5.3`自动语音识别(ASR)模型对所有片段进行质量验证,仅保留通过严格质量门槛的样本,包括字符错误率(CER)不超过0.10、经语音活动检测(VAD)和时长检查、无循环重复及严重削波等问题。最终,从VoxPopuli、YODAS、CommonVoice和FLEURS等多个来源的参考语音中,筛选出73,627个片段,总计339.5小时的语音数据。
使用方法
该数据集适用于丹麦语文本到语音(TTS)与自动语音识别(ASR)模型的预训练与微调。用户可通过Hugging Face Datasets库直接加载,并使用`speaker_id`字段按说话人进行数据集划分,以模拟多说话人场景。训练时,可依据`transcript`与`transcript_form`字段选择合适的标签形式,其中`transcript`包含书面与口语形式的随机混合,而`transcript_form`明确标注了当前记录所采用的形式。此外,利用`features`中的JSON标签可针对特定语言现象(如数字或专有名词)进行专项训练或评估。
背景与挑战
背景概述
在语音合成与识别领域,高质量标注数据的匮乏长期制约着丹麦语等低资源语言的技术突破。由Biorrith团队于近年构建的Synthetic Danish Speech数据集,旨在通过合成语音技术缓解这一困境。该数据集依托丹麦语文本转语音模型coral-chatterbox克隆经许可的参考语音,并经由ASR模型hviske-v5.3严格验证,最终收录73,627条高质量音频片段,总时长339.5小时。其核心研究问题在于探索合成数据在丹麦语语音任务中的可行性,通过多来源参考语音(VoxPopuli、YODAS、Common Voice、FLEURS)和双重文本标注(书面与口语形式),为TTS与ASR领域提供标准化预训练基线。该数据集以CC-BY-4.0协议发布,已成为低资源语言语音研究的重要基础资源。
当前挑战
该数据集面临的核心挑战在于平衡合成数据的质量与规模。首先,丹麦语作为低资源语言,原始语音数据稀缺且标注成本高昂,传统人工采集难以满足大规模预训练需求。其次,合成语音的保真度与自然度仍需突破,尽管CER阈值严控于0.10以下,但克隆语音在韵律、情感表达上仍与真实人声存在差异,可能影响下游模型泛化能力。构建过程中,团队需克服多源参考语音的许可兼容性、语音剪辑质量门控(如去重、静音检测、截幅检测)等技术难题,同时确保口语与书面文本的标注一致性——仅通过随机分配80%书面标签与20%口语标签的方式,可能引入非均衡标注偏差。此外,合成样本的声学特征单一性,对多说话人、多场景鲁棒性训练构成潜在限制。
常用场景
经典使用场景
该数据集在语音合成与语音识别领域扮演着举足轻重的角色,尤其适用于丹麦语的语言技术研究。经典使用场景包括作为预训练语料库,用于训练端到端的文本转语音系统,提升合成语音的自然度与韵律表现。同时,它也可作为自动语音识别模型的训练或微调数据,通过多样化的说话人音色和高质量的音质验证机制,显著提升模型对丹麦语口语的转录准确性。研究者还可利用其提供的书面与口语形式标注,开展语音规范化与文本正则化的探索性实验。
解决学术问题
该数据集精准破解了丹麦语语音资源匮乏的棘手难题。长期以来,丹麦语因可用语音数据稀少而严重制约了语音合成与识别技术的学术进步。此数据集通过合成方式大规模扩充高质量语音样本,有效弥补了真实语料不足的缺陷。其设计巧妙之处在于采用多种声源进行音色克隆,并经过严格质量筛选,确保了数据的可靠性与多样性。这为学术界提供了一个既具备规模优势又不失真实性的研究基石,推动了低资源语言语音技术的理论突破与方法创新。
实际应用
在实际应用中,该数据集能够直接赋能丹麦语智能语音助手的开发,例如为导航系统、智能家居设备或虚拟客服提供清晰自然的语音交互能力。此外,它可被用于构建面向丹麦语学习者的发音纠错工具,通过精准的语音识别反馈助力语言习得。无障碍领域同样受益良多,该数据有助于开发为视障人士服务的丹麦语语音阅读器或听写软件,极大提升信息获取的便捷性。其高质量的合成语音还能丰富有声读物与数字多媒体内容的生产流程。
数据集最近研究
最新研究方向
在当前低资源语言语音技术蓬勃发展的浪潮中,丹麦语因数据稀缺而长期处于研究边缘。Synthetic Danish Speech数据集应运而生,它利用先进TTS模型克隆经授权的参考语音,再通过ASR模型进行严格质量筛选(CER≤0.10),汇聚了73,627条、总计339.5小时的合成语音。该数据集创新性地融合了多源参考声音(如VoxPopuli、Common Voice等),并设计了区分书面与口语形式的双标签机制,为丹麦语文本转语音与自动语音识别研究提供了可靠的大规模预训练基础。其采用CC-BY-4.0许可发布,兼顾了合规性与开放性,有望推动北欧语言语音助手、教育工具及无障碍技术的落地,并在低资源语言数据增强、合成数据质量管控等前沿方向上树立了标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务