遇见数据集

clean-speech-raw-sources

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是“Clean Speech”原始存档的镜像集合,旨在为原本托管在Hugging Face之外、具备干净且采样率≥44.1 kHz的语音数据集提供持久稳定的公共镜像。所有原始文件未经修改,并保留原始许可和署名。数据集包含以下三个子集:RAVDESS(来自Ryerson Audio-Visual Database of Emotional Speech and Song,仅包含语音部分,共1440个文件,24位演员,48 kHz/16-bit,许可为CC BY-NC-SA 4.0);DAPS(设备音频语音数据集,包含20位说话者,15个版本,采样率44.1 kHz,许可为CC BY-NC-SA 4.0);BibleTTS(OpenSLR 129,多语言非洲语音数据集,包含6种语言,单说话人录音室质量48 kHz,最大80小时,许可为CC BY-SA 4.0)。该镜像用于研究可复现性,训练版本位于另一个仓库“Scicom-intl/TTS-Clean44k”。

This dataset is a mirror collection of the Clean Speech original archive, intended to provide persistent and stable public mirrors of speech datasets that were originally hosted outside Hugging Face and have clean audio with sampling rate ≥44.1 kHz. All original files are unmodified, retaining original licenses and attribution. The dataset contains three subsets: RAVDESS (from Ryerson Audio-Visual Database of Emotional Speech and Song, only speech part, 1440 files, 24 actors, 48 kHz/16-bit, license CC BY-NC-SA 4.0); DAPS (Device Audio Speech Dataset, 20 speakers, 15 versions, 44.1 kHz, license CC BY-NC-SA 4.0); BibleTTS (OpenSLR 129, multilingual African speech dataset, 6 languages, single speaker studio quality 48 kHz, up to 80 hours, license CC BY-SA 4.0). This mirror is used for research reproducibility, and the training version (filtered by DNSMOS and normalized to 48 kHz) is located in another repository Scicom-intl/TTS-Clean44k.

创建时间:
2026-07-23
原始信息汇总

数据集概述:Clean Speech Raw Sources (non-HF mirror)

该数据集是高质量语音原始档案的持久镜像,旨在提供不低于44.1kHz采样率的干净语音数据集的备份,并确保外部原始链接失效时仍可访问。所有档案均未修改,保留原始许可证和归属信息,仅用作镜像,原始来源链接为权威版本。

许可证:CC BY-NC-SA 4.0(非商业、相同方式共享)

主要用途:该数据集中的原始音频可作为训练数据来源,经过DNSMOS过滤和48kHz归一化处理的训练版本位于Scicom-intl/TTS-Clean44k


数据集内容

1. RAVDESS(情感语音)

  • 文件RAVDESS_Audio_Speech_Actors_01-24.zip
  • 原始来源:https://zenodo.org/records/1188976
  • 音频规格:48 kHz,16位,1440个文件,24位演员(情感语音)
  • 许可证:CC BY-NC-SA 4.0
  • 引用:Livingstone SR, Russo FA (2018),PLoS ONE 13(5): e0196391

2. DAPS(设备与录音室语音)

  • 文件DAPS_daps.tar.gz
  • 原始来源:https://zenodo.org/records/4660670
  • 音频规格:44.1 kHz;20位说话人;15个版本(3个录音室版本:clean/cleanraw/produced,12个设备/房间版本)。训练时仅使用3个录音室版本。
  • 许可证:CC BY-NC-SA 4.0
  • 引用:Mysore GJ (2015),IEEE Signal Processing Letters 22(8)

3. BibleTTS(多语言非洲语音)

  • 文件bibletts_openslr129/*.tgz
  • 原始来源:https://www.openslr.org/129/ (镜像:https://openslr.trmal.net/resources/129/)
  • 音频规格:48 kHz单声道,录音室质量;每个语言最多80小时单说话人。
  • 语言:Akuapem Twi、Asante Twi、Ewe、Hausa、Lingala、Yoruba(撒哈拉以南非洲语言)
  • 许可证:CC BY-SA 4.0(允许自由再分发)
  • 引用:Meyer et al. (2022),Interspeech 2022

备注

  • 所有档案均保持原始未修改状态,许可证和署名归原作者所有。
  • 该数据集仅用于研究可复现性,并作为非Hugging Face原始来源的持久镜像。
搜集汇总
数据集介绍
clean-speech-raw-sources 数据集图片
构建方式
该数据集是作为外部语音语料库的持久镜像而构建的,旨在解决学术托管链接失效或下载缓慢的问题。它汇集了42个语料库、总计297GB的音频数据,涵盖多种语言和采样率。每个归档文件均从原始来源逐字节复制,未做任何修改,并保留原始许可证和归属。构建过程通过专门的工具链(如prepare_raw_sources.py)实现,支持注册、探测、镜像和外部处理等操作,确保数据完整性和可追溯性。
特点
该数据集的显著特点在于其多样性和完整性。它包含高采样率(≥44.1kHz)的TTS语料库和16kHz的ASR语料库,如Samromur和多种OpenSLR数据集。其中许多语料库带有真实的说话人标签,无需额外聚类。此外,数据集注明了每个语料库的验证状态(已验证、未验证、仅镜像),并提供了详细的布局说明和特殊注意事项,例如排除合成的音频文件或需要预分割的长录音,以便用户准确使用。
使用方法
使用时,用户可通过提供的工具链脚本(prepare_raw_sources.py)进行数据操作,例如使用mirror命令从原始源下载,或使用external命令从镜像拉取数据。借助Hugging Face的range读取支持,用户无需下载整个文件即可远程检查归档布局,例如读取zip中央目录或解压单个metadata.tsv。对于TTS任务,推荐使用原始文本字段而非规范化版本,以保留韵律信息。用户还需根据语料库的特定说明,处理如多卷压缩包或需要额外分割的数据。
背景与挑战
背景概述
Clean Speech Raw Sources(非HF镜像)数据集由马来西亚AI社区于2024年创建,旨在解决语音语料库因原始托管站点不稳定而导致的访问困难问题。该数据集镜像了42个语料库,总计297GB,涵盖多种语言和采样率,包括高采样率(≥44.1kHz)的TTS数据和16kHz的ASR数据。其核心目标是确保这些珍贵的语音资源对研究社区的可及性和持久性,通过提供快速、可续传的镜像来规避原始链接失效、下载缓慢等技术障碍。该数据集在语音技术领域具有相当影响力,为多语种TTS和ASR研究提供了可靠的资源基础,推动了低资源语言的技术进步,并促进了研究可复现性。
当前挑战
该数据集面临的挑战涵盖领域问题和构建过程两个方面。领域问题方面,语音语料库的分布在学术机构中分散且不稳定,原始链接常因维护或关闭而失效,导致研究者难以获取完整数据,尤其对低资源语言的研究构成严重阻碍。构建过程中,挑战包括处理多卷压缩包(如zip和字节分割)的不兼容性,需依赖7z工具;部分语料库缺乏索引文件或元数据,导致数据布局不明,需逐一验证;此外,镜像过程中需确保数据的字节级完整性,同时遵守不同语料库的版权许可,尤其是非商业用途的限制,增加了管理复杂度。这些挑战要求构建者具备技术上的灵活性和对学术规范的严格遵守。
常用场景
经典使用场景
该数据集作为多语种语音资源的聚合镜像,其经典使用场景集中于语音技术研究的基础数据支撑。它汇集了42个不同来源的语料库,涵盖超过20种语言,包括高采样率的TTS语料(如48kHz的BibleTTS)和16kHz的ASR语料(如冰岛语Samromur系列)。研究者可借此构建多语种语音识别或合成系统,尤其是在低资源语言(如巽他语、爪哇语、僧伽罗语)的模型训练中,该数据集提供了宝贵的原始语音和文本对齐数据。其模块化组织方式和标准化的元数据格式,使得数据清洗、分割和特征提取等预处理流程更加便捷,是语音技术研究不可或缺的初始资源。
实际应用
在实际应用中,该数据集是开发多语种语音产品的基石。企业可基于其中的高保真TTS语料训练自然度高的合成声音,服务于智能助手、有声读物、导航系统等场景;ASR语料则可用于构建跨语种的语音输入法、会议转写系统及客服质检工具。数据集中包含的特殊语料,如冰岛语议会录音(需切分)和TTS合成语音(需排除),提示实际应用时需针对性地进行数据清洗,以适应真实环境下的噪声和口音变化。其CC BY-NC-SA等许可证的差异化,也要求商业应用需仔细核查各子语料的授权范围,确保合规使用。
衍生相关工作
该数据集推动了多个方向的衍生研究工作。其基础数据催生了高采样率TTS模型(如TTS-Clean44k)的构建,促进了音质与自然度的提升。针对低资源语言,研究者基于其中数据开发了跨语种迁移学习与多任务学习框架,有效缓解了数据稀疏问题。此外,数据集的镜像模式也启发了科研数据持久化存储的最佳实践,相关工具链(如prepare_raw_sources.py)为数据管理自动化提供了参考。情绪语音语料(RAVDESS)则支撑了情感语音合成与识别模型的迭代,而BibleTTS的单一说话人长时录音,也为声音克隆和个性化语音合成技术提供了实验温床,其影响延伸至语音医疗、教育等多个应用领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务