遇见数据集

librivox-mirror

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

LibriVox Mirror 是一个快速、结构化且持续更新的 LibriVox 音频镜像数据集。它汇总了 LibriVox 项目中公开领域的朗读音频,并提供标准化的元数据索引。截至最新快照,数据集包含 6,247 本已出版书籍、133,969 个章节,总计约 39,324.5 小时的音频,覆盖 68 种语言,其中英语占绝大部分(38,900.7 小时),其他语言包括德语、法语、西班牙语、葡萄牙语、荷兰语、丹麦语、意大利语、波兰语、拉丁语、日语、阿拉伯语等。数据集提供三种配置:默认的 preview 配置包含受限的、可在浏览器中播放的原始 MP3 文件;sections 和 books 配置则提供完整的 Parquet 格式索引,音频数据通过 WebDataset 分片流式传输。每个样本链接到原始 LibriVox 项目和互联网档案馆的源文件,并保留上游校验和及镜像 SHA-256,音频未经转码。该数据集适用于自动语音识别(ASR)和文本转语音(TTS)任务,用户可利用 language 和 hash_partition 字段构建稳定的下游子集或评估分割。镜像的编译、整理、标准化元数据、索引和文档采用 CC BY 4.0 许可,原始 LibriVox 音频在美国属于公共领域。

LibriVox Mirror is a fast, structured, and continuously updated mirror dataset of LibriVox audio. It aggregates public domain audiobook recordings from the LibriVox project and provides standardized metadata indexing. As of the latest snapshot, the dataset contains 6,247 published books, 133,969 chapters, totaling approximately 39,324.5 hours of audio, covering 68 languages, with English dominating (38,900.7 hours) and other languages including German, French, Spanish, Portuguese, Dutch, Danish, Italian, Polish, Latin, Japanese, Arabic, etc. The dataset offers three configurations: the default preview configuration includes restricted, browser-playable original MP3 files; the sections and books configurations provide full Parquet-format indices with audio data streamed via WebDataset shards. Each sample links to the original LibriVox project and Internet Archive source files, preserving upstream checksums and mirror SHA-256, with audio untranscoded. The dataset is suitable for automatic speech recognition (ASR) and text-to-speech (TTS) tasks; users can leverage the language and hash_partition fields to build stable downstream subsets or evaluation splits. The compilation, organization, standardized metadata, indexing, and documentation of the mirror are licensed under CC BY 4.0, while the original LibriVox audio is in the public domain in the United States.

创建时间:
2026-08-27
原始信息汇总

数据集概述:LibriVox Mirror

LibriVox Mirror 是一个快速、结构化且持续更新的 LibriVox 音频镜像数据集,主要面向自动语音识别(ASR)和文本转语音(TTS)任务。数据集采用多语言音频内容,并遵循 CC BY 4.0 许可证,原始 LibriVox 音频在美国属于公共领域。


1. 数据集规模与快照

指标 数值
已发布书籍 6,744 本
已发布章节 144,558 个
音频总时长 42,276.3 小时
音频语言数量 68 种
隔离书籍(问题书籍) 34 本
最后更新时间 (UTC) 2026-08-29T17:46:54.698025Z

2. 音频语言分布(部分)

语言 时长(小时)
英语 41,829.0
德语 235.6
法语 46.0
西班牙语 33.0
葡萄牙语 23.3
荷兰语 21.7
丹麦语 11.2
意大利语 10.5
日语 10.4
波兰语 9.3
拉丁语 5.1
阿拉伯语 3.7
世界语 3.6
希腊语 2.4
中文 1.9
乌克兰语 1.9
俄语 1.4
韩语 0.2
其他语言(如泰米尔语、希伯来语、芬兰语等) 各小于 1 小时

3. 数据集结构与配置

  • 默认配置(preview):包含一组有限的、可直接在浏览器播放的原始 MP3 文件。
  • 完整配置(sections 和 books):提供类型化的 Parquet 元数据文件,包括章节级和书籍级的索引。
  • 权威音频文件通过 WebDataset 分片(位于 data/ 目录下)进行流式访问。
  • 用户可通过 languagehash_partition 字段构建稳定的下游子集或评估划分。
  • 元数据中保留了 LibriVox 和 Internet Archive 的原始字段,以确保来源可追溯。

4. 数据集配置详情

配置名称 说明 数据文件路径
preview 默认配置,包含可播放的示例音频 metadata/preview/*.parquet
sections 章节级元数据 metadata/sections/*.parquet
books 书籍级元数据 metadata/books/*.parquet

5. 许可与引用

  • 镜像特定内容(如编译、策划、标准化元数据、索引和文档)采用 CC BY 4.0 许可证。
  • 原始 LibriVox 音频在美国属于公共领域,未被本镜像重新授权,其他司法管辖区的规则可能有所不同。
  • 推荐引用方式:

bibtex @misc{ding2026librivoxmirror, author = {James Ding}, title = {LibriVox Mirror}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/twangodev/librivox-mirror}}, note = {Continuously updated dataset} }


6. 数据溯源与完整性

  • 每个样本均链接到对应的 LibriVox 项目和 Internet Archive 源文件。
  • 保留上游校验和及镜像端的 SHA-256 哈希值。
  • 音频文件未经转码,确保原始质量。
搜集汇总
数据集介绍
librivox-mirror 数据集图片
构建方式
LibriVox Mirror 数据集作为 LibriVox 公共领域有声读物的结构化镜像,其构建依托于对 LibriVox 项目与互联网档案馆(Internet Archive)中音频资源的系统性整合。该镜像不仅保留了原始音频文件,更通过精细化的元数据提取与规范化处理,构建了分层级的索引体系。数据集的预览配置提供了一组有限的、可直接在浏览器播放的 MP3 文件;完整的 sections 和 books 索引则以高效的 Parquet 格式存储,而规范的音频数据则通过 WebDataset 分片进行流式访问。为确保数据流的持久性与可扩展性,数据集采用 language 与 hash_partition 字段作为构建稳定后续子集或评估划分的逻辑键,以支持大规模语音处理任务的灵活数据切分。
特点
该数据集最显著的特点在于其卓越的规模与多语言覆盖能力,涵盖了7,651本已发布的书籍,总计164,396个章节,音频时长近4.8万小时,支持多达69种语言,从英语到稀有语种如沃拉普克语、古诺尔斯语等,展现出极宽的语种光谱。数据集始终与LibriVox社区保持同步更新,确保内容时效性,其来源信息可追溯至精确的LibriVox项目及Internet Archive源文件,并附有上游校验和与镜像专有的SHA-256,保证了数据的完整性与可验证性。此外,镜像在元数据层面对原始字段进行了保留,兼顾了来源注释的完整性,为语音识别、语音合成等任务提供了真实且丰富的语料基础。
使用方法
使用者可通过Hugging Face datasets库加载该数据集,默认的preview配置适用于快速原型验证,而完整的sections与books索引则适合大规模训练或深度分析。在数据处理流程中,建议利用language与hash_partition字段进行数据划分,以构建跨语言或单语言的训练集、验证集与测试集。对于音频的获取,推荐采用WebDataset流式加载方式,以应对海量音频的高效读写。数据集提供的Parquet元数据文件可直接桥接到Pandas或Spark等工具链,便于用户进行数据探索与特征工程。当在研究中引用该数据集时,应遵循CC BY 4.0许可,并遵循引用规范,以支持数据集的持续维护与发展。
背景与挑战
背景概述
LibriVox Mirror数据集由James Ding于2026年创建,并在Hugging Face平台上发布,旨在为语音识别(ASR)和文本转语音(TTS)领域提供一个大规模、结构化且持续更新的公共领域有声书音频镜像。该数据集源自LibriVox项目,整合了超过7,600本已出版图书、16万多个章节及近4.8万小时的音频内容,覆盖69种语言,其中英语占主导地位。其核心研究问题在于如何高效整合分散的LibriVox音频资源,构建一个易于访问和使用的多语言语音语料库,以支持多语言语音模型的训练与评估。该数据集的发布对语音社区具有重要影响,为研究人员提供了高质量、可复现的数据基础,促进了多语言ASR和TTS技术的发展。
当前挑战
该数据集面临的挑战主要体现在两个方面。首先,在领域问题层面,语音识别与合成技术长期受限于高质量标注数据的稀缺和语言覆盖不均,尤其是低资源语言如爪哇语、古英语等的数据极少,这限制了多语言模型的泛化能力。LibriVox Mirror虽覆盖69种语言,但多数语言的音频时长不足,加剧了数据不平衡问题。其次,在构建过程中,数据整合面临严峻挑战:确保音频完整性与来源可追溯性需保留上游校验和及镜像SHA-256值,同时避免转码以维持原始质量;此外,管理持续更新的数据流、处理隔离书籍(如47本)以及维护大规模结构化索引(如Parquet格式)均需精细的工程能力,以保障数据集的稳定性与可用性。
常用场景
经典使用场景
LibriVox Mirror作为一个规模宏大、持续更新的多语种公共领域有声书镜像数据集,其最经典的使用场景当属语音识别(ASR)与语音合成(TTS)模型的训练与评测。该数据集汇聚了超过4.7万小时的音频,覆盖69种语言,为构建高鲁棒性的多语种语音系统提供了海量且多样化的真实语音数据。研究者可依据语言、哈希分区等元数据构建稳定的训练子集和评估划分,从而在跨语种、低资源语言等挑战性任务上开展系统性实验,推动语音技术向更广泛的语种覆盖和更自然的人机交互迈进。
衍生相关工作
基于LibriVox镜像数据集,业界已衍生出一系列具有影响力的工作。在语音识别方向,它被用于多语种端到端模型的预训练,推动了类似Whisper、XLS-R等通用语音模型的发展;在语音合成领域,则催生了多说话人、多语种TTS系统的研究,并促进了诸如VITS、Tacotron等经典模型的低资源语种适配。此外,该数据集还启发了语音文本对齐工具、说话人验证模型以及语种识别系统的构建,其开放的元数据亦为语音语料库自动化管理工具的开发提供了范本。
数据集最近研究
最新研究方向
在当前多语种语音处理与生成研究蓬勃发展的背景下,LibriVox Mirror作为一项持续更新的公益语音资源镜像,其前沿价值日益凸显。该数据集囊括逾七千部公有领域有声书,覆盖六十九种语言,总时长近四万八千小时,为自动语音识别(ASR)与文本转语音(TTS)模型提供了规模宏大且语种多样的训练语料。其设计巧妙融合WebDataset分片存储与Parquet元数据索引,支持基于语言与哈希分区的稳定子集划分,极大便利了跨语种迁移学习与低资源语音技术探索。尤为重要的是,数据集严格保留原始音频的校验信息与来源追溯,确保研究可复现性,同时依托LibriVox与互联网档案馆的持续协作,实现了资源的动态更新,为语音社区构筑起一座连接历史文献与现代智能的桥梁,对推动多语种语音技术民主化具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务