遇见数据集

media-metadata-librivox-audiobooks

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

LibriVox Audiobooks数据集是一个包含22,000个有声读物录音元数据的集合,这些录音来自LibriVox平台——一个由志愿者录制、属于公共领域的项目,所有录音可自由下载和使用,无任何限制。该数据集在语音研究领域广泛应用,著名的LibriSpeech自动语音识别(ASR)基准测试即基于此。它提供完整的目录元数据,以结构化字段呈现,包括:LibriVox目录ID、书籍标题、源文本链接(通常指向古登堡计划)、录音语言、文本进入公共领域的年份、音频章节数量、项目类型(如独奏或协作)、录音的RSS订阅链接、完整ZIP文件的直接下载链接、作者列表(含名、姓、出生和逝世日期)以及朗读者列表(含名、姓和读者ID)。其中,朗读者字段特别适用于多朗读者协作项目,常用于说话人多样性研究。数据集适用于语音处理、有声读物分析、说话人识别和公共领域资源挖掘等任务。

The LibriVox Audiobooks Dataset is a collection of metadata for 22,000 audiobook recordings sourced from LibriVox, a public-domain project recorded by volunteers where all recordings are freely downloadable and usable without any restrictions. This dataset is widely applied in the field of speech research, and the renowned LibriSpeech automatic speech recognition (ASR) benchmark is based on it. It provides complete catalog metadata presented in structured fields, including: LibriVox catalog ID, book title, source text link (usually pointing to Project Gutenberg), recording language, year when the text entered the public domain, number of audio chapters, project type (e.g., solo or collaborative), RSS subscription link of the recording, direct download link of the full ZIP file, list of authors (including first name, last name, birth and death dates), and list of readers (including first name, last name and reader ID). The reader field is particularly suitable for multi-reader collaborative projects and is often used in speaker diversity research. The dataset is applicable to tasks such as speech processing, audiobook analysis, speaker recognition and public domain resource mining.

创建时间:
2026-06-24
搜集汇总
数据集介绍
media-metadata-librivox-audiobooks 数据集图片
构建方式
该数据集由开源工具metadatarr中的librivox_audiobooks爬虫模块从LibriVox平台精心采集而成。LibriVox是一个以公共领域有声书籍为核心的数字图书馆,数据集聚焦于其海量音频资源的元数据。构建过程通过自动化脚本提取每部有声书的唯一标识符、标题、描述、语种、版权年份、章节数量、RSS订阅链接、压缩文件地址、项目主页及所属类型等结构化信息,同时关联作者与朗读者信息,共计22,151条记录,形成一份完整而规范的实体数据集。
特点
该数据集兼具丰富性与实用性,覆盖了LibriVox音频资源的全维度元数据。其特色在于囊括了多语种有声书信息(通过language字段)、细致的时间长度(totaltimesecs)、风格流派标签(genres)以及版权年份等关键属性,便于进行语种分布、内容时长与版权状态等交叉分析。此外,通过作者与读者字段的关联,数据集支持从创作者与演绎者双重视角探索音频资源,为数字人文与有声书研究提供了宝贵的数据基础。
使用方法
数据集可直接通过Hugging Face平台加载,适用于分析与建模任务。使用者可以基于标题、描述与语种字段进行多维度检索与过滤;利用流派和时间信息进行聚类或趋势分析;通过RSS链接和压缩文件地址实现音频数据的外部关联与批量下载。结合作者与读者数据,还可构建知识图谱或推荐系统。建议在加载后对总时长等数值型字段进行格式转换,并利用元数据中的唯一标识符与其他媒体数据集进行跨库链接,以拓展研究深度。
背景与挑战
背景概述
在数字人文与多媒体信息检索领域,有声书作为一种重要的知识载体,其元数据的系统化整理对资源发现与学术研究具有深远意义。该数据集由TigreGotico团队通过metadatarr工具从LibriVox平台抓取,创建于近年,包含22,151条有声书记录,涵盖标题、描述、语言、版权年份、作者、朗读者及流派等丰富字段。其核心研究问题是探索如何高效构建结构化、跨语言的公共领域有声书目元数据集合,以支持推荐系统、语音技术研究及数字图书馆建设。凭借CC0许可的开放性,该数据集为自然语言处理、多媒体分析及出版领域的研究者提供了高质量的基准资源,推动了开放数据运动在文化传承中的应用。
当前挑战
该数据集所解决的领域问题在于缺乏统一、可扩展的公共领域有声书元数据集合,现有资源往往碎片化且语言覆盖不均,制约了多语种语音合成与智能推荐系统的性能。构建过程中面临多重挑战:一是从LibriVox等分布异构源中抓取数据时,需应对版权年份、作者姓名等字段的格式不统一;二是处理时间戳(如totaltimesecs)与章节数(num_sections)的缺失或异常值;三是维护多语言元数据(如法语、德语条目)的准确性,避免转录错误;四是保证元数据字段与音频本体之间的关联一致性,为后续数据融合与质量校验埋下潜在障碍。
常用场景
经典使用场景
该数据集收录了来自LibriVox平台的22,151部有声书元数据,涵盖标题、描述、语言、体裁、作者、朗读者及时长等丰富字段。在数字人文与语音信息处理领域,它常被用于训练语音合成与识别模型,为多语种有声内容的自动化标注与检索提供结构化参考。同时,研究者借助其体裁与作者标签,可开展文学作品的跨语言传播分析,或探索公共领域有声资源的语义组织模式。
实际应用
在实际应用中,该数据集可用于搭建公益有声书推荐系统,通过体裁与朗读者特征实现个性化推送。教育科技领域可基于此训练自适应朗读辅助工具,帮助视障群体或语言学习者获取定制化内容。图书馆与档案馆则可利用其版权年份与语言字段优化数字馆藏的著录流程,提升公共文化资源的可发现性与再利用效率。
衍生相关工作
基于该数据集衍生的工作包括开发元数据质量自动评估框架,探索多源有声书平台的实体对齐算法。部分研究利用其作者—朗读者关系网络,构建协作朗读模式的知识图谱。此外,结合文本源链接字段,催生了跨越文字与语音模态的跨媒体叙事分析工具,推动了数字出版领域内公共资源语义增强技术的迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务