遇见数据集

AudiobookRu2

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

AudiobookRu2 是一个俄语章节级音频书数据集,作为 Muncy/AudiobookRu 的续集,主要容纳因原仓库存储配额限制未能放入第一部分的章节。每个样本包含嵌入的 MP3 音频及其对应的书籍和章节元数据。数据集包含一个训练分割,以 Parquet 格式存储。字段包括:音频文件、唯一 ID、书籍 ID、章节顺序号、章节标题、总章节数、关联书籍 ID、书籍名称、slug、音频类型、类型、语言(俄语)、音频时长(秒)、音频字节数、评分、评分投票数、评分分数、阅读次数、评论数、引用数、主要作者 slug 和名称、主要演播者 slug 和名称、出版商名称、流派名称(逗号分隔)、标签(CSV)、系列名称、订阅 ID、是否已购买、成人内容标志、写作日期、更新日期、绝对 URL、分享 URL、默认封面路径、预览音频 URL、注释纯文本、注释 HTML、页面 URL、原始元数据 JSON。该数据集适用于俄语音频书相关的语音识别(ASR)研究、语音合成、文学分析等任务。

AudiobookRu2 is a Russian chapter-level audiobook dataset, serving as a sequel to Muncy/AudiobookRu, primarily containing chapters that could not be included in the first part due to storage quota limitations of the original repository. Each sample contains embedded MP3 audio along with its corresponding book and chapter metadata. The dataset includes a training split stored in Parquet format. Fields include: audio file, unique ID, book ID, chapter sequence number, chapter title, total chapters, associated book ID, book name, slug, audio type, type, language (Russian), audio duration (seconds), audio byte size, rating, number of rating votes, rating score, reading count, comment count, citation count, main author slug and name, main narrator slug and name, publisher name, genre names (comma-separated), tags (CSV), series name, subscription ID, purchased status, adult content flag, writing date, update date, absolute URL, share URL, default cover path, preview audio URL, plain text annotations, HTML annotations, page URL, raw metadata JSON. This dataset is suitable for tasks such as Russian audiobook-related automatic speech recognition (ASR) research, speech synthesis, and literary analysis.

创建时间:
2026-09-30
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Russian Audiobooks chapter-level (part 2)
  • 数据集地址:https://huggingface.co/datasets/Lambus1/AudiobookRu2
  • 语言:俄语(ru)
  • 许可证:other(scraped-from-web-for-research-use,从网络抓取用于研究用途)
  • 标签:audio、speech、russian、audiobooks、asr

数据集描述

  • 本数据集是 Muncy/AudiobookRu 的延续(原仓库已达到 HF 存储配额上限)。
  • 内容为章节级俄语有声书:内嵌 MP3 音频及书籍/章节元数据。
  • 本仓库包含未能放入第一部分的章节。

配置信息

  • 配置名称:default
  • 数据文件:
    • split:train
    • 路径:data//train-.parquet

特征字段

字段名 数据类型
audio audio
id int64
book_id int64
chapter_order int32
chapter_title string
n_chapters int32
connected_book_id int64
name string
slug string
audio_type string
type string
lang string
duration_sec int32
audio_bytes int64
rating float32
rating_votes int32
rating_scores int32
read_count int64
reviews_count int32
citations_count int32
main_author_slug string
main_author_name string
main_actor_slug string
main_actor_name string
publisher_name string
genres_names string
tags_csv string
series_name string
subscription_id int32
is_purchased bool
adult int8
written_dt string
updated_at string
absolute_url string
share_url string
default_cover_path string
preview_audio_url string
annotation_plain string
annotation_html string
page_url string
raw_metadata_json string
搜集汇总
数据集介绍
AudiobookRu2 数据集图片
构建方式
该数据集作为Muncy/AudiobookRu的续篇,因原仓库触及HuggingFace存储配额而分拆构建。其数据源自网络公开的俄语有声书资源,以章节为粒度进行采集与整理,将内嵌MP3音频与书籍、章节元数据一并封装,形成结构统一的Parquet文件。构建过程中,对每一条章节记录均保留原始音频字节、时长、章节序号及所属书籍标识,并关联书籍层面的作者、演播者、出版者、评分、标签等属性,从而在音频与文本元数据之间建立起可追溯的对应关系,为后续语音处理与多模态研究提供基础素材。
特点
数据集以章节级俄语有声书音频为核心,兼具丰富的书籍与章节元信息。音频字段直接承载MP3数据,配合时长、字节数等量化指标,便于资源管理与筛选。元数据维度涵盖书籍标识、章节顺序、标题、作者、演播者、出版商、类型、标签、评分及互动统计等,形成对每段音频的多角度描述。语言标注明确为俄语,许可条款限定为研究用途,且区分了默认配置下的训练集划分,整体呈现出领域聚焦、结构清晰、标注详尽的特点。
使用方法
研究人员可通过HuggingFace数据集接口加载默认配置,利用Parquet文件按训练集划分读取音频与元数据字段。音频字段可直接解码为波形,用于自动语音识别、声学建模或语音合成等任务;书籍与章节元数据则支持按作者、演播者、类型或评分进行筛选与分组,便于构建特定子集或开展统计分析。字段中的标注文本与原始JSON可为文本-音频对齐、内容检索等研究提供辅助信息,使用时需遵循研究用途的许可限制。
背景与挑战
背景概述
俄语语音处理领域长期受限于高质量、大规模公开语料的匮乏,特别是兼具自然朗读风格与丰富文本标注的资源更为稀缺。AudiobookRu2数据集作为AudiobookRu的延续,由研究者Muncy创建,旨在突破HuggingFace存储配额的限制,以章节级别粒度发布包含嵌入式MP3音频及详尽书籍与章节元数据的俄语有声书语料。该数据集直面俄语自动语音识别(ASR)与语音合成(TTS)研究中对真实场景、长时语音数据的需求,为声学建模、语言模型训练及多模态研究提供了宝贵的基准资源,有力推动了低资源语言语音技术的可复现研究。
当前挑战
该数据集所应对的核心领域挑战在于俄语语音识别中因数据稀缺导致的模型泛化能力不足,以及有声书场景下长时音频与章节边界对齐的复杂性。构建过程中的挑战则集中体现在存储配额限制迫使数据集分片发布,需确保跨分片的章节归属与元数据一致性;同时,原始网页抓取数据的清洗与规范化面临音频格式多样、元数据字段缺失或冲突、以及版权与伦理约束下仅限研究使用的许可界定等问题,对数据质量与可访问性构成持续考验。
常用场景
经典使用场景
在俄语语音处理领域,AudiobookRu2数据集凭借其章节级的有声书音频与丰富的元数据,成为自动语音识别(ASR)任务中不可或缺的资源。研究者常将其用于训练和评估俄语声学模型,尤其是针对长音频、多说话人场景下的连续语音识别。音频内嵌MP3格式与章节顺序、时长等信息的结合,为构建端到端的语音转文本系统提供了便利,同时支持语言模型在文学文本上的适配与微调。
解决学术问题
该数据集有效缓解了俄语语音研究中高质量标注数据稀缺的困境,为低资源语言下的声学建模与语言理解提供了大规模真实语料。其章节级结构使得研究者能够探索篇章级语音识别、说话人分割及语音情感分析等复杂问题。元数据中的评分、阅读量等社交信号,亦为分析语音质量与听众偏好之间的关联提供了可能,推动了语音技术与计算社会科学交叉研究的发展。
衍生相关工作
基于AudiobookRu2,学界涌现出多项经典工作,如俄语端到端ASR模型的基准测试与改进、多说话人语音合成系统的声学特征分析,以及基于章节结构的自动摘要与问答系统。该数据集亦被用于迁移学习研究,探索跨语言语音识别模型的泛化能力。其续作性质促进了大规模音频数据集的分布式存储与管理方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务