遇见数据集

Bagpiper_PreTrain_Data_Collection

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集名为Bagpiper Pretraining Data Collection,是一个用于预训练的大规模多模态音频数据集。数据以Opus压缩格式存储,包含约20TB的16kHz单声道Ogg/Opus音频(码率约32kbps)。每个音频片段都附带一个以纯文本形式提供的丰富标题(rich caption),并且标注了其所属的策展子集类别,包括 speech_und(语音理解)、speech_gen(语音生成)、sound_und(声音理解)、sound_gen(声音生成)、music_und(音乐理解)、music_gen(音乐生成)以及对应的SFT规模变体。一个片段可以属于零个、一个或两个基础子集。数据集规模在1亿到10亿样本之间,语言为英语。适用于自动语音识别(ASR)、文本到音频生成(TTS)以及多模态音频理解与生成等任务。目前数据集仍在上传中,完整的卡片、统计信息和用法说明将在上传完成后提供。

The dataset is called Bagpiper Pretraining Data Collection, a large-scale multimodal audio dataset for pretraining. Data is stored in Opus compression format, containing approximately 20TB of 16kHz mono Ogg/Opus audio (bitrate about 32kbps). Each audio clip is accompanied by a rich caption provided in plain text and labeled with its curation subset category, including speech_und (speech understanding), speech_gen (speech generation), sound_und (sound understanding), sound_gen (sound generation), music_und (music understanding), music_gen (music generation), and corresponding SFT-scale variants. A clip can belong to zero, one, or two base subsets. The dataset size ranges from 100 million to 1 billion samples, and the language is English. It is suitable for tasks such as automatic speech recognition (ASR), text-to-audio generation (TTS), and multimodal audio understanding and generation. Currently, the dataset is still being uploaded; the complete card, statistics, and usage instructions will be provided after the upload is completed.

提供机构:
ESPnet
创建时间:
2026-09-21
原始信息汇总

Bagpiper Pretraining Data Collection

数据集概述

  • 数据集名称:Bagpiper Pretraining Data Collection
  • 状态:上传中,尚未完成,在移除相关提示前不应使用或引用。

数据集内容

  • 音频格式:Opus 压缩音频。
  • 标注信息:包含丰富字幕(rich captions)与策划子集标签(curation subset labels)。
  • 数据布局:采用 ESPnet speechlm dataloader 可直接读取的归档布局。
  • 计划内容:
    • 16 kHz 单声道 Ogg/Opus 音频,码率约 32 kbps。
    • 数据规模约 20 TB。
    • 每条话语以其丰富字幕作为纯字符串保存,并记录其所属的策划子集。
    • 策划子集包括:speech_und、speech_gen、sound_und、sound_gen、music_und、music_gen,以及 SFT 规模的变体。
    • 一条话语可属于零个、一个或两个基础子集。

数据集定位

  • 该数据集是 espnet/Bagpiper_PreTrain_Data 的压缩、可直接训练版本。
  • 原数据集提供 HuggingFace 风格的 Parquet 格式,训练代码无法加载。

数据集属性

  • 语言:英语(en)
  • 任务类别:
    • 自动语音识别(automatic-speech-recognition)
    • 文本到音频(text-to-audio)
  • 标签:audio、speech、music、sound、multimodal、rich-caption、opus
  • 规模类别:100M < n < 1B

后续更新

  • 上传完成后,将提供完整的数据集卡片、各数据集统计信息与使用说明,并替换当前提示内容。
搜集汇总
数据集介绍
Bagpiper_PreTrain_Data_Collection 数据集图片
构建方式
面向语音、音乐与通用声音等多模态预训练需求,该数据集以Opus压缩格式构建,将原始音频统一为16 kHz单声道、约32 kbps的Ogg/Opus流,并按ESPnet speechlm数据加载器可直接读取的归档布局组织。每条语音样本均配以丰富的文本描述,并以纯字符串形式存储;同时依据策展子集赋予标签,涵盖语音、声音、音乐三大类别下的自然与生成子集及其SFT规模变体。单条样本可归属于零个、一个或两个基础子集,形成灵活的多元标注体系,从而在大规模预训练中兼顾数据效率与语义监督。
使用方法
该数据集专为ESPnet speechlm训练流程设计,可直接被其数据加载器读取,无需额外的格式转换。使用时,研究者可依据归档布局加载Opus压缩音频及其对应的富描述文本,并利用策展子集标签进行数据筛选与采样。例如,可选取特定子集(如speech_und或music_gen)进行领域自适应预训练,或组合多个子集以平衡多模态数据分布。由于每条样本可属于零至两个基础子集,用户需注意标签的多重归属特性,在构建训练批次时合理处理样本权重。该数据集适用于自动语音识别、文本到音频生成以及多模态表征学习等任务。
背景与挑战
背景概述
大规模语音-文本预训练模型的兴起,对兼具高质量音频与细粒度语义标注的数据集提出了迫切需求。在此背景下,Bagpiper_PreTrain_Data_Collection作为ESPnet社区推动的预训练数据集合,旨在为语音语言模型提供可直接训练的大规模资源。该数据集以16 kHz单声道Ogg/Opus格式压缩存储,规模约20 TB,涵盖语音、通用声音与音乐等多种声学类别,并为每条音频配备丰富描述性文本以及整理子集标签。其核心研究问题在于弥合数据存储格式与训练框架之间的兼容性鸿沟,使预训练流程更加高效顺畅,对多模态语音理解与生成研究具有基础性支撑意义。
当前挑战
该数据集所应对的领域问题在于,通用音频-文本预训练长期受限于数据格式不统一、标注粒度不足以及存储开销庞大,难以直接服务于端到端训练。构建过程中面临的挑战同样显著:一是在约20 TB量级下保持16 kHz单声道Ogg/Opus高压缩比,同时确保音质可接受;二是为每条utterance生成丰富描述并准确分配整理子集标签,需处理零个、一个或两个子集归属的逻辑;三是与ESPnet speechlm数据加载器的归档布局严格对齐,避免训练代码无法读取。这些挑战共同塑造了该数据集在工程与标注层面的复杂性。
常用场景
经典使用场景
在语音与音频多模态预训练领域,Bagpiper_PreTrain_Data_Collection作为大规模、富标注的音频语料库,其最经典的使用场景是支撑基于ESPnet语音语言模型的预训练任务。研究者可直接调用该数据集中的16kHz单声道Ogg/Opus压缩音频,借助每条语音所附的丰富文本描述,开展自动语音识别、文本到音频生成以及跨模态表征学习等实验。由于数据同时涵盖语音、一般声音与音乐三大类别,并标注了人工标注与生成式标注的子集标签,该数据集成为训练统一音频理解与生成模型的理想基石。
解决学术问题
该数据集有效缓解了音频与语音研究领域长期存在的高质量、大规模、多模态标注数据匮乏问题。过往学术工作常受限于单一任务标注(如仅转录文本)或数据规模不足,难以训练出泛化能力强的通用音频模型。本数据集通过提供带有丰富描述性文本的音频样本,并区分人工与生成式标注来源,使研究者能够探究标注质量对模型性能的影响,以及跨模态对齐中的噪声鲁棒性问题。其意义在于推动了音频预训练从单一任务向多任务、多模态的统一范式演进,为可复现的音频基础模型研究提供了标准化数据基础。
实际应用
在实际应用层面,该数据集可直接服务于智能语音助手、音频内容检索、无障碍辅助技术以及多媒体创作工具的开发。例如,利用其富描述文本训练出的模型能够根据自然语言指令生成特定类型的音频片段,或对海量音频档案进行自动分类与语义标注。压缩的Opus格式与约20TB的规模,使得工业级分布式训练在存储与带宽成本上更为可行,从而加速了从学术原型到产品级音频理解系统的转化进程。
数据集最近研究
最新研究方向
在语音与音频多模态学习迅猛演进的背景下,Bagpiper_PreTrain_Data_Collection作为ESPnet生态中面向大规模预训练的数据集,正推动语音-文本-音频跨模态表征学习的前沿探索。其以Opus压缩格式提供约20TB、16kHz单声道音频,并为每个话语配备丰富描述性字幕与多维度策展子集标签(如speech_und、sound_gen、music_und等),为统一语音识别、文本到音频生成及音乐/环境声理解等任务提供了可直接训练的数据基础。当前研究聚焦于利用该数据集开展多任务联合预训练,探索细粒度音频-文本对齐、生成式音频建模以及跨域迁移学习,尤其关注在异构音频类型间共享表征的泛化能力。该数据集的发布有望缓解音频预训练领域高质量标注数据稀缺的瓶颈,促进语音大模型在真实场景中的鲁棒性与多模态交互能力,对推动通用音频智能的发展具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务