Bagpiper_PreTrain_Data_Collection
收藏资源简介:
该数据集名为Bagpiper Pretraining Data Collection,是一个用于预训练的大规模多模态音频数据集。数据以Opus压缩格式存储,包含约20TB的16kHz单声道Ogg/Opus音频(码率约32kbps)。每个音频片段都附带一个以纯文本形式提供的丰富标题(rich caption),并且标注了其所属的策展子集类别,包括 speech_und(语音理解)、speech_gen(语音生成)、sound_und(声音理解)、sound_gen(声音生成)、music_und(音乐理解)、music_gen(音乐生成)以及对应的SFT规模变体。一个片段可以属于零个、一个或两个基础子集。数据集规模在1亿到10亿样本之间,语言为英语。适用于自动语音识别(ASR)、文本到音频生成(TTS)以及多模态音频理解与生成等任务。目前数据集仍在上传中,完整的卡片、统计信息和用法说明将在上传完成后提供。
The dataset is called Bagpiper Pretraining Data Collection, a large-scale multimodal audio dataset for pretraining. Data is stored in Opus compression format, containing approximately 20TB of 16kHz mono Ogg/Opus audio (bitrate about 32kbps). Each audio clip is accompanied by a rich caption provided in plain text and labeled with its curation subset category, including speech_und (speech understanding), speech_gen (speech generation), sound_und (sound understanding), sound_gen (sound generation), music_und (music understanding), music_gen (music generation), and corresponding SFT-scale variants. A clip can belong to zero, one, or two base subsets. The dataset size ranges from 100 million to 1 billion samples, and the language is English. It is suitable for tasks such as automatic speech recognition (ASR), text-to-audio generation (TTS), and multimodal audio understanding and generation. Currently, the dataset is still being uploaded; the complete card, statistics, and usage instructions will be provided after the upload is completed.
Bagpiper Pretraining Data Collection
数据集概述
- 数据集名称:Bagpiper Pretraining Data Collection
- 状态:上传中,尚未完成,在移除相关提示前不应使用或引用。
数据集内容
- 音频格式:Opus 压缩音频。
- 标注信息:包含丰富字幕(rich captions)与策划子集标签(curation subset labels)。
- 数据布局:采用 ESPnet speechlm dataloader 可直接读取的归档布局。
- 计划内容:
- 16 kHz 单声道 Ogg/Opus 音频,码率约 32 kbps。
- 数据规模约 20 TB。
- 每条话语以其丰富字幕作为纯字符串保存,并记录其所属的策划子集。
- 策划子集包括:
speech_und、speech_gen、sound_und、sound_gen、music_und、music_gen,以及 SFT 规模的变体。 - 一条话语可属于零个、一个或两个基础子集。
数据集定位
- 该数据集是 espnet/Bagpiper_PreTrain_Data 的压缩、可直接训练版本。
- 原数据集提供 HuggingFace 风格的 Parquet 格式,训练代码无法加载。
数据集属性
- 语言:英语(en)
- 任务类别:
- 自动语音识别(automatic-speech-recognition)
- 文本到音频(text-to-audio)
- 标签:audio、speech、music、sound、multimodal、rich-caption、opus
- 规模类别:100M < n < 1B
后续更新
- 上传完成后,将提供完整的数据集卡片、各数据集统计信息与使用说明,并替换当前提示内容。




