asrtts_packed_webdataset
收藏资源简介:
该数据集是 FlexiSLM-Data 项目的一部分,专为 FlexiSLM 语音语言模型的训练而设计,旨在支持自动语音识别(ASR)和文本转语音(TTS)任务。数据集以 WebDataset 格式打包,包含约 355 万个训练样本和 6000 个验证样本,总样本数超过 355 万。所有音频均以 mp3 格式存储。数据来源包括 LibriTTS、MLS English(10k 小时)和 GigaSpeech Medium 三个公开数据集。每个样本包含一个音频文件(audio.mp3)以及两个 JSON 元数据文件:asr.json 用于 ASR 任务,提供转录文本和对话消息格式;tts.json 用于 TTS 任务,提供文本到语音的提示和输出。音频总时长约 11,452.71 小时,数据集总大小约 346.38 GB。该数据集适用于语音识别、语音合成以及相关的多任务学习场景。
This dataset is part of the FlexiSLM-Data project, designed for training the FlexiSLM speech language model, supporting automatic speech recognition (ASR) and text-to-speech (TTS) tasks. The dataset is packaged in WebDataset format, containing approximately 3.55 million training samples and 6,000 validation samples, with a total of over 3.55 million samples. All audio is stored in mp3 format. The data sources include three public datasets: LibriTTS, MLS English (10k hours), and GigaSpeech Medium. Each sample includes an audio file (audio.mp3) and two JSON metadata files: asr.json for ASR tasks, providing transcribed text and conversation message format; tts.json for TTS tasks, providing text-to-speech prompts and outputs. The total audio duration is approximately 11,452.71 hours, and the total dataset size is about 346.38 GB. This dataset is suitable for speech recognition, speech synthesis, and related multi-task learning scenarios.
数据集概述
FlexiSLM/asrtts_packed_webdataset 是一个为 FlexiSLM 语音语言模型训练准备的 ASR(自动语音识别)与 TTS(文本转语音)任务 WebDataset 格式重打包数据集,包含约 355 万个训练样本。
基本信息
- 语言:英语
- 任务类别:自动语音识别(ASR)、文本转语音(TTS)、音频到音频(audio-to-audio)
- 数据集规模:约 355.7 万样本(1M<n<10M)
- 数据格式:WebDataset(tar 分片),音频为 MP3 格式
数据来源
该数据集由以下公开数据源合并构建:
- LibriTTS
- MLS English(10,000 小时)
- GigaSpeech Medium
数据统计
| 指标 | 数值 |
|---|---|
| 训练集样本数 | 3,551,024(分布在 356 个分片中) |
| 验证集样本数 | 6,000(1 个分片) |
| 总样本数 | 3,557,024 |
| 总分片数 | 357 |
| 总音频时长 | 11,452.71 小时 |
| 总存储大小 | 346.38 GB |
| 移除的重复提示 | 3,763,424 |
数据组织与结构
每个样本包含三个文件,以 8 位数字键命名:
{key}.audio.mp3:音频文件{key}.asr.json:用于 ASR 任务的元数据{key}.tts.json:用于 TTS 任务的元数据
ASR 元数据字段
task:任务类型("asr")audios/audio_durations/audio_tokens:音频相关信息transcript_text:音频对应的文本转录messages:对话格式提示(用户:要求转录音频;助手:给出转录文本)text_tokens_est/num_tokens_est:预估 token 数量source_config:来源配置(可选)
TTS 元数据字段
task:任务类型("tts")audios/audio_durations/audio_tokens:音频相关信息transcript_text:需要朗读的文本messages:对话格式提示(用户:要求朗读文本;助手:音频对应的文本)text_tokens_est/num_tokens_est:预估 token 数量source_config:来源配置(可选)
数据划分
- 训练集:
data/train-{00000..00355}-of-00356.tar - 验证集:
data/validation-{00000..00000}-of-00001.tar
相关数据发布
该数据集属于 FlexiSLM 系列数据发布的一部分,其他相关数据集包括:
- FlexiSLM/FlexiSLM-Data-4M-s2s:包含 400 万样本的语音到语音对话数据,问题音频为 44kHz WAV,回复音频为 MP3,约 2.8TB
- FlexiSLM/FlexiSLM-Data-2M-s2s-compact:经筛选和 MP3 压缩的 4M 子集,仅需 385GB 存储
- FlexiSLM/FlexiSLM-Data-5M-t2t:纯文本输入输出对,不含音频
加载方式
可通过 Hugging Face Datasets(流式加载)或 WebDataset 直接读取 tar 分片。数据集还提供 manifest.jsonl 元数据清单文件,方便在不加载音频的情况下检查元数据。
许可说明
数据集基于 LibriTTS、MLS English 和 GigaSpeech Medium 构建,重新分发或商业使用前需查阅原始数据集的许可证和使用条款。




