遇见数据集

asrtts_packed_webdataset

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是 FlexiSLM-Data 项目的一部分,专为 FlexiSLM 语音语言模型的训练而设计,旨在支持自动语音识别(ASR)和文本转语音(TTS)任务。数据集以 WebDataset 格式打包,包含约 355 万个训练样本和 6000 个验证样本,总样本数超过 355 万。所有音频均以 mp3 格式存储。数据来源包括 LibriTTS、MLS English(10k 小时)和 GigaSpeech Medium 三个公开数据集。每个样本包含一个音频文件(audio.mp3)以及两个 JSON 元数据文件:asr.json 用于 ASR 任务,提供转录文本和对话消息格式;tts.json 用于 TTS 任务,提供文本到语音的提示和输出。音频总时长约 11,452.71 小时,数据集总大小约 346.38 GB。该数据集适用于语音识别、语音合成以及相关的多任务学习场景。

This dataset is part of the FlexiSLM-Data project, designed for training the FlexiSLM speech language model, supporting automatic speech recognition (ASR) and text-to-speech (TTS) tasks. The dataset is packaged in WebDataset format, containing approximately 3.55 million training samples and 6,000 validation samples, with a total of over 3.55 million samples. All audio is stored in mp3 format. The data sources include three public datasets: LibriTTS, MLS English (10k hours), and GigaSpeech Medium. Each sample includes an audio file (audio.mp3) and two JSON metadata files: asr.json for ASR tasks, providing transcribed text and conversation message format; tts.json for TTS tasks, providing text-to-speech prompts and outputs. The total audio duration is approximately 11,452.71 hours, and the total dataset size is about 346.38 GB. This dataset is suitable for speech recognition, speech synthesis, and related multi-task learning scenarios.

创建时间:
2026-08-07
原始信息汇总

数据集概述

FlexiSLM/asrtts_packed_webdataset 是一个为 FlexiSLM 语音语言模型训练准备的 ASR(自动语音识别)与 TTS(文本转语音)任务 WebDataset 格式重打包数据集,包含约 355 万个训练样本。

基本信息

  • 语言:英语
  • 任务类别:自动语音识别(ASR)、文本转语音(TTS)、音频到音频(audio-to-audio)
  • 数据集规模:约 355.7 万样本(1M<n<10M)
  • 数据格式:WebDataset(tar 分片),音频为 MP3 格式

数据来源

该数据集由以下公开数据源合并构建:

  • LibriTTS
  • MLS English(10,000 小时)
  • GigaSpeech Medium

数据统计

指标 数值
训练集样本数 3,551,024(分布在 356 个分片中)
验证集样本数 6,000(1 个分片)
总样本数 3,557,024
总分片数 357
总音频时长 11,452.71 小时
总存储大小 346.38 GB
移除的重复提示 3,763,424

数据组织与结构

每个样本包含三个文件,以 8 位数字键命名:

  • {key}.audio.mp3:音频文件
  • {key}.asr.json:用于 ASR 任务的元数据
  • {key}.tts.json:用于 TTS 任务的元数据

ASR 元数据字段

  • task:任务类型("asr")
  • audios / audio_durations / audio_tokens:音频相关信息
  • transcript_text:音频对应的文本转录
  • messages:对话格式提示(用户:要求转录音频;助手:给出转录文本)
  • text_tokens_est / num_tokens_est:预估 token 数量
  • source_config:来源配置(可选)

TTS 元数据字段

  • task:任务类型("tts")
  • audios / audio_durations / audio_tokens:音频相关信息
  • transcript_text:需要朗读的文本
  • messages:对话格式提示(用户:要求朗读文本;助手:音频对应的文本)
  • text_tokens_est / num_tokens_est:预估 token 数量
  • source_config:来源配置(可选)

数据划分

  • 训练集data/train-{00000..00355}-of-00356.tar
  • 验证集data/validation-{00000..00000}-of-00001.tar

相关数据发布

该数据集属于 FlexiSLM 系列数据发布的一部分,其他相关数据集包括:

  • FlexiSLM/FlexiSLM-Data-4M-s2s:包含 400 万样本的语音到语音对话数据,问题音频为 44kHz WAV,回复音频为 MP3,约 2.8TB
  • FlexiSLM/FlexiSLM-Data-2M-s2s-compact:经筛选和 MP3 压缩的 4M 子集,仅需 385GB 存储
  • FlexiSLM/FlexiSLM-Data-5M-t2t:纯文本输入输出对,不含音频

加载方式

可通过 Hugging Face Datasets(流式加载)或 WebDataset 直接读取 tar 分片。数据集还提供 manifest.jsonl 元数据清单文件,方便在不加载音频的情况下检查元数据。

许可说明

数据集基于 LibriTTS、MLS English 和 GigaSpeech Medium 构建,重新分发或商业使用前需查阅原始数据集的许可证和使用条款。

搜集汇总
数据集介绍
asrtts_packed_webdataset 数据集图片
构建方式
本数据集源自LibriTTS、MLS English(10k小时)与GigaSpeech Medium三大公开语音语料库的深度整合与重构,经过去重、筛选与打包流程,构建了专为FlexiSLM口语语言模型训练优化的ASR与TTS双任务数据集。每个样本以8位数字为键,封装为tar分片,包含MP3音频文件及对应的ASR与TTS元数据JSON,其中元数据详细记录了音频路径、时长、令牌数、转录文本及交互消息格式。数据划分包含355万训练样本与6000验证样本,总音频时长逾1.1万小时,分存于357个分片中,确保大规模高效训练。
使用方法
使用者可通过Hugging Face Datasets库的流式接口直接加载数据集,默认配置返回包含音频与JSON元数据的完整样本,适用于端到端模型训练。亦可单独加载manifest.jsonl清单文件,仅获取元数据而不载入音频字节,便于快速探查数据分布。对于偏好底层操作的研究者,提供WebDataset加载示例,支持通过curl管道流式读取tar分片。数据集内建train与validation划分,训练时可按需混洗分片,验证集固定为单分片,便于一致性评估。需留意各源语料库的原始许可条款,确保合规使用。
背景与挑战
背景概述
该数据集由FlexiSLM研究团队于2026年创建,作为大规模语音对话模型FlexiSLM训练数据的关键组成部分,汇集了LibriTTS、MLS English和GigaSpeech Medium三大公开语音语料库,经过去重、清洗与打包,构建了包含355万余条训练样本和6000条验证样本的WebDataset格式数据。其核心研究问题在于为自动语音识别(ASR)与文本转语音(TTS)任务提供统一、高效且可扩展的音频-文本配对数据,从而支撑端到端语音对话模型的预训练与微调。该数据集的发布显著推动了语音语言模型领域的数据标准化与可复用性,其分片存储和流式加载设计为大规模语音模型训练提供了便捷路径,成为FlexiSLM及相关研究的基石性资源,对语音技术社区产生了广泛影响。
当前挑战
该数据集构建面临多重挑战:首要任务是解决多源异构语音数据的整合难题,包括不同采样率、编码格式及标注风格的统一,需设计精细的清洗与去重流程,如本书中移除了超过370万重复提示,确保数据唯一性。其次,需兼顾ASR与TTS任务的双重需求,保证音频与其转录文本的精确对齐,以及元数据结构的灵活性,以适应不同任务模板。此外,海量数据的存储与访问效率也是一大考验,通过WebDataset分片与mp3压缩,将数据量控制在346GB,同时维持高可用性。在领域层面,该数据集旨在推动语音到语音的对话生成,挑战在于如何从有限的高质量语音数据中提取泛化特征,并确保模型在不同说话者、口音和环境下保持鲁棒性,同时需处理许可合规问题,保障数据使用的合法性。
常用场景
经典使用场景
该数据集作为大规模英文语音对话数据的整合资源,在语音领域研究与应用中扮演着举足轻重的角色。其经典使用场景专注于训练端到端的口语理解与生成模型,特别是面向自动语音识别(ASR)与文本到语音合成(TTS)等核心任务的联合建模。通过对音频与文本转录的无缝配对,该数据集为开发能够同时处理语音输入与输出的多模态智能系统提供了高标准的训练语料,推动了从孤立任务到统一语音接口的范式转变。
解决学术问题
此数据集有效解决了学术界在构建大规模、高质量语音对话模型时所面临的数据碎片化与格式不统一问题。通过汇集LibriTTS、MLS English及GigaSpeech等权威语料库,并精细化清洗、去重及格式标准化,它为研究社区提供了一个规模宏大且一致性强的训练基础。这一举措攻克了以往研究因数据匮乏或预处理繁琐而难以复现与对比的难题,为探索语音语言模型(如FlexiSLM)的规模法则、鲁棒性与跨任务泛化能力铺平了道路,其意义在于显著加速了语音基础模型的发展进程。
实际应用
在实际应用层面,该数据集对于构建高精度、高自然度的语音交互产品具有直接推动作用。其应用场景覆盖智能语音助手、实时语音翻译、有声内容自动生成及辅助交流工具等。通过利用该数据训练的ASR与TTS模型,能够显著提升嘈杂环境下的语音识别准确率与合成语音的情感表达力,进而优化人机交互体验。此外,其WebDataset格式与流式加载支持,便于在分布式计算环境中高效部署,服务于需要低延迟响应的商业级语音服务。
数据集最近研究
最新研究方向
该数据集近期研究聚焦于构建大规模、多任务的语音-语言预训练模型,特别是通过FlexiSLM框架实现语音到语音的端到端对话生成。此类研究整合了自动语音识别(ASR)与文本到语音合成(TTS)任务,利用WebDataset格式高效存储与流式处理海量音频数据,支撑模型在跨模态语义理解与生成上的突破。前沿方向涵盖多模态大语言模型的语音接口优化、低资源语音任务的迁移学习,以及通过压缩存储(如mp3)在保持数据质量的同时降低存储与训练成本,从而推动实时语音交互系统向更自然、更智能的方向演进。数据集的大规模、多任务特性使其成为连接语音与文本模态的关键资源,对下一代人机交互技术的研发具有重要奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务