遇见数据集

kupe-asr-en-data

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集为英语自动语音识别(ASR)任务设计,包含两个可加载配置:raw和mimi。raw配置提供24 kHz单声道英语音频(以FLAC格式存储)及其对应的文本转录;mimi配置提供Mimi编码器生成的c0至c7编码(帧率为12.5 Hz)以及对应的文本。每个配置的数据以约20-25个parquet文件(bunch_*.parquet)形式组织,便于在Hugging Face Hub上高效存储和加载。此外,数据集中还包含ledger目录,用于跟踪已收集和已编码的音频时长以及恢复状态。该数据集适用于训练和评估语音识别模型,以及基于离散编码的语音表示学习。

This dataset is designed for English automatic speech recognition (ASR) tasks. It provides two configurable subsets: raw and mimi. The raw subset offers 24 kHz mono English audio stored in FLAC format along with corresponding text transcriptions. The mimi subset provides c0 to c7 encodings generated by the Mimi encoder at a frame rate of 12.5 Hz, along with the corresponding text. Each subset is organized into approximately 20-25 parquet files (bunch_*.parquet) for efficient storage and loading on the Hugging Face Hub. Additionally, the dataset includes a ledger directory to track the duration of collected and encoded audio and recovery status. This dataset is suitable for training and evaluating speech recognition models, as well as representation learning based on discrete encodings.

创建时间:
2026-09-06
原始信息汇总

数据集概述

kupe-asr-en-mini-150m — data 是一个用于英语自动语音识别(ASR)的数据集,支持两种加载配置,旨在为模型训练和编码阶段提供灵活的数据格式。

主要配置

  • raw 配置:包含 24 kHz 单声道英语音频(以 FLAC 字节存储)及对应的文本转录。此配置用于编码步骤,即从原始音频生成特征表示。数据文件存储在 raw/data/bunch_*.parquet 路径中。
  • mimi 配置:包含 Mimi 编码器的 c0 至 c7 码本(采样率为 12.5 Hz)及文本转录。此配置直接用于模型训练过程。数据文件存储在 mimi/data/bunch_*.parquet 路径中。

文件结构

  • 每个配置包含约 20 至 25 个 bunch_*.parquet 文件,方便 Hub 配额管理。
  • ledger/ 目录下保留账本文件(data.jsonmimi.json),用于跟踪已收集和已编码的音频时长,并记录处理状态的恢复点。

加载示例

用户可通过以下 Python 代码加载 mimi 配置的数据: python from datasets import load_dataset ds = load_dataset("anuj-inavlabs/kupe-asr-en-data", "mimi", split="train")

元数据

  • 许可证other(非标准自定义许可)
  • 任务类型:自动语音识别(automatic-speech-recognition)
  • 语言:英语(en
  • 相关标签asrmimilummakupe
搜集汇总
数据集介绍
kupe-asr-en-data 数据集图片
构建方式
在自动语音识别领域,数据集的构建质量直接决定了模型性能的上限。kupe-asr-en-data 通过双阶段流水线完成构建:原始阶段采集24 kHz单声道英语音频并以FLAC字节形式存储,同时保留对应文本;随后编码阶段利用 Mimi 神经音频编解码器将音频压缩为12.5 Hz的离散码本序列(c0至c7),形成紧凑的声学表示。全部数据以约20至25个 bunch_*.parquet 文件分片封装,兼顾存储效率与Hub配额限制。ledger目录下的 data.json 与 mimi.json 持续追踪已采集与已编码的时长及断点续传状态,保障构建过程的可追溯性与可恢复性,为大规模语音识别训练提供系统化、可扩展的数据基础。
特点
该数据集的核心特征体现在其双配置架构与高效编码范式上。raw配置保留原始24 kHz单声道英语音频与文本对,适用于需要高保真声学信号的编码阶段;mimi配置则提供Mimi编解码器生成的12.5 Hz离散码本序列及对应文本,专为训练阶段设计,显著降低序列长度与计算开销。数据集以约20至25个Parquet分片组织,便于在Hugging Face Hub上高效加载与版本管理。语言覆盖英语,任务类别聚焦自动语音识别,标签涵盖asr、mimi、lumma与kupe,形成面向低帧率语音表示学习的专用资源。ledger文件进一步记录数据采集与编码进度,支持增量式数据处理与中断恢复,增强了数据集在持续训练场景下的实用性。
使用方法
使用该数据集时,研究者可通过Hugging Face datasets库直接加载指定配置。例如,加载mimi配置用于训练:from datasets import load_dataset; ds = load_dataset("anuj-inavlabs/kupe-asr-en-data", "mimi", split="train")。若需执行编码阶段或进行原始音频分析,则加载raw配置以获取24 kHz单声道FLAC字节与文本。数据以Parquet格式分片存储,加载后自动整合为统一数据集对象,支持流式读取与批处理。ledger目录下的JSON文件可用于监控已处理时长与恢复状态,适合在分布式或中断恢复的训练流程中作为进度追踪依据。该数据集设计兼容Mimi编解码器与标准ASR训练管线,便于与基于离散语音单元的模型架构无缝集成。
背景与挑战
背景概述
自动语音识别(ASR)作为人机交互的核心技术,长期致力于将连续语音信号高效映射为自然语言文本。为应对多源语音数据的异质性及训练稳定性问题,Kupe-ASR-EN-Data数据集应运而生,由研究团队于近期构建,专注于英语语音识别任务。该数据集提供原始24kHz单声道音频与Mimi神经音频编解码器提取的离散码本(c0-c7,12.5Hz)双配置,旨在探索基于离散语音表示的ASR新范式。其核心研究问题在于验证Mimi编码对语音识别性能的影响,并推动低资源、高效率的ASR系统发展,为相关领域提供了标准化的数据基准与评估平台。
当前挑战
在语音识别领域,传统ASR系统面临背景噪声、口音变异及说话人差异等固有挑战,而本数据集进一步引入了离散语音编码带来的信息损失与重建难题。构建过程中,需确保原始音频与Mimi码本之间的时序对齐与语义一致性,同时管理约20-25个分片Parquet文件的存储与加载,以规避HuggingFace Hub的配额限制。此外,编解码器参数固定导致的数据分布偏移,以及文本标注的准确性与覆盖率问题,均为数据集的可靠性与泛化能力带来显著挑战。
常用场景
经典使用场景
在自动语音识别(ASR)的模型训练与评测中,kupe-asr-en-data数据集以其双配置架构为声学建模提供了经典范式。该数据集经典使用场景聚焦于端到端语音识别系统的训练,研究者可通过`mimi`配置直接加载Mimi编码的离散语音表征进行高效训练,或利用`raw`配置获取24 kHz单声道英文音频与对应文本进行传统特征提取与声学模型构建。这一设计使得数据加载与模型迭代无缝衔接,成为语音识别研究中平衡计算效率与识别精度的典型数据资源。
解决学术问题
该数据集有效回应了语音识别领域长期存在的表征效率与训练稳定性难题。通过Mimi编码将连续音频压缩为12.5 Hz的离散码本序列,显著降低了序列长度,缓解了传统帧级建模中的冗余计算与长时依赖挑战,为探索离散语音表征学习、自监督预训练以及低资源条件下的声学建模提供了可控实验平台。其意义在于推动了语音识别从连续特征向离散令牌范式的转变,为后续研究提供了可复现的基准数据。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,包括基于Mimi离散编码的语音识别模型(如Mimi-ASR与Lumma架构)的基准测试与改进、面向低比特率语音传输的令牌级语言建模,以及利用`raw`配置开展的语音增强与说话人自适应研究。这些工作进一步拓展了数据集在跨模态语音-文本对齐、多任务语音理解以及轻量化部署方面的应用边界,形成了以kupe-asr-en-data为核心的语音表征学习生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务