遇见数据集

kupe-spark-asr-270m-data

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

kupe-spark-asr-270m-data 是一个多语言自动语音识别(ASR)语料库,专为 kupe-spark-asr-270m 模型(基于 Gemma-3-270m 和 Mimi 编解码器)训练而设计。数据集包含六种语言:英语(en)、印地语(hi)、古吉拉特语(gu)、孟加拉语(bn)、乌尔都语(ur)和马拉地语(mr)。数据以两种配置提供: - **audio**:原始语音,重采样为24kHz单声道,存储为Parquet格式(audio/data/*.parquet)。 - **mimi**:Mimi编解码器第0码本的token序列(每秒12.5个token)以及对应的转录文本,存储为Parquet格式(mimi/*.parquet)。该配置用于模型训练。 数据分片逐步上传,并保留恢复状态文件(audio/fetch_state.json)。数据来源包括:ai4bharat/IndicVoices、ARTPARK-IISc/Vaani-transcription-part、mozilla-foundation/common_voice_17_0 和 MLCommons/peoples_speech。用户可通过Hugging Face Datasets库加载数据。

kupe-spark-asr-270m-data is a multilingual automatic speech recognition (ASR) corpus, designed for training the kupe-spark-asr-270m model (based on Gemma-3-270m and Mimi codec). It contains six languages: English (en), Hindi (hi), Gujarati (gu), Bengali (bn), Urdu (ur), and Marathi (mr). Data is provided in two configurations: audio (raw speech resampled to 24kHz mono, stored as Parquet) and mimi (Mimi codec codebook 0 token sequences with corresponding transcripts, stored as Parquet). Data sources include: ai4bharat/IndicVoices, ARTPARK-IISc/Vaani-transcription-part, mozilla-foundation/common_voice_17_0, and MLCommons/peoples_speech. The data is uploaded in shards with a fetch state file.

创建时间:
2026-09-04
原始信息汇总

kupe-spark-asr-270m-data 数据集概述

基本信息

  • 数据集名称:kupe-spark-asr-270m-data
  • 用途:多语言自动语音识别(ASR)语料库,用于训练 kupe-spark-asr-270m 模型(Gemma-3-270m + Mimi codec)

支持语言

该数据集涵盖以下六种语言:

  • 英语(English)
  • 印地语(Hindi)
  • 古吉拉特语(Gujarati)
  • 孟加拉语(Bengali)
  • 乌尔都语(Urdu)
  • 马拉地语(Marathi)

数据集配置(Configs)

该数据集包含两种配置:

  1. audio 配置

    • 内容:原始语音,已重采样为 24 kHz 单声道
    • 文件格式:Parquet(路径:audio/data/*.parquet
    • 用途:提供原始音频数据
  2. mimi 配置

    • 内容:Mimi 码本-0 令牌(12.5 令牌/秒)及对应的文本转写
    • 文件格式:Parquet(路径:mimi/*.parquet
    • 用途:用于模型训练

使用方式

可通过 Hugging Face datasets 库加载数据:

python from datasets import load_dataset

audio = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "audio", split="train") mimi = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "mimi", split="train")

数据来源

该数据集整合自以下多个语音语料库:

  • ai4bharat/IndicVoices
  • ARTPARK-IISc/Vaani-transcription-part
  • mozilla-foundation/common_voice_17_0
  • MLCommons/peoples_speech

注意:各数据源拥有各自的许可证,使用时需参照相应来源的许可条款。

其他说明

  • 数据分片(shards)按获取进度逐一上传
  • 获取状态记录在 audio/fetch_state.json 文件中
搜集汇总
数据集介绍
kupe-spark-asr-270m-data 数据集图片
构建方式
该数据集专为多语言自动语音识别(ASR)模型训练而构建,源于多个权威开源语音语料库,涵盖英语、印地语、古吉拉特语、孟加拉语、乌尔都语及马拉地语六种语言。数据构建遵循精细的流水线:初始语音被统一重采样至24 kHz单声道,以确保采样率一致性;随后,采用Mimi编解码器将波形转换为12.5 Hz的码本0令牌,以适配模型的高效训练。最终数据被划分并存储为两种配置:'audio'配置保留原始波形,而'mimi'配置包含令牌序列与对应文本转录。分片文件通过增量上传方式管理,便于数据追溯与状态恢复。
特点
数据集的显著特点在于其双模态结构设计,融合了传统语音样本与压缩表示。'audio'配置提供高保真原始语音,支持直接波形输入处理,而'mimi'配置则以紧凑的码本令牌形式呈现语音内容,大幅降低存储与计算开销,特别适用于序列到序列模型的端到端训练。数据集覆盖六种语言,其中包含资源较少的印度语族语言,增强了其在多语言及代码转换任务中的适用性。此外,详尽的元数据(如采样率、令牌率)和透明的数据来源(IndicVoices、Common Voice等)赋予其高度的可复现性与可扩展性。
使用方法
使用者可通过HuggingFace的datasets库便捷加载,仅需指定配置名称('audio'或'mimi')即可获取相应数据结构。对于波形级模型,推荐使用'audio'配置,其中parquet文件包含原始音频数组;对于基于token的ASR系统,则采用'mimi'配置,其内含码本令牌序列与转录文本,可直接用于生成训练批次。加载后的数据集可无缝集成至PyTorch或TensorFlow的DataLoader中,支持流式分片读取以应对大规模训练需求。需注意,原始数据来源于不同项目,各自遵循其许可证,使用时务必核实各源数据的版权与引用要求。
背景与挑战
背景概述
该数据集由Anuj等研究人员于2025年创建,旨在支持kupe-spark-asr-270m多语言自动语音识别模型的训练,该模型基于Gemma-3-270m语言模型与Mimi音频编解码器。数据集覆盖英语、印地语、古吉拉特语、孟加拉语、乌尔都语和马拉地语六种语言,整合了IndicVoices、Vaani-transcription-part、Common Voice 17.0及People's Speech等公开语音资源,形成约270万小时的高质量多语言语料。其发布填补了低资源印地语及印度次大陆语言在端到端语音识别研究中的数据空白,为多语言ASR系统提供了标准化的训练与评估基准,对推动多语言语音技术的应用具有重要意义。
当前挑战
该数据集面对的挑战主要涉及多语言语音识别的核心难题:音系差异、口音变化、噪声鲁棒性及低资源语言的稀疏数据,需在统一模型架构下平衡各语言性能。构建过程中则遭遇多重技术瓶颈,包括从异构公共语料中清洗不一致的标注、统一采样率为24kHz并消除静音与重叠语音、对齐Mimi编解码器生成12.5Hz的codebook-0令牌与文本转录、以及管理海量分片数据的持续上传与断点续传状态,确保训练集与测试集的分布一致性,此外还需妥善处理不同来源的许可协议以合规发布。
常用场景
经典使用场景
kupe-spark-asr-270m-data数据集专为多语种自动语音识别(ASR)模型的训练与评估而构建,覆盖英语及五种印度语言(印地语、古吉拉特语、孟加拉语、乌尔都语、马拉地语)。其经典使用场景在于为端到端ASR系统提供大规模、多样化的语音数据,尤其适用于基于神经编解码器(如Mimi codec)的语音识别架构。研究者可借此数据训练语音到文本的映射模型,亦可利用其对应的离散声学标记进行语言建模实验,从而在多语种、低资源场景下优化识别性能与泛化能力。
解决学术问题
该数据集解决了多语种ASR研究中数据稀缺与分布不均的关键问题,特别是在印度次大陆的多种低资源语言上。通过整合IndicVoices、Common Voice等权威来源,它提供了大规模、带文本标注的语音样本,支持跨语言声学模型训练、语言自适应及迁移学习研究。其设计促使学界深入探讨多语种联合建模的有效性,以及离散语音标记在提升解码效率与鲁棒性方面的潜力,有力推动了低资源语种语音识别技术的学术进步。
衍生相关工作
围绕此数据集,已衍生出多项相关研究与实践,包括多语种语音识别基准的构建、语音到语音翻译系统的开发,以及基于自监督预训练模型的微调探索。例如,以Mimi codebook标记为基础的训练策略,催生了对抗性解码与紧凑语言模型的新思考;而结合Gemma-3语言模型,则衍生出语音增强与文本生成联合优化的范式。这些工作拓展了语音编码与语言模型融合的边界,为下一代通用语音智能系统铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务