kupe-spark-asr-270m-data
收藏资源简介:
kupe-spark-asr-270m-data 是一个多语言自动语音识别(ASR)语料库,专为 kupe-spark-asr-270m 模型(基于 Gemma-3-270m 和 Mimi 编解码器)训练而设计。数据集包含六种语言:英语(en)、印地语(hi)、古吉拉特语(gu)、孟加拉语(bn)、乌尔都语(ur)和马拉地语(mr)。数据以两种配置提供: - **audio**:原始语音,重采样为24kHz单声道,存储为Parquet格式(audio/data/*.parquet)。 - **mimi**:Mimi编解码器第0码本的token序列(每秒12.5个token)以及对应的转录文本,存储为Parquet格式(mimi/*.parquet)。该配置用于模型训练。 数据分片逐步上传,并保留恢复状态文件(audio/fetch_state.json)。数据来源包括:ai4bharat/IndicVoices、ARTPARK-IISc/Vaani-transcription-part、mozilla-foundation/common_voice_17_0 和 MLCommons/peoples_speech。用户可通过Hugging Face Datasets库加载数据。
kupe-spark-asr-270m-data is a multilingual automatic speech recognition (ASR) corpus, designed for training the kupe-spark-asr-270m model (based on Gemma-3-270m and Mimi codec). It contains six languages: English (en), Hindi (hi), Gujarati (gu), Bengali (bn), Urdu (ur), and Marathi (mr). Data is provided in two configurations: audio (raw speech resampled to 24kHz mono, stored as Parquet) and mimi (Mimi codec codebook 0 token sequences with corresponding transcripts, stored as Parquet). Data sources include: ai4bharat/IndicVoices, ARTPARK-IISc/Vaani-transcription-part, mozilla-foundation/common_voice_17_0, and MLCommons/peoples_speech. The data is uploaded in shards with a fetch state file.
kupe-spark-asr-270m-data 数据集概述
基本信息
- 数据集名称:kupe-spark-asr-270m-data
- 用途:多语言自动语音识别(ASR)语料库,用于训练 kupe-spark-asr-270m 模型(Gemma-3-270m + Mimi codec)
支持语言
该数据集涵盖以下六种语言:
- 英语(English)
- 印地语(Hindi)
- 古吉拉特语(Gujarati)
- 孟加拉语(Bengali)
- 乌尔都语(Urdu)
- 马拉地语(Marathi)
数据集配置(Configs)
该数据集包含两种配置:
-
audio 配置
- 内容:原始语音,已重采样为 24 kHz 单声道
- 文件格式:Parquet(路径:
audio/data/*.parquet) - 用途:提供原始音频数据
-
mimi 配置
- 内容:Mimi 码本-0 令牌(12.5 令牌/秒)及对应的文本转写
- 文件格式:Parquet(路径:
mimi/*.parquet) - 用途:用于模型训练
使用方式
可通过 Hugging Face datasets 库加载数据:
python from datasets import load_dataset
audio = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "audio", split="train") mimi = load_dataset("anuj-inavlabs/kupe-spark-asr-270m-data", "mimi", split="train")
数据来源
该数据集整合自以下多个语音语料库:
- ai4bharat/IndicVoices
- ARTPARK-IISc/Vaani-transcription-part
- mozilla-foundation/common_voice_17_0
- MLCommons/peoples_speech
注意:各数据源拥有各自的许可证,使用时需参照相应来源的许可条款。
其他说明
- 数据分片(shards)按获取进度逐一上传
- 获取状态记录在
audio/fetch_state.json文件中




