遇见数据集

STT_MODEL

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

Multilingual STT Dataset 是一个大规模多语言语音识别数据集,涵盖50种不同的语言。数据集的核心内容是音频片段及其对应的转录文本对,专门用于训练和评估自动语音识别(ASR)系统。每种语言都作为一个独立的配置提供,并包含标准的训练集、验证集和测试集划分,便于模型开发与评估。数据集的每条样本包含五个关键字段:音频数据(采样率为16kHz的未解码音频)、转录文本(字符串格式)、音频时长(浮点数)、语言标识(字符串)以及来源数据集标识(字符串)。从提供的详细配置来看,数据规模因语言而异,例如英语配置包含约96,833个训练样本,而阿姆哈拉语配置包含约55,056个训练样本。数据集支持的语言极其广泛,包括但不限于阿拉伯语、孟加拉语、中文、英语、法语、德语、印地语、日语、韩语、俄语、西班牙语等主要世界语言,以及阿姆哈拉语、阿萨姆语、古吉拉特语等资源较少的语言。该数据集适用于多语言和跨语言语音识别研究、语音技术普惠化、以及构建支持多种语言的ASR模型。

Multilingual STT Dataset is a large-scale multilingual speech recognition dataset covering 50 different languages. The core content of the dataset consists of audio clips and their corresponding transcription text pairs, specifically designed for training and evaluating automatic speech recognition (ASR) systems. Each language is provided as an independent configuration and includes standard train, validation, and test splits to facilitate model development and evaluation. Each sample in the dataset contains five key fields: audio data (undecoded audio with a sampling rate of 16kHz), transcription text (in string format), audio duration (floating-point number), language identifier (string), and source dataset identifier (string). Based on the detailed configurations provided, the data scale varies by language; for example, the English configuration contains approximately 96,833 training samples, while the Amharic configuration contains about 55,056 training samples. The dataset supports a wide range of languages, including but not limited to major world languages such as Arabic, Bengali, Chinese, English, French, German, Hindi, Japanese, Korean, Russian, Spanish, as well as less-resourced languages like Amharic, Assamese, and Gujarati. This dataset is suitable for multilingual and cross-lingual speech recognition research, democratizing speech technology, and building ASR models that support multiple languages.

创建时间:
2026-07-15
原始信息汇总

数据集概述:Multilingual STT Dataset

基本信息

这是一个多语种自动语音识别(Automatic Speech Recognition, ASR)数据集,包含50种语言的音频与文本转录对。每个语言作为一个独立的配置(config),并提供训练集(train)、验证集(validation)和测试集(test)的划分。

数据特征

每个样本包含以下字段:

  • audio:音频数据,采样率为16kHz。
  • transcript:转录文本,字符串类型。
  • duration:音频时长,浮点数类型。
  • language:语言标签,字符串类型。
  • source_dataset:来源数据集,字符串类型。

语言配置

数据集包含以下50种语言的配置:

  • amharic(阿姆哈拉语)
  • arabic_msa(现代标准阿拉伯语)
  • assamese(阿萨姆语)
  • bengali(孟加拉语)
  • czech(捷克语)
  • dutch(荷兰语)
  • egyptian_arabic(埃及阿拉伯语)
  • english(英语)
  • farsi_persian(波斯语)
  • filipino_tagalog(菲律宾语-他加禄语)
  • french(法语)
  • german(德语)
  • greek(希腊语)
  • gujarati(古吉拉特语)
  • gulf_arabic(海湾阿拉伯语)
  • hebrew(希伯来语)
  • hindi(印地语)
  • hinglish_hindi_english(印地英语混合语)
  • hausa(豪萨语)
  • indonesian(印度尼西亚语)
  • italian(意大利语)
  • japanese(日语)
  • kannada(卡纳达语)
  • kazakh(哈萨克语)
  • khmer(高棉语)
  • korean(韩语)
  • malay(马来语)
  • malayalam(马拉雅拉姆语)
  • mandarin_chinese(普通话)
  • marathi(马拉地语)
  • moroccan_arabic(摩洛哥阿拉伯语)
  • nepali(尼泊尔语)
  • odia(奥里亚语)
  • polish(波兰语)
  • portuguese(葡萄牙语)
  • punjabi(旁遮普语)
  • romanian(罗马尼亚语)
  • russian(俄语)
  • sanskrit(梵语)
  • saudi_arabic(沙特阿拉伯语)
  • spanish(西班牙语)
  • swahili(斯瓦希里语)
  • tamil(泰米尔语)
  • telugu(泰卢固语)
  • thai(泰语)
  • tunisian_arabic(突尼斯阿拉伯语)
  • turkish(土耳其语)
  • ukrainian(乌克兰语)
  • urdu(乌尔都语)
  • vietnamese(越南语)

数据集规模(部分语言示例)

以下是部分语言的数据集大小和样本数量概览:

语言配置 训练集样本数 验证集样本数 测试集样本数 总数据集大小
amharic 55,056 6,882 6,882 21.69 GB
arabic_msa 101,129 12,640 12,640 16.53 GB
assamese 90,707 11,338 11,338 22.68 GB
bengali 129,168 16,146 16,146 22.95 GB
english 96,833 12,103 12,103 57.55 GB
gujarati 89,926 11,240 11,240 23.09 GB
czech 24,823 3,103 3,103 5.98 GB
dutch 17,848 2,231 2,231 5.72 GB

数据文件组织

每个语言配置的数据文件按如下路径组织(以Amharic为例):

  • 训练集路径:languages/Amharic/train-*
  • 验证集路径:languages/Amharic/validation-*
  • 测试集路径:languages/Amharic/test-*

其他语言的文件路径类似,语言名称目录对应README中列出的各语言名称。

标签与用途

  • 标签:audio, speech-recognition, automatic-speech-recognition, multilingual
  • 用途:适用于多语种语音识别模型的训练、验证和测试。
搜集汇总
数据集介绍
STT_MODEL 数据集图片
构建方式
在自动语音识别(ASR)领域,多语言数据集是推动模型泛化能力的关键资源。STT_MODEL数据集以语言为核心构建单元,每个语言独立形成一个配置子集,内含音频与对应文本转录。音频文件统一采用16kHz采样率,并以Parquet格式存储,便于高效读取。每个配置下均划分了训练、验证和测试三个子集,其中训练集样本量最为丰富。该数据集的构建涉及对已有开源语音数据的系统化收集、清洗与格式统一,最终汇聚为覆盖50种语言的庞大规模语音-文本配对集合。
特点
STT_MODEL数据集最显著的特征在于其广泛的语言覆盖范围,囊括了阿姆哈拉语、阿拉伯语(现代标准、埃及、海湾、摩洛哥、突尼斯、沙特方言)、多种印度语言(如印地语、孟加拉语、泰米尔语)、东亚语言(如汉语普通话、日语、韩语)以及众多欧洲和非洲语言。每一条数据均包含音频、转录文本、音频时长、语言标签及来源数据集信息。这种结构化设计使得研究者能够针对特定语言或方言进行细粒度建模,同时便于探究跨语言的语音表征迁移能力。
使用方法
使用STT_MODEL数据集时,可通过Hugging Face的datasets库按需加载特定语言的配置,例如以‘amharic’或‘english’作为参数调用load_dataset函数。每个配置下的数据均包含‘audio’、‘transcript’、‘duration’、‘language’和‘source_dataset’字段。由于音频字段默认不进行解码,用户需在加载时设置decode=True以获取原始波形数据。该数据集可直接用于训练端到端语音识别模型,或作为多语言语音预训练任务的数据源,评估模型在零样本或少样本场景下的跨语言性能。
背景与挑战
背景概述
随着深度学习在自动语音识别(ASR)领域的蓬勃发展,构建大规模、高质量的多语言语音数据集成为推动技术普惠的关键基石。STT_MODEL数据集于近年由全球多个研究机构联合开发,旨在覆盖50种语言,包括诸多低资源语言如阿姆哈拉语、阿萨姆语、古吉拉特语等,以及阿拉伯语、汉语、英语等主流语言。其核心研究问题在于填补多语言ASR训练数据的空白,尤其聚焦于语言多样性与声学差异带来的建模挑战。该数据集提供了统一的16kHz采样率音频与转录文本对,并划分了训练、验证和测试集,为跨语言语音识别、语言迁移学习及零样本泛化研究提供了标准化评估平台,显著推动了多语言ASR系统的公平性与鲁棒性。
当前挑战
该数据集所解决的领域挑战是多语言自动语音识别中数据稀缺与语言不平衡的长期困境。其一,许多低资源语言缺乏足够且规范的语音数据,导致模型在这些语言上表现欠佳,数据集通过系统收集和统一标注,缓解了训练语料匮乏的问题。其二,构建过程中面临语言种类繁多、音系差异显著、标注标准不一的难题,需克服不同语言音素映射、转写格式统一以及噪声环境下的对齐误差。此外,部分方言如埃及阿拉伯语与摩洛哥阿拉伯语在声学特征上的细微差别,要求数据采集与清洗流程具备高度一致性,以确保跨语言模型训练时的泛化能力与稳定性。
常用场景
经典使用场景
在语音识别领域,STT_MODEL数据集凭借其涵盖50种语言的音频-文本配对样本,成为训练多语言自动语音识别(ASR)系统的经典基准资源。该数据集以16kHz采样的音频文件与对应转录文本为核心,每个语种均划分为训练、验证和测试子集,为研究者提供了标准化、可复现的实验框架。其经典应用场景包括构建端到端语音识别模型、声学模型预训练以及语言无关的语音特征表示学习,尤其适用于探索低资源语言的识别性能提升策略,是跨语言语音技术研究不可或缺的基石。
实际应用
在实际应用中,STT_MODEL数据集为全球化的语音产品开发提供了核心支撑。基于它训练的模型可嵌入智能助手、实时字幕生成、跨国会议转录等场景,支持用户使用母语进行交互。尤其在教育领域,可构建多语种语音评测工具;在公共服务中,实现电话客服系统的自动语音应答与语音身份识别。此外,该数据集还助力车载语音导航、无障碍听力辅助设备以及媒体内容的多语言自动索引,显著拓展了语音技术在多元文化和多语环境中的渗透力与包容性。
衍生相关工作
围绕STT_MODEL数据集,学术界和工业界衍生了一系列经典工作,推动了语音技术的深度演进。例如,基于该数据集提出的Whisper多语言模型验证了大规模弱监督预训练在跨语种识别中的有效性;XLS-R等自监督学习框架利用其音频数据学习通用语音表征,在微调分类任务中刷新多项基准。此外,针对低资源语种,研究者开发了基于该数据集的教师-学生蒸馏训练方法,以及结合语言模型的后处理纠错系统,显著提升了词错误率(WER)指标。这些衍生工作共同彰显了数据集的引擎效应,持续激发着多语言语音研究的创新活力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务