STT_MODEL
收藏资源简介:
Multilingual STT Dataset 是一个大规模多语言语音识别数据集,涵盖50种不同的语言。数据集的核心内容是音频片段及其对应的转录文本对,专门用于训练和评估自动语音识别(ASR)系统。每种语言都作为一个独立的配置提供,并包含标准的训练集、验证集和测试集划分,便于模型开发与评估。数据集的每条样本包含五个关键字段:音频数据(采样率为16kHz的未解码音频)、转录文本(字符串格式)、音频时长(浮点数)、语言标识(字符串)以及来源数据集标识(字符串)。从提供的详细配置来看,数据规模因语言而异,例如英语配置包含约96,833个训练样本,而阿姆哈拉语配置包含约55,056个训练样本。数据集支持的语言极其广泛,包括但不限于阿拉伯语、孟加拉语、中文、英语、法语、德语、印地语、日语、韩语、俄语、西班牙语等主要世界语言,以及阿姆哈拉语、阿萨姆语、古吉拉特语等资源较少的语言。该数据集适用于多语言和跨语言语音识别研究、语音技术普惠化、以及构建支持多种语言的ASR模型。
Multilingual STT Dataset is a large-scale multilingual speech recognition dataset covering 50 different languages. The core content of the dataset consists of audio clips and their corresponding transcription text pairs, specifically designed for training and evaluating automatic speech recognition (ASR) systems. Each language is provided as an independent configuration and includes standard train, validation, and test splits to facilitate model development and evaluation. Each sample in the dataset contains five key fields: audio data (undecoded audio with a sampling rate of 16kHz), transcription text (in string format), audio duration (floating-point number), language identifier (string), and source dataset identifier (string). Based on the detailed configurations provided, the data scale varies by language; for example, the English configuration contains approximately 96,833 training samples, while the Amharic configuration contains about 55,056 training samples. The dataset supports a wide range of languages, including but not limited to major world languages such as Arabic, Bengali, Chinese, English, French, German, Hindi, Japanese, Korean, Russian, Spanish, as well as less-resourced languages like Amharic, Assamese, and Gujarati. This dataset is suitable for multilingual and cross-lingual speech recognition research, democratizing speech technology, and building ASR models that support multiple languages.
数据集概述:Multilingual STT Dataset
基本信息
这是一个多语种自动语音识别(Automatic Speech Recognition, ASR)数据集,包含50种语言的音频与文本转录对。每个语言作为一个独立的配置(config),并提供训练集(train)、验证集(validation)和测试集(test)的划分。
数据特征
每个样本包含以下字段:
- audio:音频数据,采样率为16kHz。
- transcript:转录文本,字符串类型。
- duration:音频时长,浮点数类型。
- language:语言标签,字符串类型。
- source_dataset:来源数据集,字符串类型。
语言配置
数据集包含以下50种语言的配置:
- amharic(阿姆哈拉语)
- arabic_msa(现代标准阿拉伯语)
- assamese(阿萨姆语)
- bengali(孟加拉语)
- czech(捷克语)
- dutch(荷兰语)
- egyptian_arabic(埃及阿拉伯语)
- english(英语)
- farsi_persian(波斯语)
- filipino_tagalog(菲律宾语-他加禄语)
- french(法语)
- german(德语)
- greek(希腊语)
- gujarati(古吉拉特语)
- gulf_arabic(海湾阿拉伯语)
- hebrew(希伯来语)
- hindi(印地语)
- hinglish_hindi_english(印地英语混合语)
- hausa(豪萨语)
- indonesian(印度尼西亚语)
- italian(意大利语)
- japanese(日语)
- kannada(卡纳达语)
- kazakh(哈萨克语)
- khmer(高棉语)
- korean(韩语)
- malay(马来语)
- malayalam(马拉雅拉姆语)
- mandarin_chinese(普通话)
- marathi(马拉地语)
- moroccan_arabic(摩洛哥阿拉伯语)
- nepali(尼泊尔语)
- odia(奥里亚语)
- polish(波兰语)
- portuguese(葡萄牙语)
- punjabi(旁遮普语)
- romanian(罗马尼亚语)
- russian(俄语)
- sanskrit(梵语)
- saudi_arabic(沙特阿拉伯语)
- spanish(西班牙语)
- swahili(斯瓦希里语)
- tamil(泰米尔语)
- telugu(泰卢固语)
- thai(泰语)
- tunisian_arabic(突尼斯阿拉伯语)
- turkish(土耳其语)
- ukrainian(乌克兰语)
- urdu(乌尔都语)
- vietnamese(越南语)
数据集规模(部分语言示例)
以下是部分语言的数据集大小和样本数量概览:
| 语言配置 | 训练集样本数 | 验证集样本数 | 测试集样本数 | 总数据集大小 |
|---|---|---|---|---|
| amharic | 55,056 | 6,882 | 6,882 | 21.69 GB |
| arabic_msa | 101,129 | 12,640 | 12,640 | 16.53 GB |
| assamese | 90,707 | 11,338 | 11,338 | 22.68 GB |
| bengali | 129,168 | 16,146 | 16,146 | 22.95 GB |
| english | 96,833 | 12,103 | 12,103 | 57.55 GB |
| gujarati | 89,926 | 11,240 | 11,240 | 23.09 GB |
| czech | 24,823 | 3,103 | 3,103 | 5.98 GB |
| dutch | 17,848 | 2,231 | 2,231 | 5.72 GB |
数据文件组织
每个语言配置的数据文件按如下路径组织(以Amharic为例):
- 训练集路径:
languages/Amharic/train-* - 验证集路径:
languages/Amharic/validation-* - 测试集路径:
languages/Amharic/test-*
其他语言的文件路径类似,语言名称目录对应README中列出的各语言名称。
标签与用途
- 标签:audio, speech-recognition, automatic-speech-recognition, multilingual
- 用途:适用于多语种语音识别模型的训练、验证和测试。




