fleurs
收藏资源简介:
提供的README内容描述了一个多语言音频数据集,包含多个配置(af_za、am_et、ar_eg、as_in、ast_es、az_az)。每个配置包含采样率为16000 Hz的音频样本,以及转录文本、原始转录文本、性别信息、语言ID和语言组ID。数据集分为训练集、验证集和测试集,每个集都有指定的字节数和示例数。数据集支持多种语言和方言,分为西欧、东欧、中亚/中东/北非、撒哈拉以南非洲、南亚、东南亚和中日韩(CJK)等语言组。
The accompanying README describes a multilingual audio dataset encompassing multiple configurations (af_za, am_et, ar_eg, as_in, ast_es, az_az). Each configuration contains audio samples with a sampling rate of 16000 Hz, alongside transcription text, original transcription text, gender information, language ID, and language group ID. The dataset is partitioned into training, validation, and test splits, each with specified byte counts and quantities of examples. The dataset supports a wide range of languages and dialects, categorized into language groups including Western European, Eastern European, Central Asian/Middle Eastern/North African, Sub-Saharan African, South Asian, Southeast Asian, and Chinese-Japanese-Korean (CJK).
FLEURS 数据集概述
数据集基本信息
- 数据集名称:FLEURS
- 托管地址:https://huggingface.co/datasets/mteb/fleurs
- 数据格式:多语言语音数据集,每个语言对应一个配置(config)
数据结构与特征
每个语言配置包含以下字段:
- id:整型标识符
- num_samples:整型样本数
- audio:音频数据,采样率为16000 Hz
- transcription:字符串类型转录文本
- raw_transcription:字符串类型原始转录文本
- gender:说话者性别标签(male、female、other)
- lang_id:语言标识符,涵盖103种语言变体
- language:字符串类型语言名称
- lang_group_id:语言组标识符,分为7个地理区域
语言覆盖范围
数据集支持103种语言变体,包括:
- 西欧语言(western_european_we)
- 东欧语言(eastern_european_ee)
- 中亚、中东、北非语言(central_asia_middle_north_african_cmn)
- 撒哈拉以南非洲语言(sub_saharan_african_ssa)
- 南亚语言(south_asian_sa)
- 东南亚语言(south_east_asian_sea)
- 中文、日语、韩语(chinese_japanase_korean_cjk)
数据划分
每个语言配置包含三个标准划分:
- 训练集(train)
- 验证集(validation)
- 测试集(test)
示例语言配置详情
南非荷兰语(af_za)
- 训练集:1,032个样本,839.64 MB
- 验证集:198个样本,147.30 MB
- 测试集:264个样本,207.28 MB
- 下载大小:1.17 GB
- 数据集大小:1.19 GB
阿姆哈拉语(am_et)
- 训练集:3,163个样本,2.56 GB
- 验证集:223个样本,150.57 MB
- 测试集:516个样本,371.84 MB
- 下载大小:3.05 GB
- 数据集大小:3.08 GB
阿拉伯语(ar_eg)
- 训练集:2,104个样本,1.39 GB
- 验证集:295个样本,201.61 MB
- 测试集:428个样本,300.09 MB
- 下载大小:1.88 GB
- 数据集大小:1.90 GB
阿萨姆语(as_in)
- 训练集:2,812个样本,2.47 GB
- 验证集:418个样本,324.75 MB
- 测试集:984个样本,800.24 MB
- 下载大小:3.57 GB
- 数据集大小:3.59 GB
阿斯图里亚斯语(ast_es)
- 训练集:2,511个样本,1.74 GB
- 验证集:398个样本,227.57 MB
- 测试集:946个样本,561.74 MB
- 下载大小:2.51 GB
- 数据集大小:2.53 GB
阿塞拜疆语(az_az)
- 特征结构:与其他配置一致,包含完整语言标签体系
技术规格
- 音频采样率:统一为16,000 Hz
- 数据格式:结构化数据集,支持批量加载和处理
- 标签体系:标准化的分类标签,确保跨语言一致性




