遇见数据集

FluidInference/fleurs

收藏
Hugging Face2025-08-24 更新2025-09-13 收录
官方服务:

资源简介:

# FLEURS Test Dataset Reorganized FLEURS test dataset with audio and transcripts together. ## Structure ``` fleurs-test/ ├── en_us/ │ ├── en_us_0000.wav │ ├── en_us_0001.wav │ ├── ... │ ├── en_us.trans.txt (LibriSpeech format) │ ├── en_us.csv (detailed metadata) │ └── en_us.json (JSON metadata) ├── fr_fr/ │ └── ... └── ... ``` ## Languages - **bg_bg**: 350 test samples - **cs_cz**: 350 test samples - **da_dk**: 930 test samples - **de_de**: 350 test samples - **el_gr**: 650 test samples - **en_us**: 350 test samples - **es_419**: 350 test samples - **et_ee**: 893 test samples - **fi_fi**: 918 test samples - **fr_fr**: 350 test samples - **hr_hr**: 350 test samples - **hu_hu**: 905 test samples - **it_it**: 350 test samples - **lt_lt**: 986 test samples - **lv_lv**: 851 test samples - **mt_mt**: 926 test samples - **nl_nl**: 350 test samples - **pl_pl**: 350 test samples - **pt_br**: 350 test samples - **ro_ro**: 883 test samples - **ru_ru**: 350 test samples - **sk_sk**: 350 test samples - **sl_si**: 834 test samples - **sv_se**: 759 test samples - **uk_ua**: 350 test samples **Total**: 14435 test files across 25 languages ## File Formats - `.wav`: Audio files (16kHz, mono) - `.trans.txt`: Transcriptions in LibriSpeech format - `.csv`: Detailed metadata with all fields - `.json`: JSON format metadata

The FLEURS Test Dataset is reorganized with audio and transcripts together, containing 14435 test files across 25 languages. The dataset is organized by language, providing .wav audio files, LibriSpeech format transcription texts, detailed metadata files, and JSON format metadata files.

提供机构:
FluidInference
搜集汇总
数据集介绍
FluidInference/fleurs 数据集图片
背景与挑战
背景概述
该数据集是FLEURS测试数据集,专注于多语言音频和转录任务,包含25种语言,总计14435个测试样本,文件总大小为5.34 GB。数据集提供音频文件(.wav格式)和转录文件(如LibriSpeech格式的.trans.txt),适用于语音识别和语言处理研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务