FluidInference/fleurs
收藏资源简介:
# FLEURS Test Dataset Reorganized FLEURS test dataset with audio and transcripts together. ## Structure ``` fleurs-test/ ├── en_us/ │ ├── en_us_0000.wav │ ├── en_us_0001.wav │ ├── ... │ ├── en_us.trans.txt (LibriSpeech format) │ ├── en_us.csv (detailed metadata) │ └── en_us.json (JSON metadata) ├── fr_fr/ │ └── ... └── ... ``` ## Languages - **bg_bg**: 350 test samples - **cs_cz**: 350 test samples - **da_dk**: 930 test samples - **de_de**: 350 test samples - **el_gr**: 650 test samples - **en_us**: 350 test samples - **es_419**: 350 test samples - **et_ee**: 893 test samples - **fi_fi**: 918 test samples - **fr_fr**: 350 test samples - **hr_hr**: 350 test samples - **hu_hu**: 905 test samples - **it_it**: 350 test samples - **lt_lt**: 986 test samples - **lv_lv**: 851 test samples - **mt_mt**: 926 test samples - **nl_nl**: 350 test samples - **pl_pl**: 350 test samples - **pt_br**: 350 test samples - **ro_ro**: 883 test samples - **ru_ru**: 350 test samples - **sk_sk**: 350 test samples - **sl_si**: 834 test samples - **sv_se**: 759 test samples - **uk_ua**: 350 test samples **Total**: 14435 test files across 25 languages ## File Formats - `.wav`: Audio files (16kHz, mono) - `.trans.txt`: Transcriptions in LibriSpeech format - `.csv`: Detailed metadata with all fields - `.json`: JSON format metadata
The FLEURS Test Dataset is reorganized with audio and transcripts together, containing 14435 test files across 25 languages. The dataset is organized by language, providing .wav audio files, LibriSpeech format transcription texts, detailed metadata files, and JSON format metadata files.




