Voices-in-the-Wild-2M
收藏资源简介:
# Voices in the Wild Voices in the Wild is an automatic speech recognition dataset for robustness training and evaluation under diverse acoustic conditions. Audio files use public sequential names and are grouped only by normalized acoustic subset. ## Data Fields - `file_name`: relative path to the audio file. - `audio_path`: audio path retained for local tooling. - `text`: transcription alias copied from `answer`. - `answer`: reference transcription. - `question`: transcription instruction. - `subset`: normalized acoustic condition category. - `prediction`: empty placeholder for model output. - `name`: public sample identifier. - `index`: integer sample index. ## Dataset Size - Total examples: 645925 - Subset categories: 54 ## Loading ```python from datasets import load_dataset, Audio ds = load_dataset("audiofolder", data_dir="/path/to/Voices-in-the-Wild") ds = ds.cast_column("audio", Audio()) print(ds["train"][0]) ```



