Peacockery/tajik-asr-corpus-v0
收藏资源简介:
Tajik ASR Corpus v0 是一个塔吉克语自动语音识别语料库,版本为v0。它通过去重处理,从多个源数据集组装而成,包括FLEURS衍生的语音数据、Mozilla Common Voice 25的塔吉克语部分以及Muhtasham Tajik ASR增强数据。数据集格式包括每个分割(如训练、开发、测试)的TSV文件(data.tsv)和音频目录(audio/),TSV列涵盖id、音频文件名、原始转录、转录、字符数、音频字节、来源、来源ID和重复计数。此外,还提供了一个SQLite数据库(tajik_asr_combined.sqlite),用于本地管理,包含标准化文本、来源分割和来源元数据JSON。数据集规模为:训练集1,885行,开发集263行,测试集441行;去重后各源数据贡献行数为:fleurs_tg_tj 1,815行,common_voice_25_tg 572行,muhtasham_tajik_asr_augmented_test 200行,shunyalabs_tajik_speech_dataset 2行。
Tajik ASR Corpus v0 is a deduplicated Tajik automatic speech recognition corpus assembled from FLEURS-derived speech data, Mozilla Common Voice 25 Tajik, and Muhtasham Tajik ASR augmented data. The dataset format includes a TSV file (data.tsv) and an audio directory for each split (train, dev, test), with TSV columns such as id, audio_filename, raw_transcription, transcription, characters, audio_bytes, source, source_id, and duplicate_count. It also provides an SQLite database (tajik_asr_combined.sqlite) for local curation, containing normalized_text, source_split, and source_metadata_json. The dataset counts are: train split with 1,885 rows, dev split with 263 rows, test split with 441 rows; after deduplication, source contributions are: fleurs_tg_tj with 1,815 rows, common_voice_25_tg with 572 rows, muhtasham_tajik_asr_augmented_test with 200 rows, and shunyalabs_tajik_speech_dataset with 2 rows.




