Taiwan-Tongues-ASR-CE-dataset-test
收藏资源简介:
Taiwan-Tongues-ASR-CE测试数据集是Taiwan-Tongues-ASR-CE项目使用的测试数据集,以WebDataset tar分片形式打包,专用于自动语音识别评估。该数据集包含一个多语言核心测试集,涵盖普通话(台湾地区)、台湾闽南语、客家话、英语和印尼语,总计3,852个话语,音频总时长约3.45小时。具体数据分布为:普通话(zh-tw)1,262个话语(1.00小时)、台湾闽南语(zh-nan)827个话语(0.63小时)、客家话(zh-hak)473个话语(0.59小时)、英语(en)687个话语(0.58小时)、印尼语(id)603个话语(0.66小时)。数据集文件包括一个包含所有语言元数据的TSV文件(test.tsv)和一个存储压缩音频分片的目录(test/)。TSV文件包含音频文件名、ASR转录文本、音频文件扩展名、地区代码、句子标识符、数据分割(test)和音频持续时间(秒)等列。音频以MP3格式存储在WebDataset tar分片中,无需解压即可直接流式加载。该数据集适用于多语言自动语音识别模型的评估和基准测试。使用前需注意许可证为other,建议参考项目文档以了解具体使用限制。
The Taiwan-Tongues-ASR-CE test dataset is the test dataset utilized in the Taiwan-Tongues-ASR-CE project, packaged as WebDataset tar shards and exclusively designed for automatic speech recognition (ASR) evaluation. This dataset encompasses a multilingual core test set covering Mandarin (Taiwan region), Taiwanese Minnan, Hakka, English, and Indonesian, with a total of 3,852 utterances and an aggregate audio duration of approximately 3.45 hours. The detailed data distribution is as follows: 1,262 utterances (1.00 hour) for Mandarin (zh-tw), 827 utterances (0.63 hours) for Taiwanese Minnan (zh-nan), 473 utterances (0.59 hours) for Hakka (zh-hak), 687 utterances (0.58 hours) for English (en), and 603 utterances (0.66 hours) for Indonesian (id). The dataset files include a TSV file containing metadata across all languages (test.tsv) and a directory storing compressed audio shards (test/). The TSV file comprises columns such as audio filename, ASR transcript, audio file extension, region code, sentence identifier, data split (test), and audio duration (in seconds). Audios are stored in WebDataset tar shards in MP3 format and can be directly streamed without decompression. This dataset is applicable for the evaluation and benchmark testing of multilingual automatic speech recognition models. Prior to usage, please note that the license is "other", and it is recommended to consult the project documentation for specific usage restrictions.
Taiwan-Tongues-ASR-CE Test Dataset 概述
基本信息
- 数据集名称:Taiwan-Tongues-ASR-CE Test Dataset
- 任务类型:自动语音识别(automatic-speech-recognition)
- 语言:中文(zh)、闽南语(nan)、客家语(hak)、英语(en)、印尼语(id)
- 数据规模:1,000 < 样本数 < 10,000
- 许可证:other(其他),使用前请参考项目文档
- 标签:dginfra, automatic-speech-recognition, webdataset, taiwanese, hakka, indonesian
数据集描述
该数据集是 Taiwan-Tongues-ASR-CE 项目使用的测试数据集,以 WebDataset tar 分片形式打包,用于 ASR 评估。核心测试集为约3小时、4语言的评估集,覆盖普通话、台湾闽南语、客家语和英语。v2.0 印尼语更新后,印尼语(id)测试元数据已合并到统一的 test.tsv 中,印尼语 tar 分片也包含在 test/ 分片目录下。音频文件保留在压缩的 .tar 分片内,未在仓库中展开为单独文件。
数据集统计
| 数据划分 | 语言 | 地区代码 | 话语数 | 时长 |
|---|---|---|---|---|
| test | 普通话 | zh-tw |
1,262 | 1.00 小时 |
| test | 台湾闽南语 | zh-nan |
827 | 0.63 小时 |
| test | 客家语 | zh-hak |
473 | 0.59 小时 |
| test | 英语 | en |
687 | 0.58 小时 |
| test | 印尼语 | id |
603 | 0.66 小时 |
| 总计 | 3,852 | 3.45 小时 |
文件结构
test.tsv test/ test-000000.tar test-000001.tar ...
test.tsv:包含所有地区(包括印尼语)的元数据。test/目录:包含多个 WebDataset tar 分片文件。
TSV 列说明
| 列名 | 描述 |
|---|---|
audio |
WebDataset 分片中的音频文件名 |
transcript |
ASR 转录文本 |
audio_ext |
音频文件扩展名 |
locale |
地区代码,如 zh-tw、zh-nan、zh-hak、en、id |
sentence_id |
每个地区内的句子标识符 |
split |
数据划分,值为 test |
duration |
音频时长(秒) |
使用说明
- 该数据集专为自动语音识别评估设计。
- 音频存储在压缩的 WebDataset tar 分片中,使用 WebDataset 流式加载时无需解包。
- 可通过
pip install webdataset pandas安装所需库,并使用 WebDataset 直接加载 tar 分片,或使用 pandas 读取test.tsv元数据。





