遇见数据集

adi-gov-tw/Taiwan-Tongues-ASR-CE-dataset-test

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

Taiwan-Tongues-ASR-CE-dataset-test 是台湾语种ASR-CE项目使用的测试数据集,以WebDataset tar分片形式打包,用于自动语音识别评估。该数据集核心测试集包含约3小时、涵盖四种语言的音频:中文普通话、台湾闽南语、客家语和英语。在v2.0印尼语更新中,印尼语测试元数据已合并到同一个test.tsv文件中,印尼语tar分片也包含在同一test/分片目录下。音频文件存储在压缩的.tar分片中,未在仓库中作为单独文件展开。数据集总计3852条话语,总时长为3.45小时,包括中文普通话(1262条,1.00小时)、台湾闽南语(827条,0.63小时)、客家语(473条,0.59小时)、英语(687条,0.58小时)和印尼语(603条,0.66小时)。数据集旨在用于ASR评估,音频以压缩格式存储,无需解压即可通过WebDataset流式读取,许可证列为其他,使用前需参考项目和发布文档。

Taiwan-Tongues-ASR-CE-dataset-test is the test dataset used by the Taiwan-Tongues-ASR-CE project, packaged as WebDataset tar shards for automatic speech recognition evaluation. The core test set is a roughly 3-hour, 4-language evaluation set for Mandarin Chinese, Taiwanese Hokkien, Hakka, and English. For the v2.0 Indonesian update, the Indonesian test metadata has been merged into the same test.tsv, and the Indonesian tar shards are included under the same test/ shard directory. Audio files remain inside the compressed .tar shards and are not expanded as individual files in the repository. The dataset totals 3,852 utterances with a duration of 3.45 hours, including Mandarin Chinese (1,262 utterances, 1.00 hours), Taiwanese Hokkien (827 utterances, 0.63 hours), Hakka (473 utterances, 0.59 hours), English (687 utterances, 0.58 hours), and Indonesian (603 utterances, 0.66 hours). It is intended for ASR evaluation, with audio stored in compressed format that can be streamed via WebDataset without unpacking; the license is listed as other, and users should refer to project and release documentation before use.

提供机构:
adi-gov-tw
搜集汇总
数据集介绍
adi-gov-tw/Taiwan-Tongues-ASR-CE-dataset-test 数据集图片
构建方式
Taiwan-Tongues-ASR-CE-dataset-test是专为自动语音识别评估而设计的测试数据集,源自Taiwan-Tongues-ASR-CE项目。其构建方式采用WebDataset格式,将音频文件打包为压缩的tar分片,而非以单个文件形式存放于仓库中。核心测试集涵盖约3小时的四种语言(普通话、台语、客家话和英语),总计3,852条语音样本。在v2.0印尼语更新中,印尼语测试元数据被合并至同一份test.tsv文件,其tar分片也纳入同一个test目录下,实现了多语言评估数据的统一管理与高效访问。
特点
该数据集最显著的特点在于其多语言兼容性与高效的存储结构。它集成了五种语言(中文、台语、客家话、英语和印尼语),覆盖台湾地区常见的语言变体,每个语言均提供时间长度近似的音频段,确保评估的均衡性。音频以WebDataset tar分片形式压缩存储,支持流式加载而无需解压,大幅降低存储开销与加载延迟。元数据采用TSV格式,包含音频文件名、转录文本、语言区域代码、句子标识符及音频时长等关键字段,便于按语言分组统计和分析。
使用方法
使用该数据集进行ASR评估时,首先需安装WebDataset与pandas库。通过WebDataset的API可直接从tar分片中流式读取音频字节和对应文本,例如以'wds.WebDataset("test/test-{000000..000028}.tar")'的方式加载。同时,借助pandas读取test.tsv文件,可快速获取各语言的统计信息,如按语言统计总时长。由于音频保留在压缩分片内,无需预先解压,只需结合TSV中的元数据即可高效完成评估流程,极大简化了多语言语音识别任务的实验配置。
背景与挑战
背景概述
在自动语音识别(ASR)领域,多语言和方言识别一直是极具挑战性的研究方向,尤其是对于台湾地区广泛使用的华语、闽南语、客家语以及英语和印尼语等语言。Taiwan-Tongues-ASR-CE-dataset-test数据集由台湾行政院政府数字服务委员会(adi-gov-tw)于近期创建,旨在为多语言ASR系统提供标准化的测试基准。该数据集聚焦于评估模型在五种语言/方言上的识别性能,包括台湾华语(zh-tw)、台湾闽南语(zh-nan)、客家语(zh-hak)、英语(en)和印尼语(id),覆盖总计3852条语音样本,时长约3.45小时。通过提供WebDataset格式的压缩音频分片,该数据集在评估多语言ASR模型的泛化能力和实际部署效果方面具有重要价值,尤其推动了台湾地区本土语言及新住民语言语音技术的进步。
当前挑战
该数据集面临的主要挑战包括:1)多语言与方言声学差异显著,闽南语、客家语等低资源语言的音素系统与华语差异大,且语料稀少,导致ASR模型在跨语言迁移时易产生混淆,识别准确率难以提升。2)音频数据以WebDataset压缩分片形式存储,虽然便于流式加载,但元数据与音频分离,需额外设计高效解耦与对齐机制,增加了数据处理复杂性。3)测试集规模较小(仅3.45小时),且样本分布不均(如客家语仅0.59小时),难以全面评估模型在噪声、口音或真实场景下的鲁棒性,限制了其作为通用基准的可信度。4)许可证标注为“other”,使用者需自行查阅项目文档确认商用与再分发条款,可能阻碍学术与工业界的广泛采用。
常用场景
经典使用场景
Taiwan-Tongues-ASR-CE-dataset-test作为跨语言自动语音识别(ASR)评估的标杆数据集,其核心价值在于提供覆盖中文普通话、台湾闽南语、客家语、英语及印尼语的多语种测试基准。该数据集以WebDataset格式打包,通过压缩的tar分片存储约3.45小时的语音数据,支持流式加载与高效评估。研究者可借助其规范的TSV元数据(包含语言代码、时长、转写文本等字段),系统性地评测ASR模型在台湾地区多元语言生态下的泛化能力与鲁棒性,尤其适用于检验模型对低资源语言(如客家语、闽南语)的识别性能。
衍生相关工作
该数据集衍生了多条研究脉络,包括但不限于基于对比学习的跨语言语音表征预训练(如借鉴XLS-R框架优化台湾方言编码)、聚焦多任务联合优化的端到端多语ASR架构(通过共享编码器与语言适配模块提升识别稳定性),以及针对低资源语言的半监督与自监督微调方法。此外,其测试元数据还催生了面向代码混合场景的语言识别与语音转写联合任务,并启发了利用语种均衡采样策略降低模型偏见的训练范式,为后续多语种语音评测体系的构建提供了范本。
数据集最近研究
最新研究方向
在自动语音识别(ASR)领域,多语言与方言的鲁棒性评估正成为研究热点,尤其是面向台湾地区的语言多样性。Taiwan-Tongues-ASR-CE-dataset-test作为基准测试集,聚焦于普通话、闽南语、客家语、英语及印尼语的混合场景,其紧凑的3.45小时音频设计旨在高效评估模型在跨语言和低资源语种上的泛化能力。结合近期台湾地区活跃的数字化语言保存运动与东南亚语种融入的趋势,该数据集推动了ASR系统在真实多语界面中的公平性验证与误差分析,尤其为WebDataset流式加载技术的应用提供了标准化评估框架,对促进包容性语音技术落地具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务