遇见数据集

Taiwan-Tongues-ASR-CE-dataset-test

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

Taiwan-Tongues-ASR-CE测试数据集是Taiwan-Tongues-ASR-CE项目使用的测试数据集,以WebDataset tar分片形式打包,专用于自动语音识别评估。该数据集包含一个多语言核心测试集,涵盖普通话(台湾地区)、台湾闽南语、客家话、英语和印尼语,总计3,852个话语,音频总时长约3.45小时。具体数据分布为:普通话(zh-tw)1,262个话语(1.00小时)、台湾闽南语(zh-nan)827个话语(0.63小时)、客家话(zh-hak)473个话语(0.59小时)、英语(en)687个话语(0.58小时)、印尼语(id)603个话语(0.66小时)。数据集文件包括一个包含所有语言元数据的TSV文件(test.tsv)和一个存储压缩音频分片的目录(test/)。TSV文件包含音频文件名、ASR转录文本、音频文件扩展名、地区代码、句子标识符、数据分割(test)和音频持续时间(秒)等列。音频以MP3格式存储在WebDataset tar分片中,无需解压即可直接流式加载。该数据集适用于多语言自动语音识别模型的评估和基准测试。使用前需注意许可证为other,建议参考项目文档以了解具体使用限制。

The Taiwan-Tongues-ASR-CE test dataset is the test dataset utilized in the Taiwan-Tongues-ASR-CE project, packaged as WebDataset tar shards and exclusively designed for automatic speech recognition (ASR) evaluation. This dataset encompasses a multilingual core test set covering Mandarin (Taiwan region), Taiwanese Minnan, Hakka, English, and Indonesian, with a total of 3,852 utterances and an aggregate audio duration of approximately 3.45 hours. The detailed data distribution is as follows: 1,262 utterances (1.00 hour) for Mandarin (zh-tw), 827 utterances (0.63 hours) for Taiwanese Minnan (zh-nan), 473 utterances (0.59 hours) for Hakka (zh-hak), 687 utterances (0.58 hours) for English (en), and 603 utterances (0.66 hours) for Indonesian (id). The dataset files include a TSV file containing metadata across all languages (test.tsv) and a directory storing compressed audio shards (test/). The TSV file comprises columns such as audio filename, ASR transcript, audio file extension, region code, sentence identifier, data split (test), and audio duration (in seconds). Audios are stored in WebDataset tar shards in MP3 format and can be directly streamed without decompression. This dataset is applicable for the evaluation and benchmark testing of multilingual automatic speech recognition models. Prior to usage, please note that the license is "other", and it is recommended to consult the project documentation for specific usage restrictions.

创建时间:
2026-07-12
原始信息汇总

Taiwan-Tongues-ASR-CE Test Dataset 概述

基本信息

  • 数据集名称:Taiwan-Tongues-ASR-CE Test Dataset
  • 任务类型:自动语音识别(automatic-speech-recognition)
  • 语言:中文(zh)、闽南语(nan)、客家语(hak)、英语(en)、印尼语(id)
  • 数据规模:1,000 < 样本数 < 10,000
  • 许可证:other(其他),使用前请参考项目文档
  • 标签:dginfra, automatic-speech-recognition, webdataset, taiwanese, hakka, indonesian

数据集描述

该数据集是 Taiwan-Tongues-ASR-CE 项目使用的测试数据集,以 WebDataset tar 分片形式打包,用于 ASR 评估。核心测试集为约3小时、4语言的评估集,覆盖普通话、台湾闽南语、客家语和英语。v2.0 印尼语更新后,印尼语(id)测试元数据已合并到统一的 test.tsv 中,印尼语 tar 分片也包含在 test/ 分片目录下。音频文件保留在压缩的 .tar 分片内,未在仓库中展开为单独文件。

数据集统计

数据划分 语言 地区代码 话语数 时长
test 普通话 zh-tw 1,262 1.00 小时
test 台湾闽南语 zh-nan 827 0.63 小时
test 客家语 zh-hak 473 0.59 小时
test 英语 en 687 0.58 小时
test 印尼语 id 603 0.66 小时
总计 3,852 3.45 小时

文件结构

test.tsv test/ test-000000.tar test-000001.tar ...

  • test.tsv:包含所有地区(包括印尼语)的元数据。
  • test/ 目录:包含多个 WebDataset tar 分片文件。

TSV 列说明

列名 描述
audio WebDataset 分片中的音频文件名
transcript ASR 转录文本
audio_ext 音频文件扩展名
locale 地区代码,如 zh-twzh-nanzh-hakenid
sentence_id 每个地区内的句子标识符
split 数据划分,值为 test
duration 音频时长(秒)

使用说明

  • 该数据集专为自动语音识别评估设计。
  • 音频存储在压缩的 WebDataset tar 分片中,使用 WebDataset 流式加载时无需解包。
  • 可通过 pip install webdataset pandas 安装所需库,并使用 WebDataset 直接加载 tar 分片,或使用 pandas 读取 test.tsv 元数据。
搜集汇总
数据集介绍
Taiwan-Tongues-ASR-CE-dataset-test 数据集图片
构建方式
Taiwan-Tongues-ASR-CE-dataset-test 是基于台湾多语种语音识别项目构建的评估测试集,采用 WebDataset 格式将音频文件封装为压缩的 .tar 分片,避免在仓库中展开为独立文件。核心测试集涵盖普通话、台湾闽南语、客家话和英语四种语言,总时长约3小时;在v2.0更新中,印度尼西亚语的测试元数据和音频分片被合并至同一目录下。元数据统一存储于 test.tsv 文件中,包含音频文件名、转录文本、语种代码、句子标识符及时长等字段,便于按语种或分片进行读取与分析。
特点
该数据集集多语种于一身,包含3852条语音样本,总时长达3.45小时,各语种分布均匀,覆盖中文(台湾)、闽南语、客家语、英语及印尼语五种语言。音频以 WebDataset 压缩分片形式存储,支持流式加载,无需预先解压即可高效读取。元数据表结构清晰,字段涵盖音频路径、转录文本、语种代码及音频时长,便于进行按语种统计与评估。数据集专为自动语音识别评估设计,许可信息需参考项目发布文档。
使用方法
使用该数据集时,需安装 WebDataset 与 pandas 库。通过 wds.WebDataset 加载 test/ 目录下的 .tar 分片,直接迭代样本即可获取音频字节与对应转录文本。元数据可借助 pandas 读取 test.tsv 文件,按 locale 字段分组汇总各语种的音频时长。音频文件始终保持在压缩分片内,无需额外解压操作,简化了数据加载流程。详细用法示例可参考 README 中的代码片段。
背景与挑战
背景概述
台湾多语言语音识别测试数据集(Taiwan-Tongues-ASR-CE-dataset-test)由台湾行政院数字发展部主导开发,发布于2023年,旨在为自动语音识别(ASR)系统提供多语言、低资源场景下的标准化评估基准。该数据集聚焦于台湾地区多元语言生态,涵盖普通话、台语、客家话、英语及印度尼西亚语五种语言,总计约3.45小时、3852条语音样本。作为Taiwan-Tongues-ASR-CE项目的核心测试集,其采用WebDataset格式封装,支持高效流式加载,显著降低了大规模语音评估中的数据管理复杂度。该数据集的出现填补了台湾本土多语言ASR评估资源的空白,为研究方言与移民语言的鲁棒识别提供了关键验证平台,推动了小语种语音技术在实际场景中的落地。
当前挑战
该数据集主要面临三重挑战。其一,领域问题层面,台湾地区语言混杂,台语、客家话等方言声学特征与标准汉语差异显著,且存在语码混合现象,传统单一语言ASR系统难以泛化至多语言交错场景,模型需同时处理声学相似性干扰与语言边界模糊问题。其二,构建过程中,数据收集面临稀缺性挑战——各语言时长不均(台语仅0.63小时)、印度尼西亚语语料稀少,且需确保音频质量与转录一致性,避免因方言变体、口音差异引入标注噪声。此外,WebDataset压缩存储虽提升加载效率,但动态解压与流式处理增加了测试环境的兼容性调试成本,尤其对低算力场景下的实时评估构成隐性障碍。
常用场景
经典使用场景
Taiwan-Tongues-ASR-CE-dataset-test作为多语言自动语音识别(ASR)系统的评估基准,承载着检验模型在真实多语混杂环境下鲁棒性的重任。该数据集涵盖了普通话、台湾闽南语、客家语、英语及印度尼西亚语共五种语言,总时长达3.45小时,包含3852条语音样本。其经典使用方式是将WebDataset格式的tar分片直接通过流式加载,结合test.tsv中的元数据进行转录质量评估。研究者常利用该数据集衡量ASR模型在多语种混杂、口音多样性及低资源语言上的表现,尤其是在台湾地区特有的语言生态系统中,为跨语言语音识别技术的优化提供了标准化测试平台。
解决学术问题
该数据集的核心学术贡献在于解决了多语言ASR评测中缺乏统一、多样化测试集的困境。传统语音识别研究往往聚焦于单一语言或标准口音,而台湾多语环境下的语言混合与方言变体长期未被充分建模。通过整合官方语种与社区常用语言,本数据集为研究者提供了评估模型在真实多语场景中混淆度与跨语言迁移能力的实验基础。其意义在于推动了分层式多任务学习、说话者对抗训练及低资源语言模型蒸馏等前沿方法的验证,助力学术界厘清不同语言间的声学与音系冲突机制,进而提升语音系统的包容性与公平性。
衍生相关工作
该数据集已衍生出多项具有代表性的研究工作,其中之一便是作者项目Taiwan-Tongues-ASR-CE中提出的跨语言端到端语音识别框架。该框架利用统一的编码器-解码器架构处理多语言输入,并通过语言特定的适配层缓解不同语言间的声学分布偏移。另一类代表性工作聚焦于语言自适应前端,通过声学特征对齐与音素级对抗学习来提升低资源语言(如客家语)的识别率。此外,研究者还基于该数据集开展了语言混淆条件下的噪声稳健性分析,推动了多语言语音数据的课程学习与数据增强策略创新。这些工作共同拓展了多语言ASR的理论边界,并为后续的语音技术标准化提供了实证支持。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务