遇见数据集

Taiwan-Tongues-ASR-CE-dataset-id

收藏
Hugging Face2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

Taiwan-Tongues-ASR-CE-dataset-id 是一个用于自动语音识别(ASR)训练的印尼语语音数据集,属于Taiwan-Tongues-ASR-CE项目的一部分。该数据集以WebDataset tar分片格式打包,支持高效流式加载,音频文件存储在压缩的tar分片内,无需预先解压。它包含约20小时的印尼语语音,具体由17,897条话语组成,总时长为20.02小时。元数据存储在train.tsv文件中,包含以下字段:audio(音频文件名)、transcript(ASR转录文本)、audio_ext(音频文件扩展名)、locale(语言代码,固定为id)、sentence_id(句子标识符)、split(数据集划分,固定为train)和duration(音频时长,单位为秒)。数据集适用于自动语音识别模型的训练和微调任务,但许可证标记为other,使用前建议参考项目文档了解具体的分发和使用限制。

Taiwan-Tongues-ASR-CE-dataset-id is an Indonesian speech dataset for automatic speech recognition (ASR) training, part of the Taiwan-Tongues-ASR-CE project. It is packaged in WebDataset tar shard format for efficient streaming loading, with audio files stored in compressed tar shards without the need for pre-extraction. The dataset contains approximately 20 hours of Indonesian speech, specifically consisting of 17,897 utterances with a total duration of 20.02 hours. Metadata is stored in the train.tsv file, including fields such as audio (audio file name), transcript (ASR transcription text), audio_ext (audio file extension), locale (language code, fixed as id), sentence_id (sentence identifier), split (dataset split, fixed as train), and duration (audio duration in seconds). The dataset is suitable for training and fine-tuning automatic speech recognition models, but its license is marked as other, and it is recommended to refer to the project documentation for specific distribution and usage restrictions.

创建时间:
2026-07-12
原始信息汇总

数据集名称

Taiwan-Tongues-ASR-CE-dataset-id

任务类别

自动语音识别(ASR)

语言

印度尼西亚语(id

数据集规模

训练集包含 17,897 条话语,总时长为 20.02 小时

数据划分

划分 语言 地区 话语数 时长
train 印度尼西亚语 id 17,897 20.02 小时

文件结构

  • train.tsv:训练集的元数据文件。
  • train/:包含多个 WebDataset 压缩 tar 分片(如 train-000000.tartrain-000001.tar 等),音频文件以压缩形式存储于其中,未单独解压。

TSV 元数据列说明

列名 说明
audio 音频文件在 WebDataset 分片中的文件名
transcript ASR 转录文本
audio_ext 音频文件扩展名
locale 地区代码,固定为 id
sentence_id 句子在划分内的标识符
split 数据集划分,固定为 train
duration 音频时长(秒)

使用方式

  • 安装 webdatasetpandas 后,可直接通过 WebDataset 流式加载 tar 分片,无需解压。

  • 示例代码: python import webdataset as wds dataset = wds.WebDataset("train/train-{000000..000119}.tar") for sample in dataset: audio_bytes = sample["mp3"] transcript = sample["txt"].decode("utf-8")

  • 可通过 pandas 读取 train.tsv 查看元数据。

备注

  • 该数据集专为自动语音识别训练和微调设计。
  • 音频以压缩格式存储在 WebDataset tar 分片中,可直接流式读取。
  • 许可证为 other,商业使用或再分发前请查阅项目文档。

项目来源

项目主页:Taiwan-Tongues-ASR-CE

搜集汇总
数据集介绍
Taiwan-Tongues-ASR-CE-dataset-id 数据集图片
构建方式
Taiwan-Tongues-ASR-CE-dataset-id 是台湾多语言语音识别项目 Taiwan-Tongues-ASR-CE 的印尼语子集,专为自动语音识别训练而设计。该数据集采用 WebDataset 格式打包为 tar 分片文件,音频数据压缩存储于分片内部,不展开为独立文件。数据集包含约 20 小时的印尼语语音,共计 17,897 条 utterances,所有音频均以 mp3 格式保存。元数据以 TSV 文件形式提供,记录了音频文件名、转录文本、音频扩展名、语言区域、句子标识符、数据集划分及时长等信息。数据划分仅含训练集,便于直接用于 ASR 模型的训练与微调。
特点
该数据集的核心特色在于其高效的存储与流式加载机制。通过 WebDataset 将音频与元数据整合为 tar 分片,用户可在不预先解压的情况下直接按批次流式读取数据,极大减少磁盘占用并加速训练流程。数据集专为印尼语设计,语音时长适中,适合作为多语言 ASR 研究中的印尼语基准资源。此外,元数据中提供了详细的句子级标识与时长信息,便于进行数据筛选与分析。其简洁的 TSV 结构降低了使用门槛,兼容常见数据处理库如 pandas,使得数据探索与预处理操作更为便捷。
使用方法
使用该数据集需安装 webdataset 与 pandas 库,通过 WebDataset 接口直接加载 tar 分片文件。用户可指定分片编号范围(如 train-{000000..000119}.tar)进行流式读取,每个样本包含音频字节流与解码后的转录文本。元数据文件 train.tsv 可用 pandas 读取,支持基于转录、时长等字段的筛选与统计。由于音频以 mp3 格式存储于分片内,无需手动解压,配合 WebDataset 的迭代器机制即可实现高效训练管道。值得注意的是,该数据集许可证标记为 'other',使用前需参考项目文档确认版权与商用限制。
背景与挑战
背景概述
Taiwan-Tongues-ASR-CE-dataset-id是由台湾行政院数字发展部主导的Taiwan-Tongues-ASR-CE项目所发布的印尼语自动语音识别训练数据集,创建于2024年左右。该数据集专注于印尼语(id)语音识别,包含约20小时、17897条语音-文本对,以WebDataset压缩分片形式存储,旨在为多语言语音识别研究提供高质量训练资源。作为台湾推动东协语言技术发展的重要举措,该数据集填补了印尼语开源ASR数据的稀缺性,尤其为低资源语言领域的声学模型预训练与微调提供了标准化基准,对促进东南亚语言语音技术的进步具有显著影响力。
当前挑战
该数据集面临的挑战主要涉及两方面。领域问题层面,印尼语作为低资源语言,存在口音多样、语速差异大及背景噪声干扰等问题,20小时的数据量对于训练鲁棒性强的端到端ASR模型仍显不足,难以覆盖复杂真实场景的语音变异性。构建过程层面,语音数据的采集、清洗与标注需确保文本-音频对齐的精确性,同时WebDataset格式虽利于流式读取,但分片存储增加了元数据管理复杂度,且许可证标注为“other”导致商用与再分发存在版权不确定性,限制了数据集的广泛采用与跨机构合作。
常用场景
经典使用场景
Taiwan-Tongues-ASR-CE-dataset-id数据集专为印地语自动语音识别任务而设计,其经典使用场景聚焦于端到端语音识别系统的训练与微调。该数据集包含约20小时的印尼语语音数据,以WebDataset格式打包为tar分片,支持高效的流式加载,适用于构建从声学特征到文本转录的映射模型。研究者通常利用该数据集训练基于Transformer或CTC架构的ASR模型,通过其提供的音频文件与对应转录文本,实现语音信号到文字序列的精准转换。数据集的紧凑规模使其特别适合作为迁移学习的起点,为低资源语言的ASR系统开发奠定基础。
解决学术问题
该数据集核心解决了印尼语等低资源语言在语音识别领域面临的标注数据匮乏问题。学术研究中,主流ASR模型多依赖英语等数据充足的语种,而印尼语因缺少大规模、高质量的语音-文本对齐数据,长期制约着相关语音技术的突破。Taiwan-Tongues-ASR-CE-dataset-id提供了17,897条精心标注的语音样本与对应转录,使研究人员能够系统评估不同声学模型在东南亚语言上的泛化能力。它的发布推动了多语言语音识别研究的边界,为验证跨语言特征迁移、端到端模型在小样本条件下的鲁棒性提供了标准化基准,对促进语料稀缺语言的语音技术发展具有里程碑式的意义。
衍生相关工作
基于此数据集,衍生出一系列推动语音识别技术发展的相关研究工作。例如,研究者通过在该数据集上微调预训练的wav2vec 2.0模型,探索了自监督学习在低资源语言上的适应性,验证了特征提取器对不同语种音素结构的捕捉能力。另有工作将该数据集与其他印尼语语音资源联合使用,构建多源混合训练范式,有效提升了语音识别系统的鲁棒性和词汇覆盖率。在领域适应方面,该数据集被用作微调基线,测试从通用ASR模型向特定应用领域迁移的性能,为医疗、法律等垂直场景的语音交互系统开发提供了实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务