遇见数据集

adi-gov-tw/Taiwan-Tongues-ASR-CE-dataset-id

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

Taiwan-Tongues-ASR-CE-dataset-id 是 Taiwan-Tongues-ASR-CE 项目使用的印尼语训练数据分割。该数据集以 WebDataset tar 分片形式打包,用于自动语音识别训练,包含约20小时的印尼语语音数据,共计17,897条话语。音频文件存储在压缩的tar分片中,无需解压即可通过WebDataset流式读取。数据集包含元数据文件(train.tsv),列包括音频文件名、转录文本、音频扩展名、区域代码、句子标识符、数据分割和时长。

Taiwan-Tongues-ASR-CE-dataset-id is the Indonesian training split used by the Taiwan-Tongues-ASR-CE project. The dataset is packaged as WebDataset tar shards for ASR training, containing approximately 20 hours of Indonesian speech data with 17,897 utterances. Audio files remain inside compressed tar shards and can be streamed without unpacking via WebDataset. It includes a metadata file (train.tsv) with columns for audio file name, transcript, audio extension, locale code, sentence identifier, split, and duration.

提供机构:
adi-gov-tw
搜集汇总
数据集介绍
adi-gov-tw/Taiwan-Tongues-ASR-CE-dataset-id 数据集图片
构建方式
Taiwan-Tongues-ASR-CE-dataset-id 是台湾语音识别项目 Taiwan-Tongues-ASR-CE 的印度尼西亚语训练子集,专为自动语音识别任务而设计。该数据集采用 WebDataset 格式进行封装,将约20小时的语音数据压缩为多个tar分片文件(如 train-000000.tar 至 train-000119.tar),音频文件以mp3格式存储于分片内部,不展开为独立文件。同时提供一个TSV元数据文件 train.tsv,记录每条语音的音频文件名、转录文本、音频格式、语言代码、句子标识符、所属数据集划分(train)及音频时长等信息,便于模型训练时快速索引与加载。
特点
该数据集包含17,897条语音样本,总时长约20.02小时,语言为印度尼西亚语(id),规模处于10,000至100,000条之间。音频以WebDataset分片形式存储,支持流式读取,无需解压即可高效加载,显著降低存储与I/O开销。每条语音配有精确的转录文本及时长信息,适用于监督式语音识别模型的训练与微调。项目采用其他许可证(other),使用时需参考官方文档确认使用与分发条款。
使用方法
使用前需安装webdataset与pandas库。可通过webdataset.WebDataset接口直接加载tar分片流式读取音频与转录文本,如 wds.WebDataset("train/train-{000000..000119}.tar") ,随后从样本中获取mp3音频字节与txt转录文本。亦可使用pandas读取train.tsv元数据,以获取完整的标注信息。该数据集无需预先解压,适合集成到现有深度学习框架的ASR训练流程中,实现高效的数据加载与模型迭代。
背景与挑战
背景概述
Taiwan-Tongues-ASR-CE-dataset-id是台湾行政院数字部主导的Taiwan-Tongues-ASR-CE项目所发布的开源印尼语语音识别数据集,创建于近年,旨在推动东南亚语言在自动语音识别(ASR)领域的研究与应用。该数据集由台湾数字治理基础设施(dginfra)团队构建,核心研究问题聚焦于提供高质量、可扩展的印尼语语音训练资源,以缓解低资源语言在语音技术中的数据短缺困境。数据集包含约20小时的印尼语语音数据,共17,897条话语,并以WebDataset格式打包为tar分片,便于高效流式加载。该工作不仅支持跨语言语音识别模型的训练与微调,也为台湾与印尼之间的多语言技术合作奠定了数据基础,对低资源ASR领域的开源生态具有积极推动作用。
当前挑战
该数据集所应对的领域挑战在于印尼语作为低资源语言,缺乏大规模、标注规范的语音语料库,限制了语音识别系统的泛化性能与实用落地。构建过程中面临多重困难:首先,语音数据需从多种开源来源搜集并统一清洗,噪音与口音差异增加标注一致性难度;其次,音频存储采用压缩WebDataset分片格式,虽便于分布式训练,但设计高效流式数据管道以避免I/O瓶颈仍需技术考量;最后,许可证标注为“other”,需使用者自行核实项目文档以确保合规使用,增加了数据集复用的法律不确定性。
常用场景
经典使用场景
Taiwan-Tongues-ASR-CE-dataset-id数据集专为自动语音识别(ASR)任务所设计,尤其聚焦于印度尼西亚语的口语语料处理。其核心使用场景在于为多语言ASR系统提供高质量、标准化的训练数据,支持端到端声学模型的构建。数据集以WebDataset格式封装,包含近18,000条话语,累计时长约20小时,音频与文本转录一一对应,便于模型学习语音到文本的映射关系。这种结构化的数据组织方式使得研究人员能够高效地进行大规模训练,并验证模型在印尼语这一低资源语言上的识别性能。
实际应用
在实际应用中,该数据集驱动的ASR模型可部署于多种印尼语交互场景,帮助实现语音到文本的自动转换。例如,在印尼地区的客服系统中,模型能够实时转录用户语音请求,提升服务效率;在语音助手产品中,则支持本地语言的指令识别与响应。此外,该数据集还可用于语音搜索、实时会议记录、教育辅助中听力文本的生成等任务,显著降低人工转写成本,加速印尼语数字生态系统的建设。其轻量化的WebDataset格式便于快速集成到云端或嵌入式设备中,增强了技术落地的灵活性。
衍生相关工作
基于Taiwan-Tongues-ASR-CE-dataset-id,研究界衍生出多项经典工作,推动印尼语语音技术的持续演进。其中,有工作利用该数据集作为基础训练语料,结合Adapter微调技术,实现了对印尼语方言的鲁棒性增强;另有研究在其上应用无监督预训练加有监督微调的范式,显著提升了跨域语音识别泛化能力。此外,该数据集还常被用于多语言ASR模型的联合训练,作为印度尼西亚语支的代表性数据,对比不同语言间的声学共享特性。这些衍生工作不仅验证了数据集的价值,也为其后继扩展版本提供了方法论指导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务