小语种数据集
收藏官方服务:
资源简介:
用于训练ASR、TTS、跨语言翻译、文本处理、对话理解等算法,重点提升小语种场景下的语音处理质量、跨语言转换准确性、文本理解精度,以及对低资源、口音差异、文化特色表达的适配能力,广泛应用于跨境贸易、跨国政务、小语种文化保护、多语言智能助手等领域。
提供机构:
数据堂(北京)科技股份有限公司创建时间:
2025-12-30
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集包含缅甸语、孟加拉语、印尼语、越南语等30多种小语种音频与文本数据,总时长超2万小时,存储量约2-3TB。它主要用于训练ASR、TTS、跨语言翻译等算法,旨在提升小语种场景下的语音处理质量与跨语言转换准确性,并增强对低资源、口音差异及文化表达的适配能力,广泛应用于跨境贸易、跨国政务、小语种文化保护及多语言智能助手等领域。
以上内容由遇见数据集搜集并总结生成



