遇见数据集

小语种数据集

收藏
杭州数据交易所2026-02-26 更新2026-06-18 收录
官方服务:

资源简介:

用于训练ASR、TTS、跨语言翻译、文本处理、对话理解等算法,重点提升小语种场景下的语音处理质量、跨语言转换准确性、文本理解精度,以及对低资源、口音差异、文化特色表达的适配能力,广泛应用于跨境贸易、跨国政务、小语种文化保护、多语言智能助手等领域。

创建时间:
2025-12-30
搜集汇总
数据集介绍
小语种数据集 数据集图片
背景与挑战
背景概述
该数据集包含缅甸语、孟加拉语、印尼语、越南语等30多种小语种音频与文本数据,总时长超2万小时,存储量约2-3TB。它主要用于训练ASR、TTS、跨语言翻译等算法,旨在提升小语种场景下的语音处理质量与跨语言转换准确性,并增强对低资源、口音差异及文化表达的适配能力,广泛应用于跨境贸易、跨国政务、小语种文化保护及多语言智能助手等领域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务