遇见数据集

声云大规模多语种语料资源数据集

收藏
数据链接:
官方服务:

资源简介:

本数据集是一款大规模、高质量的多语种语音数据集,由多个子集构成,覆盖越南语、日语等语种,是国内稀缺的大规模多语种语音语料库。该数据集采用“标注数据+无监督数据”双轨结构,兼顾有监督训练与大模型预训练需求,数据形态完整、技术兼容性强,主要用于ASR(语音识别)大模型训练和预训练,训练后的模型可广泛应用于AI智能硬件语音能力部署及多语种语音服务等场景。

创建时间:
2026-05-21
二维码
社区交流群
二维码
科研交流群
商业服务