遇见数据集

malaysia-ai/fleurs-r-neucodec-all-languages

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含102种语言的FLEURS-R元数据、源音频和预计算的NeuCodec令牌。具体布局包括:data/目录以Parquet格式存储训练和开发元数据;audio/目录按语言和分割组织源FLEURS-R音频存档;neucodec/目录按语言、分割和处理等级组织NeuCodec令牌存档。每个Parquet行包含语言、分割、源音频路径、NeuCodec令牌路径、转录文本、归一化文本、说话者性别和样本计数。源数据集为google/fleurs-r,遵循CC BY 4.0许可证,适用于多语言文本到语音和自动语音识别任务。

This dataset contains FLEURS-R metadata, source audio, and precomputed NeuCodec tokens for 102 locales. The layout includes: data/ with train and development metadata in Parquet format; audio/ with source FLEURS-R audio archives organized by locale and split; neucodec/ with NeuCodec token archives organized by locale, split, and processing rank. Each Parquet row includes the locale, split, source audio path, NeuCodec token path, transcript, normalized text, speaker gender, and sample count. The source dataset is google/fleurs-r, distributed under the CC BY 4.0 license, and it is designed for multilingual text-to-speech and automatic speech recognition tasks.

提供机构:
malaysia-ai
搜集汇总
数据集介绍
malaysia-ai/fleurs-r-neucodec-all-languages 数据集图片
构建方式
FLEURS-R NeuCodec All Languages数据集基于Google发布的FLEURS-R语料库构建,覆盖102个语言区域的语音数据。该数据集不仅保留了原始音频文件和对应的转录文本,还利用NeuCodec编码器对语音信号进行预计算处理,生成离散化的神经语音标记(NeuCodec tokens)。数据以Parquet格式存储元数据,并按照语言区域、数据集划分(训练/开发)以及处理层级进行归档,确保结构清晰且便于大规模并行加载。每一条记录包含语言区域、音频路径、标记路径、原始转录、标准化文本、说话人性别及样本计数等字段。
使用方法
用户可通过Hugging Face Datasets库直接加载该数据集,利用Parquet文件中的元数据索引对应的音频与NeuCodec标记。对于ASR任务,可将音频与转录文本作为输入-输出对;对于TTS任务,则可结合转录文本与NeuCodec标记进行条件生成。建议用户根据具体语言区域或数据划分筛选子集,并结合NeuCodec解码器将离散标记重建为波形。数据集的CC BY 4.0许可证允许非商业与商业用途,但需注意原始FLEURS-R的引用义务。
背景与挑战
背景概述
在语音合成与自动语音识别领域,多语言数据的稀缺与建模复杂性长期制约着技术突破。FLEURS-R NeuCodec All Languages数据集应运而生,由科研机构基于谷歌FLEURS-R语料库构建,收录102个语种的原始音频与预计算的NeuCodec神经编解码令牌。该数据集通过Parquet格式整合训练与开发元数据,并提供语种、音频路径、令牌路径、文本转录及说话人性别等结构化信息,为多语言神经语音编解码研究奠定了高覆盖基准。其发布推动了跨语言语音表征学习与低资源语种建模的前沿探索,成为连接语音前端处理与下游任务的关键纽带。
当前挑战
该数据集面临的首要挑战在于多语言声学异质性问题:不同语种的音系结构、韵律特征及说话人变异使得Neucodec令牌的泛化编码难以兼顾精度与效率。同时,构建过程中需处理102个语种的音频对齐与元数据标准化,部分稀有小语种原始音频信噪比低、标注噪声高,导致令牌提取引入误差累积风险。此外,超大规模多语种数据的分布式处理与存储管理要求设计鲁棒的负载均衡策略,以避免计算资源浪费与数据结构漏洞。这些技术与非技术难点共同构成了数据集可用性的深层壁垒。
常用场景
经典使用场景
该数据集最经典的使用场景是作为多语言文本到语音(TTS)和自动语音识别(ASR)系统的训练与评测基准。它覆盖了102个语言地区的音频、转录文本及预计算的NeuCodec离散编码,为研究人员提供了标准化的多模态数据资源,尤其适用于构建跨语言语音合成与识别模型,支持在统一框架下对比不同语言的表现。
解决学术问题
该数据集解决了多语言语音处理中数据稀缺与标注不一致的学术难题。通过提供高质量、多语种的音频与对齐文本,它支撑了低资源语言语音技术的突破性研究,推动了多语言ASR和TTS从单一语言到全球覆盖的范式转变。其标准化NeuCodec tokens还促进了离散语音表示学习的探索,对理解语音与语义的映射关系具有深远意义。
实际应用
在实际应用中,该数据集可服务于智能语音助手、实时翻译系统和无障碍通信工具的国际化部署。例如,企业利用其多语言音视频数据训练通用语音界面,实现部分低资源语言的语音输入输出功能;教育机构则借助该数据集开发跨语言学习平台,助力非主流语言的文化传承与数字化普及。
数据集最近研究
最新研究方向
基于FLEURS-R NeuCodec多语言数据集的前沿研究聚焦于利用神经音频编解码技术推动多语种语音合成与识别系统的统一建模。该数据集覆盖102个语种,预计算的高质量NeuCodec令牌能够显式解耦声学与语言特征,为构建跨语种共享的语音表征提供了核心数据支撑。当前热点方向包括:借助该资源训练端到端多语种文本转语音模型,实现低资源语言的自然度突破;以及结合大规模自监督预训练范式,提升开放语种语音识别在噪声环境下的鲁棒性。其CC-BY 4.0许可协议有效降低了学术与工业界的数据获取壁垒,推动了多语种语音技术的公平性与普惠性发展,尤其对濒危语言及方言的数字化保护具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务