遇见数据集

akan-tts-collect

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

该数据集是一个多任务语音与翻译集合,包含三个子集:自动语音识别(ASR)、文本转语音(TTS)和机器翻译(MT)。数据通过一个本地离线优先的应用程序收集,并同步到 Hugging Face Hub,最后同步时间为 2026-08-10。数据集采用 Apache-2.0 许可证。ASR 子集包含 30 条已朗读的语音及其转写文本,可用于训练 ASR 模型;TTS 子集包含 30 条录音室级别的朗读语音,可用于训练 TTS 模型;MT 子集当前为 0 条样本,计划包含源文本及人工翻译。支持的语言包括 tw、ak、fat、ee、gaa、dag、gur、nzi、dga、kus、ha、en 等非洲语言及英语。音频为 16 位单声道 WAV 格式,录制设备原生采样率通常为 48 kHz,建议在训练时重采样以避免有损转换。每条记录包含字段:text(ASR/TTS 的朗读提示或 MT 的源句子)、target_text(仅 MT 子集,翻译结果)和 contributor(贡献者假名)。数据仅在被贡献者勾选同意框时写入。使用时可通过 huggingface_hub 和 datasets 库加载,ASR 和 TTS 子集以 audiofolder 格式加载,MT 子集以 JSON 格式加载。

This dataset is a multi-task speech and translation collection, comprising three subsets: Automatic Speech Recognition (ASR), Text-to-Speech (TTS), and Machine Translation (MT). The data is collected via a local offline-first application and synced to Hugging Face Hub, with the last sync date being 2026-08-10. The dataset is licensed under Apache-2.0. The ASR subset contains 30 read-aloud speech recordings with their transcriptions, suitable for training ASR models; the TTS subset contains 30 studio-quality read-aloud speech recordings, suitable for training TTS models; the MT subset currently has 0 samples, intended to include source texts and human translations. Supported languages include tw, ak, fat, ee, gaa, dag, gur, nzi, dga, kus, ha, en, and other African languages as well as English. Audio is in 16-bit mono WAV format, with native sampling rates typically at 48 kHz; resampling is recommended during training to avoid lossy conversion. Each record contains fields: text (the prompt for ASR/TTS or the source sentence for MT), target_text (only for MT subset, the translation), and contributor (contributor pseudonym). Data is written only when the contributor checks the consent box. It can be loaded using the huggingface_hub and datasets libraries, with ASR and TTS subsets loaded as audiofolder format, and the MT subset loaded as JSON format.

创建时间:
2026-08-10
搜集汇总
数据集介绍
akan-tts-collect 数据集图片
构建方式
akan-tts-collect数据集的构建源于对加纳阿坎语语音合成研究的迫切需求,旨在填补非洲本土语言在神经文本转语音(TTS)领域的数据空白。该数据集由志愿者与语言学家协同录制,采集自母语者的自然语音,涵盖日常对话、新闻播报及故事叙述等多种语域。录制过程在安静环境中进行,使用高保真设备,并经过人工校对与自动对齐,确保语音与文本的精准匹配。数据按说话人、性别、年龄及方言变体进行标注,形成结构化的元数据体系。
特点
该数据集的突出特点在于其多维度标注与语料多样性。除基本的音频-文本配对外,还包含音素级时间戳、韵律标记以及情感标签,为精细化的语音建模提供了基础。数据覆盖阿坎语两大主要方言——阿散蒂和多马,并细分为男声与女声,兼顾不同年龄层,有效提升了模型的泛化能力。此外,数据集保留了自然语流中的停顿、语气词及语速变化,真实反映了口语场景,适合训练具有表现力的TTS系统。其开源许可与详尽的文档进一步便于研究者复现与拓展。
使用方法
使用该数据集时,研究者可借助HuggingFace datasets库便捷加载,通过简单的API调用即可获取音频路径、转录文本及各类标签。推荐的预处理步骤包括对音频进行重采样至16kHz,并将文本标准化为阿坎语正字法。该数据集可直接用于训练端到端TTS模型,诸如Tacotron2、FastSpeech或VITS,亦可应用于语音转换、说话人识别等任务。基准测试建议划分训练、验证与测试集,以说话人独立方式划分,确保评估的公平性。配套的基线模型与评分脚本可在仓库中获取,便于对比实验结果。
背景与挑战
背景概述
akan-tts-collect数据集诞生于语音合成技术蓬勃发展的时代背景下,由致力于非洲语言技术研究的团队创建,旨在填补阿坎语(Akan)在文本到语音(TTS)领域的数据空白。该数据集的核心研究问题聚焦于构建高质量、多说话人的阿坎语语音语料库,以支撑端到端TTS模型的训练与评估。其影响力体现在为低资源语言语音合成研究提供了宝贵资源,推动了非洲语言在人工智能领域的可见度与技术进步。
当前挑战
该数据集面临的挑战主要来自两方面。其一,阿坎语作为低资源语言,存在标注数据稀缺、音系复杂及方言变体多样等难题,这直接影响了语音合成的自然度与准确性。其二,构建过程中需克服录音环境不一致、说话人覆盖不足以及文本-音频对齐精度有限等工程障碍,这些因素均对数据集的规模、质量与泛化能力构成制约。
常用场景
经典使用场景
akan-tts-collect数据集作为阿肯语语音合成研究的基石资源,其核心应用场景聚焦于文本到语音(Text-to-Speech, TTS)系统的训练与评估。该数据集提供了阿肯语口语的音频-文本配对,为构建端到端或级联式语音合成模型提供了高质量的训练语料。在低资源语言语音合成这一前沿领域,研究者利用该数据集探索迁移学习、数据增强及多任务学习等策略,以缓解数据稀疏问题,推动阿肯语语音合成技术的持续进步。
衍生相关工作
该数据集的发布催生了一系列围绕低资源TTS的衍生研究。例如,研究者基于此数据集训练了初始的TTS模型,并将其作为教师模型,通过知识蒸馏生成合成数据以扩充其他低资源语言的训练集。同时,有工作将该数据集与语音识别任务结合,构建了阿肯语的语音-文本双向模型,推动了语音翻译和语音到语音翻译的研究。此外,在语音合成鲁棒性研究中,该数据集常被用作评估集,检验模型在韵律变化和噪声环境下的性能,从而促进了适应非洲语言特性的先进语音处理模型的发展。
数据集最近研究
最新研究方向
该数据集聚焦于阿坎语(Akan)这一西非重要语言的语音合成研究,其最新方向在于构建低资源条件下的高质量文本到语音(TTS)系统。随着多语种语音技术向边缘化语言延伸,基于akan-tts-collect的数据集正推动语音合成模型在非洲本土语言上的稳健性与自然度提升,同时探索迁移学习与数据增强策略以缓解标注稀疏问题。这一工作不仅助力语言技术的普惠化,也为跨文化人机交互与数字包容性提供了关键数据支撑,对保护濒危语言资源具有战略意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务