遇见数据集

tts_farm

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

阿拉伯语和日语 TTS/ASR 聚合数据集是一个专门用于文本转语音(TTS)和自动语音识别(ASR)任务的多语言语音数据集。该数据集汇集了阿拉伯语和日语两种语言的语音数据,总体规模在10万到100万个样本之间。数据经过清洗、去重和响度归一化处理(针对阿拉伯语部分),以确保质量。每个数据样本包含核心的音频-文本对:音频为16位PCM WAV格式,采样率为22050 Hz;文本为对应的转录内容。此外,数据集还提供了丰富的元数据字段,包括音频时长、采样率、语言、方言、说话人ID、性别、来源数据集名称、数据划分(如训练/验证/测试)、唯一标识符(uid)以及多项音频质量指标(RMS、LUFS、SNR)。这些元数据有助于进行深入的数据分析、模型训练和评估。数据集通过Hugging Face平台提供,配置了阿拉伯语和日语两个独立的数据子集。

The Arabic and Japanese TTS/ASR aggregated dataset is a multilingual speech dataset specifically designed for text-to-speech (TTS) and automatic speech recognition (ASR) tasks. It aggregates speech data in Arabic and Japanese languages, with an overall scale ranging from 100,000 to 1,000,000 samples. The data has been cleaned, deduplicated, and normalized for loudness (for the Arabic portion) to ensure quality. Each data sample consists of core audio-text pairs: audio in 16-bit PCM WAV format with a sampling rate of 22050 Hz, and text as corresponding transcriptions. Additionally, the dataset provides rich metadata fields, including audio duration, sampling rate, language, dialect, speaker ID, gender, source dataset name, data splits (e.g., train/validation/test), unique identifier (uid), and multiple audio quality metrics (RMS, LUFS, SNR). This metadata facilitates in-depth data analysis, model training, and evaluation. The dataset is available via the Hugging Face platform, configured with two independent subsets for Arabic and Japanese.

创建时间:
2026-07-09
原始信息汇总
  • 数据集名称: Arabic and Japanese TTS/ASR Aggregated Dataset
  • 数据集地址: https://huggingface.co/datasets/RidheshBhati/tts_farm
  • 语言: 阿拉伯语 (ar)、日语 (ja)
  • 许可: 其他 (other)
  • 任务类别: 文本转语音 (text-to-speech)、自动语音识别 (automatic-speech-recognition)
  • 数据集大小: 100,000 到 1,000,000 个样本 (100K<n<1M)
  • 配置:
    • config_name: default
      • 数据文件:
        • 分裂: arabic → 路径: data/arabic/*.parquet
        • 分裂: japanese → 路径: data/japanese/*.parquet
  • 数据特征:
    • audio: 音频,采样率 22050 Hz
    • text: 文本 (字符串)
    • duration: 时长 (浮点数)
    • sampling_rate: 采样率 (整数)
    • language: 语言 (字符串)
    • dialect: 方言 (字符串)
    • speaker_id: 说话人ID (字符串)
    • gender: 性别 (字符串)
    • dataset_name: 数据集名称 (字符串)
    • split: 分裂 (字符串)
    • uid: 唯一标识符 (字符串)
    • rms: 均方根值 (浮点数)
    • lufs: 响度单位 (浮点数)
    • snr: 信噪比 (浮点数)
  • 描述: 经过清理、去重和响度归一化的阿拉伯语语音数据。训练集包含 audio (16位PCM WAV, 22050 Hz) 和 text 列;其余列包含质量和来源元数据。
搜集汇总
数据集介绍
tts_farm 数据集图片
构建方式
该数据集通过聚合多个阿拉伯语与日语语音资源,经过清洗、去重及响度归一化等精细处理流程构建而成。原始音频被统一转换为16位PCM WAV格式,采样率固定为22050 Hz,确保了数据的一致性与兼容性。数据集以parquet格式存储,分为阿拉伯语和日语两个子集,每个子集均包含音频与对应文本,同时附带了丰富的元数据列,如语者身份、性别、方言、数据来源及音频质量指标(如RMS、LUFS、SNR),为多维度分析提供了可能。
特点
数据集的核心特点在于其多语种覆盖与高质量控制。它同时涵盖阿拉伯语与日语语音数据,适用于文本转语音与自动语音识别双重任务。每个样本均提供详细的音频质量参数(如响度与信噪比),便于研究者筛选高质量数据。此外,语者信息(如ID与性别)及方言标注增强了数据集的多样性,有助于训练更具鲁棒性的模型。规模介于10万至100万样本之间,兼顾了数据丰富度与实用性。
使用方法
使用方法简便直观,可直接通过HuggingFace Datasets库加载。用户可按语言分割选择阿拉伯语或日语子集,或访问完整数据集。主要训练字段为音频与文本,其余元数据可用于过滤或分析。例如,基于SNR阈值筛选高信噪比样本,或按方言分组进行领域适配。对于文本转语音任务,可结合语者ID实现多说话人建模;而自动语音识别任务则可充分利用其文本对齐特性进行端到端训练。
背景与挑战
背景概述
在语音合成与识别领域,高资源语言如英语已拥有大规模、高质量的数据集,而阿拉伯语和日语等低资源语言仍面临数据匮乏的窘境。tts_farm数据集由国际研究团队创建,旨在填补这一空白,通过汇聚、清洗和标准化来自多个来源的阿拉伯语及日语语音数据,为文本到语音(TTS)与自动语音识别(ASR)研究提供统一、高质量的训练资源。该数据集发布于HuggingFace平台,包含超过10万条语音样本,每条样本均配备22050Hz采样率的音频、文本转录及丰富的元数据(如性别、方言、信噪比等),显著降低了低资源语言语音技术的研发门槛,对推动多语言语音模型的发展具有重要影响力。
当前挑战
该数据集首先致力于解决低资源语言在TTS与ASR领域中的核心挑战:阿拉伯语方言多样性与日语发音变异性导致传统模型泛化能力弱,而缺乏大规模、标准化的高质量语音数据则限制了端到端深度学习方法的有效性。此外,数据构建过程中面临多重技术挑战:来自不同来源的语音需进行去重、响度标准化和噪声滤除(如基于RMS与LUFS的音频质量筛选),手动标注与校对昂贵且耗时,方言标签的一致性维护也增加了数据清洗的复杂性,这些步骤均需在确保数据多样性的前提下严控质量,以支持下游模型训练。
常用场景
经典使用场景
在语音合成与自动语音识别研究领域,阿拉伯语和日语因复杂的音韵结构和多样的方言变体而长期面临数据资源匮乏的困境。tts_farm数据集通过整合多个来源、经过去重和响度归一化处理,构建了结构规整的大规模语音-文本对,成为训练高质量多语言TTS和ASR模型的经典基础资源。研究者常利用其清晰的元数据字段,如方言标签、说话人性别和信噪比,进行可控实验设计,从而在声学模型建模、发音特征提取和多任务学习等方向上取得突破。
衍生相关工作
基于tts_farm数据集的优越条件,学术界已衍生出多项经典工作,包括引入对抗训练以消除方言偏见的跨语言语音转换模型、利用元学习实现少样本说话人自适应的TTS框架,以及结合卷积与Transformer架构的轻量级ASR系统。此外,该数据集还被用于构建大规模韵律标注库,支撑了韵律预测和情感语音合成的前沿探索。这些工作不仅验证了数据集的可靠性,更将其价值辐射至多语言语音研究的更广阔边界。
数据集最近研究
最新研究方向
在低资源语言语音合成与识别领域,tts_farm数据集为阿拉伯语和日语的多说话人、多方言语音建模提供了标准化基础。当前前沿方向聚焦于跨语言迁移学习与零样本TTS技术,利用该数据集的元数据(如性别、信噪比、响度)进行声学特征解耦,以提升合成语音的自然度与鲁棒性。同时,结合自监督预训练模型与语音增强方法,该数据集正被用于探索噪声环境下的端到端语音识别优化,尤其在阿拉伯语方言多样性处理上取得突破。其意义在于填补了面向非英语语言的高质量、多标注聚合语音资源的空白,促进了多语种语音技术的公平发展,并为会话式AI与无障碍通讯系统提供了关键支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务