遇见数据集

denysdios/alcace_speech_choice_en

收藏
Hugging Face2024-02-07 更新2024-03-04 收录
官方服务:

资源简介:

--- license: apache-2.0 dataset_info: - config_name: facebook_mms-tts-eng features: - name: audio dtype: audio - name: id dtype: string - name: text dtype: string - name: time dtype: float64 splits: - name: train num_bytes: 3956228.0 num_examples: 20 download_size: 3746153 dataset_size: 3956228.0 - config_name: microsoft_speecht5_tts_cmu-arctic-xvectors_4777 features: - name: audio dtype: audio - name: id dtype: string - name: text dtype: string - name: time dtype: float64 splits: - name: train num_bytes: 3730780.0 num_examples: 20 download_size: 3722345 dataset_size: 3730780.0 - config_name: tts_models_multilingual_multi-dataset_xtts_v2 features: - name: audio dtype: audio - name: id dtype: string - name: text dtype: string - name: time dtype: float64 splits: - name: train num_bytes: 3051756.0 num_examples: 20 download_size: 1831300 dataset_size: 3051756.0 configs: - config_name: facebook_mms-tts-eng data_files: - split: train path: facebook_mms-tts-eng/train-* - config_name: microsoft_speecht5_tts_cmu-arctic-xvectors_4777 data_files: - split: train path: microsoft_speecht5_tts_cmu-arctic-xvectors_4777/train-* - config_name: tts_models_multilingual_multi-dataset_xtts_v2 data_files: - split: train path: tts_models_multilingual_multi-dataset_xtts_v2/train-* ---

许可证:Apache-2.0 数据集信息: - 配置名称:facebook_mms-tts-eng 特征字段: - 音频(audio):音频类型 - 标识符(id):字符串类型 - 文本(text):字符串类型 - 时长(time):双精度浮点数(float64)类型 数据划分: - 训练集(train):占用字节数3956228.0,样本量20 下载大小:3746153,数据集总字节数:3956228.0 - 配置名称:microsoft_speecht5_tts_cmu-arctic-xvectors_4777 特征字段: - 音频(audio):音频类型 - 标识符(id):字符串类型 - 文本(text):字符串类型 - 时长(time):双精度浮点数(float64)类型 数据划分: - 训练集(train):占用字节数3730780.0,样本量20 下载大小:3722345,数据集总字节数:3730780.0 - 配置名称:tts_models_multilingual_multi-dataset_xtts_v2 特征字段: - 音频(audio):音频类型 - 标识符(id):字符串类型 - 文本(text):字符串类型 - 时长(time):双精度浮点数(float64)类型 数据划分: - 训练集(train):占用字节数3051756.0,样本量20 下载大小:1831300,数据集总字节数:3051756.0 配置项: - 配置名称:facebook_mms-tts-eng,对应数据文件:训练集(train)的路径为facebook_mms-tts-eng/train-* - 配置名称:microsoft_speecht5_tts_cmu-arctic-xvectors_4777,对应数据文件:训练集(train)的路径为microsoft_speecht5_tts_cmu-arctic-xvectors_4777/train-* - 配置名称:tts_models_multilingual_multi-dataset_xtts_v2,对应数据文件:训练集(train)的路径为tts_models_multilingual_multi-dataset_xtts_v2/train-*

提供机构:
denysdios
原始信息汇总

数据集概述

数据集配置

1. facebook_mms-tts-eng

  • 特征:
    • audio: 音频数据
    • id: 字符串类型
    • text: 字符串类型
    • time: 浮点数类型
  • 分割:
    • train:
      • 字节数: 3956228.0
      • 样本数: 20
  • 下载大小: 3746153
  • 数据集大小: 3956228.0
  • 数据文件:
    • train: facebook_mms-tts-eng/train-*

2. microsoft_speecht5_tts_cmu-arctic-xvectors_4777

  • 特征:
    • audio: 音频数据
    • id: 字符串类型
    • text: 字符串类型
    • time: 浮点数类型
  • 分割:
    • train:
      • 字节数: 3730780.0
      • 样本数: 20
  • 下载大小: 3722345
  • 数据集大小: 3730780.0
  • 数据文件:
    • train: microsoft_speecht5_tts_cmu-arctic-xvectors_4777/train-*

3. tts_models_multilingual_multi-dataset_xtts_v2

  • 特征:
    • audio: 音频数据
    • id: 字符串类型
    • text: 字符串类型
    • time: 浮点数类型
  • 分割:
    • train:
      • 字节数: 3051756.0
      • 样本数: 20
  • 下载大小: 1831300
  • 数据集大小: 3051756.0
  • 数据文件:
    • train: tts_models_multilingual_multi-dataset_xtts_v2/train-*
搜集汇总
数据集介绍
denysdios/alcace_speech_choice_en 数据集图片
构建方式
在语音合成与多模态交互研究领域,高质量、多样化的语音数据是模型训练与评估的基石。denysdios/alcace_speech_choice_en 数据集应运而生,其构建方式别具匠心。该数据集整合了来自三种不同语音合成模型的输出:Facebook MMS-TTS-ENG、Microsoft SpeechT5 TTS CMU Arctic Xvectors 4777 以及 TTS Models Multilingual Multi-Dataset XTTS V2,每种模型贡献20条语音样本。每条数据均包含音频文件、唯一标识符、对应文本及时间戳,通过统一的特征结构(audio、id、text、time)进行组织,形成三个独立的配置(config)模块,分别存储于单独的目录中,确保了数据的模块化与可扩展性。
使用方法
使用该数据集时,研究者可通过Hugging Face Datasets库轻松加载。首先需要指定所需的配置名称,例如'facebook_mms-tts-eng'、'microsoft_speecht5_tts_cmu-arctic-xvectors_4777'或'tts_models_multilingual_multi-dataset_xtts_v2',然后加载对应的训练分片。加载后的数据将包含音频(audio)、文本(text)、标识符(id)和时间(time)等字段,可直接用于语音合成模型的评估、跨模型对比分析或作为基准测试集。建议在实验前对音频进行标准化处理,并利用时间戳信息进行精确的语音段切割,以充分发挥该数据集在细粒度语音研究中的潜力。
背景与挑战
背景概述
在语音合成与多模态交互领域,跨语言与跨模型的语音数据对齐始终是推动技术落地的关键瓶颈。denysdios/alcace_speech_choice_en数据集由研究者denysdios于近期构建,旨在为英语语音选择任务提供标准化的评估基准。该数据集整合了来自Facebook MMS-TTS、Microsoft SpeechT5以及Coqui XTTS v2三种主流模型的合成语音样本,每类模型仅包含20条精心标注的音频-文本对,并记录生成时间戳。其核心研究问题在于:面对不同架构与训练策略的TTS系统,人类或自动评估系统能否在有限样本下做出一致的偏好选择?这一工作为语音质量感知比较、模型鲁棒性测试以及小样本评估范式提供了可复现的试验场,对推动语音合成系统的客观与主观评价融合具有开创性意义。
当前挑战
该数据集面临的核心挑战体现在两个层面。在领域问题层面,语音选择任务需解决如何从极少量样本(每模型仅20条)中提取具有统计显著性的偏好信号,并规避不同TTS模型在音色、韵律和自然度上的系统偏差对选择决策的干扰。在构建过程中,挑战尤为突出:首先,需确保来自三个异构模型的音频在语速、背景噪声和采样率上保持可比性,这要求严格的预处理与归一化流程;其次,时间戳字段的引入虽为时序分析提供可能,但如何利用该信息消解生成延迟对选择实验的潜在影响,仍缺乏成熟方法论。此外,数据集规模过小限制了深度学习方法的直接应用,迫使其依赖更精巧的统计推断或迁移学习策略来挖掘可靠结论。
常用场景
经典使用场景
在语音合成与语音识别领域,该数据集为评估不同文本转语音(TTS)模型在英语语音生成上的表现提供了标准化基准。其核心场景在于对比分析多种前沿TTS架构——如Meta的MMS-TTS、Microsoft的SpeechT5以及Coqui的XTTS-v2——在相同文本输入下生成的语音质量、自然度和韵律特征。研究人员可借助该数据集进行客观的声学指标评测,亦可开展主观听感测试,从而在统一框架下衡量各模型在发音准确性和情感表达上的差异。
解决学术问题
该数据集直接回应了多模型对比研究中缺乏统一语料库的学术困境。过往研究常因采用不同评测数据集而难以公平比较各TTS系统的性能,导致结论碎片化。此数据集通过固定文本和音频格式,解决了跨模型评估的可重复性与可比性问题,为语音合成领域的模型选择与优化提供了实证依据,推动了语音生成技术标准化评测体系的构建。
实际应用
在实际应用中,该数据集可用于智能语音助手、有声读物生成、无障碍辅助技术等场景的模型选型。开发者能够依据该数据集提供的多模型输出样例,快速判断哪种TTS引擎更适配特定场景需求,例如在需要高自然度的客服对话系统中优先选择表现优异的模型。此外,该数据集还能辅助教育领域进行发音教学资源的自动化生成,提升人机交互体验的沉浸感。
数据集最近研究
最新研究方向
在语音合成与多模态交互技术迅猛发展的当下,alcace_speech_choice_en数据集聚焦于跨模型语音生成能力的对比与评估。该数据集整合了来自Facebook MMS-TTS、Microsoft SpeechT5及Coqui XTTS-v2等前沿TTS引擎的音频样本,每个配置均包含20条精心配对的语音与文本数据,并附有时间戳。这为研究不同架构(如自监督预训练模型与多语言扩展模型)在英文语音合成中的表现提供了标准化基准。当前前沿方向集中于利用此类小样本、多源数据集进行零样本语音克隆、情感迁移及多说话人风格控制等任务,尤其关注模型在低资源场景下的泛化能力与自然度。该数据集的出现,推动了语音合成领域从单一模型评估向多模型横向比较的范式转变,对于构建更鲁棒、更具表现力的语音接口具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务