遇见数据集

ovos-tts-bench-intents-for-eval-prompts

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

该数据集名为OVOS tts bench — intents-for-eval-prompts,是一个用于文本到语音(TTS)系统基准评估的预测结果集合。它基于OpenVoiceOS/intents-for-eval数据集中的提示,生成了在OVOS Plugin Arena平台上注册的多个TTS模型(称为fighters)的合成音频片段预测,每个提示对应一个音频片段。数据按语言组织,每个语言(如加泰罗尼亚语ca_ES、英语en_US、西班牙语es_ES等)作为一个独立的数据分割,存储为JSONL文件,每个文件对应一个TTS模型竞争者。数据行遵循固定的基准合约,包含数据集版本(dataset_revision)、插件版本(plugin_version)和延迟时间(latency_ms)等字段。数据集通过可复现的基准测试脚本生成,用于构建TTS模型的排行榜、盲测池和基于基准的ELO评分梯子。该数据集由NGI0 Commons Fund/NLnet通过欧盟下一代互联网计划资助,适用于TTS模型性能比较、基准测试和语音合成研究。

The dataset named OVOS tts bench — intents-for-eval-prompts is a collection of predictions for benchmarking text-to-speech (TTS) systems. It is based on prompts from the OpenVoiceOS/intents-for-eval dataset, generating synthetic audio segment predictions for multiple TTS models (referred to as fighters) registered on the OVOS Plugin Arena platform, with each prompt corresponding to an audio segment. Data is organized by language, with each language (e.g., Catalan ca_ES, English en_US, Spanish es_ES, etc.) as a separate data split, stored as JSONL files, each file corresponding to a TTS model competitor. Data rows follow a fixed benchmark contract, including fields such as dataset version (dataset_revision), plugin version (plugin_version), and latency time (latency_ms). The dataset is generated through reproducible benchmark scripts and is used to build leaderboards, blind test pools, and ELO rating ladders for TTS models. It is funded by the NGI0 Commons Fund/NLnet through the European Unions Next Generation Internet program and is suitable for TTS model performance comparison, benchmarking, and speech synthesis research.

创建时间:
2026-06-23
原始信息汇总

数据集概述

数据集名称:OVOS tts bench — intents-for-eval-prompts
许可证:Apache-2.0
标签:openvoiceos, benchmark, predictions, text-to-speech, tts

数据集内容与用途

  • 数据集包含针对 OVOS Plugin Arena 注册的 TTS(文本到语音)模型生成的合成音频片段,每个提示(prompt)对应一个片段。
  • 数据集基于 OpenVoiceOS/intents-for-eval 数据集的提示生成。
  • 每个模态对应一个专用仓库;每个语言对应一个数据集划分(split);每个参赛者(fighter)对应一个 JSONL 文件,存放于 predictions/<lang>/<competitor_id>.jsonl

数据划分与文件结构

  • 配置名称default
  • 数据文件路径
    • ca_ESpredictions/ca-ES/*.jsonl
    • da_DKpredictions/da-DK/*.jsonl
    • en_USpredictions/en-US/*.jsonl
    • es_ESpredictions/es-ES/*.jsonl
    • eu_ESpredictions/eu-ES/*.jsonl
    • gl_ESpredictions/gl-ES/*.jsonl
    • pt_PTpredictions/pt-PT/*.jsonl

数据格式与来源

  • 每一行数据遵循 Arena 第 3.2 节的约定,包含 dataset_revisionplugin_versionlatency_ms 字段。
  • 数据由可复现的基准测试脚本在 Arena 仓库中生成。
  • Arena 的 assemble 工作流将这些数据转换为基准排行榜、盲测池和基于基准的 ELO 排名榜。

资金来源

由 NGI0 Commons Fund(通过 NLnet,欧盟资助协议 No 101135429)资助,隶属于欧盟 Next Generation Internet 计划。

搜集汇总
数据集介绍
ovos-tts-bench-intents-for-eval-prompts 数据集图片
构建方式
该数据集基于OpenVoiceOS框架下的OVOS Plugin Arena评测体系构建,专注于文本到语音合成任务。数据源自对registered TTS fighters在intents-for-eval提示集上的合成音频预测结果,每个提示对应一个合成片段。数据集按语言划分为多个子集,分别对应加泰罗尼亚语、丹麦语、美式英语、西班牙语、巴斯克语、加利西亚语和葡萄牙语。每个子集下以JSONL格式存储每位参赛者的预测文件,遵循Arena协议§3.2规范,包含数据集修订版本、插件版本及延迟时间等关键字段,通过可复现的基准测试脚本自动生成。
特点
该数据集具备多语言覆盖与标准化结构两大突出特性。其覆盖七种欧洲语言,适应多语言TTS系统评估需求。数据组织遵循统一规范:每个语言拆分独立存放,每位参赛者的预测结果以单独的JSONL文件呈现,便于横向对比。文件行记录严格遵循协议,确保评测数据的一致性与可复现性。此外,数据集由NGI0 Commons Fund资助,生态系统化地支撑了基准看板、盲测池及ELO排名系统的构建,体现了其在开源TTS评测中的核心地位。
使用方法
使用时,用户可通过HuggingFace Datasets库加载该数据集,指定配置名'default'及所需语言拆分,如'en_US'或'es_ES'。每个拆分下的预测文件存放于predictions/<语言代码>/路径中,文件名对应参赛者ID。加载后,每条记录包含合成音频的元数据及性能参数,可用于复现基准测试结果、分析不同TTS引擎的语言表现差异,或构建自定义评估指标。建议结合OVOS Plugin Arena的assemble工作流,将数据整合至排名系统或盲测池中进行深入分析。
背景与挑战
背景概述
该数据集由OpenVoiceOS团队创建,依托于OVOS Plugin Arena框架,旨在为文本到语音(TTS)系统提供标准化性能评估。其核心研究问题聚焦于多语言环境下TTS合成的质量与延迟度量,覆盖加泰罗尼亚语、丹麦语、英语等七种语言。作为NGI0 Commons Fund资助项目的一部分,该数据集整合了多个TTS插件的预测结果,通过构建盲测池与ELO排名机制,推动TTS社区形成可复现的基准评价体系。其影响力在于为多语言TTS系统的横向对比提供统一平台,促进了低资源语言的合成技术发展。
当前挑战
当前挑战主要体现于两方面:领域问题层面,TTS合成面临跨语言韵律保真度与自然度差异的瓶颈,尤其低资源语言如巴斯克语、加利西亚语缺乏高质量训练数据,导致合成语音带有明显机械感;构建过程中,数据集需协调不同插件版本、推理延迟和音频采样率的统一,例如同步‘dataset_revision’与‘plugin_version’字段,并确保在多种硬件环境下生成可复现性。此外,多语言评测提示的语义覆盖完整性不足,部分意图类别在特定语言中未能体现日常对话的多样性,限制了评估的普适性。
常用场景
经典使用场景
该数据集作为OpenVoiceOS(OVOS)文本转语音(TTS)基准测试套件的核心组成部分,主要用于评估不同TTS引擎在意图驱动提示文本上的合成表现。通过提供多语言(如加泰罗尼亚语、丹麦语、英语等)的合成音频片段及其对应的延迟、插件版本等元数据,研究人员可利用该数据集对各类TTS插件进行横向比较与性能排序,是构建语音助手、智能家居交互系统中不可或缺的评测工具。
解决学术问题
在学术研究中,该数据集有效解决了多语言、多系统环境下TTS质量评估缺乏统一基准的痛点。传统评测往往依赖人工听觉测试,成本高昂且难以复现。该数据集通过标准化JSONL格式记录合成结果与评测元数据,支持ELO评分、盲战池等定量分析方法,为语音合成领域中的音质、自然度、响应速度等多维度对比研究提供了可复现的客观依据,推动了TTS系统公平比较与迭代优化。
衍生相关工作
基于该数据集已衍生出多项经典工作:其一,OVOS Plugin Arena的‘组装’工作流利用该数据集产出可视化排行榜与盲战评测池,支撑社区驱动的ELO排名系统;其二,后续研究基于其元数据字段(如`latency_ms`)对TTS系统的计算效率与合成质量进行联合建模,提出延迟感知的TTS评估指标;此外,该数据集还启发了多语言TTS领域中的跨语言迁移效果研究,成为验证零样本合成能力的重要参照标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务