遇见数据集

ovos-stt-bench-voxpopuli-es-ES

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 OVOS stt bench 基准测试套件的一部分,专注于语音识别任务的性能评估。具体针对 voxpopuli 数据集中的西班牙语(es-ES)语种,收集了多个 OVOS 插件竞技场注册的 STT 系统(称为“战斗机”)对每个音频片段的转录预测结果。数据集按语言分割,每个语言对应一个数据分割;每个 STT 系统对应一个独立的 JSONL 格式文件,文件路径为 predictions/<语言>/<竞争者ID>.jsonl。每一行数据遵循竞技场协议 §3.2 规定的字段,包括数据集修订版本(dataset_revision)、插件版本(plugin_version)和延迟时间(latency_ms)等关键指标。该数据集由竞技场仓库中的可复现基准脚本生成,最终用于构建基准排行榜、盲战池以及基于基准的 ELO 排名系统。该项目由 NGI0 Commons Fund 和 NLnet 根据欧盟 Next Generation Internet 计划资助。

This dataset is part of the OVOS stt bench benchmark suite, focusing on performance evaluation of speech recognition tasks. Specifically targeting the Spanish (es-ES) language from the voxpopuli dataset, it collects transcription predictions from multiple STT systems (called fighters) registered in the OVOS plugin arena for each audio clip. The dataset is split by language, with each language corresponding to one data split; each STT system corresponds to an independent JSONL file with path predictions/<language>/<competitor_id>.jsonl. Each line follows the fields specified in Arena Protocol §3.2, including key indicators such as dataset_revision, plugin_version, and latency_ms. This dataset is generated by reproducible benchmark scripts in the arena repository and is ultimately used to build benchmark leaderboards, blind battle pools, and benchmark-based ELO ranking systems. The project is funded by the NGI0 Commons Fund and NLnet under the European Unions Next Generation Internet initiative.

创建时间:
2026-09-02
原始信息汇总

OVOS STT 基准数据集 — voxpopuli-es-ES

数据集概述

该数据集是 OVOS Plugin Arena 项目的一部分,用于存储语音识别(STT)系统在西班牙语语音数据集上的预测结果,作为基准测试数据。

主要特性

属性 说明
许可证 Apache 2.0
标签 openvoiceos、benchmark、predictions、automatic-speech-recognition、stt
数据集名称 OVOS stt bench — voxpopuli-es-ES
语言 西班牙语(es-ES)

数据内容

  • 数据来源:预测结果基于 facebook/voxpopuli 数据集生成
  • 数据格式:JSONL 文件,每个语音识别系统(参赛者)对应一个文件,路径为 predictions/<language>/<competitor_id>.jsonl
  • 数据划分:包含 es_ES 单一划分

数据结构与协议

每条记录遵循 OVOS Plugin Arena 的 §3.2 协议,包含以下字段:

  • dataset_revision(固定版本)
  • plugin_version(插件版本)
  • latency_ms(推理延迟)

数据用途

该数据用于:

  • 生成基准测试排行榜
  • 构建盲测对战池
  • 生成基于基准测试的 ELO 排名

资金支持

该项目由 NGI0 Commons Fund / NLnet 资助,资助协议编号为 101135429,属于欧盟委员会 Next Generation Internet 计划的一部分。

搜集汇总
数据集介绍
ovos-stt-bench-voxpopuli-es-ES 数据集图片
构建方式
在语音识别技术评估领域,构建可复现的基准数据集对于衡量不同模型性能至关重要。ovos-stt-bench-voxpopuli-es-ES数据集基于OpenVoiceOS的插件竞技场框架,针对西班牙语(es-ES)语音识别任务,从facebook/voxpopuli数据集中提取音频片段,并收集多个注册的stt插件对这些片段的转录预测。每个插件在predictions/es-ES/目录下生成对应的JSONL文件,记录每个片段的预测结果,并附有数据集修订版本、插件版本及延迟毫秒数等元数据。整个构建过程由竞技场仓库中的可复现基准脚本自动完成,确保评估条件的一致性和结果的可追溯性。
使用方法
使用该数据集时,研究者需先加载默认配置,该配置指向predictions/es-ES/目录下的所有JSONL文件。每个文件代表一个插件的预测记录,可通过解析JSONL行获取每个音频片段的转录文本及关联元数据。基于这些预测,用户能够计算词错误率等指标,或直接利用竞技场提供的assemble工作流,将预测结果转化为基准看板、盲测对战池和ELO排名。该数据集适用于语音识别系统的对比研究、插件性能分析以及可复现基准测试的构建,使用时需注意遵守Apache-2.0许可协议,并引用相关资助信息。
背景与挑战
背景概述
面向开放语音交互生态的持续演进,自动语音识别模型的横向评测需求日益迫切。ovos-stt-bench-voxpopuli-es-ES数据集由OpenVoiceOS社区在NGI0 Commons Fund资助下构建,依托OVOS Plugin Arena框架,对多种STT插件在facebook/voxpopuli西班牙语语料上的逐片段转录结果进行系统记录。该数据集以可复现基准脚本产出,涵盖固定数据集版本、插件版本与推理延迟等关键元数据,并经由组装流程转化为基准榜单、盲测对战池及ELO评级阶梯。其核心研究问题在于建立开放、透明的语音识别插件比较机制,对推动去中心化语音助手生态的标准化评测具有基础性影响。
当前挑战
该数据集所面对的领域问题在于多说话人、多场景语音条件下转录一致性与鲁棒性的量化比较,需在方言口音、背景噪声与口语化表达交织的真实语料中保持评测的公平性。构建过程中亦面临多重挑战:不同STT插件在推理延迟与资源占用上差异显著,难以在统一硬件条件下实现完全对等的比较;逐片段预测结果需与固定版本语料严格对齐,任何版本漂移都可能引入偏差;盲测对战池与ELO评级的统计稳定性依赖足量且均衡的样本,而单一语种的覆盖范围限制了结论的跨语言外推能力。
常用场景
经典使用场景
在语音识别技术评测领域,基准数据集构成了衡量模型性能的基石。ovos-stt-bench-voxpopuli-es-ES数据集承载了OVOS Plugin Arena框架下多个STT插件在facebook/voxpopuli西班牙语语音语料上的逐片段转录预测结果,其经典使用场景聚焦于构建可复现的语音识别基准测试平台。研究者通过汇总各竞争插件在统一数据划分上的输出,生成基准排行榜与盲测对战池,并以此驱动基于基准种子初始化的ELO等级分阶梯。该数据集使不同语音识别系统得以在同一严格契约下进行公平比较,成为开源语音识别插件生态中不可或缺的评估基础设施。
解决学术问题
该数据集有效回应了语音识别研究中长期存在的可复现性危机与评估标准碎片化问题。传统研究常因缺乏统一的评测协议、固定的数据版本与公开的预测记录,导致不同系统间难以进行公正比较。该数据集通过固定数据集版本、记录插件版本与推理延迟等元信息,并遵循竞技场第3.2节契约,为学术共同体提供了透明、可追溯的评估基准。其意义在于降低了语音识别系统对比研究的门槛,促进了结果的可验证性,并为多语言语音识别技术的迭代进步提供了坚实的实证基础。
实际应用
在实际应用层面,该数据集为语音识别插件的选型与部署提供了数据驱动的决策依据。开发者和企业可借助其中记录的逐片段预测、延迟指标以及由此衍生的ELO等级分,评估不同STT插件在西班牙语场景下的准确性与实时性表现,从而针对具体产品需求选择最优方案。同时,该数据集支撑的盲测对战池和基准排行榜机制,能够持续吸纳新插件参与评测,推动开源语音识别生态的良性竞争。此外,其可复现的基准脚本也为工业界构建私有语音识别评测流水线提供了可借鉴的范式。
数据集最近研究
最新研究方向
在语音识别技术持续演进的背景下,ovos-stt-bench-voxpopuli-es-ES数据集为西班牙语语音转写模型的性能评估提供了标准化基准。该数据集基于facebook/voxpopuli语料库,通过OVOS Plugin Arena框架,对多个STT插件进行逐片段预测记录,并纳入延迟、版本等关键指标。当前研究聚焦于利用此类基准构建盲测对战池与ELO评级体系,以动态反映模型在真实场景下的鲁棒性与效率。这一方向不仅推动了开源语音识别插件的公平比较,也为欧洲多语言语音技术的可复现研究树立了典范,对提升低资源语言识别质量具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务