遇见数据集

ovos-stt-bench-mtedx-es-ES

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 OVOS stt bench 基准测试的一部分,专注于西班牙语(es-ES)的自动语音识别(ASR)预测。它基于 deepdml/mtedx 数据集,收集了来自 OVOS Plugin Arena 中多个 STT 参赛者对每个音频片段的转录预测结果。每个预测结果以 JSONL 格式存储,每行包含 dataset_revision、plugin_version、latency_ms 等字段,遵循 arena 协议。数据集可用于评估和比较不同 STT 系统的性能,支持构建基准面板、盲战池和 ELO 排名。数据由可复现的基准脚本生成,并受 NGI0 Commons Fund / NLnet 资助。

This dataset is part of the OVOS stt bench benchmark, focusing on Spanish (es-ES) automatic speech recognition (ASR) predictions. It is based on the deepdml/mtedx dataset and collects transcription predictions from multiple STT contestants in the OVOS Plugin Arena for each audio clip. Each prediction is stored in JSONL format with fields such as dataset_revision, plugin_version, and latency_ms, following the arena protocol. The dataset can be used to evaluate and compare the performance of different STT systems, supporting the creation of benchmark panels, blind battle pools, and ELO rankings. The data is generated by reproducible benchmark scripts and funded by the NGI0 Commons Fund / NLnet.

创建时间:
2026-09-02
原始信息汇总

OVOS STT Bench — mtedx-es-ES 数据集概述

基本信息

  • 数据集名称:OVOS stt bench — mtedx-es-ES
  • 许可证:Apache 2.0
  • 标签:openvoiceos、benchmark、predictions、automatic-speech-recognition、stt(语音识别相关)
  • 数据集配置:single config(默认配置),包含一个数据分割 es_ES,对应路径为 predictions/es-ES/*.jsonl

内容说明

该数据集包含注册在 OVOS Plugin Arena 中的语音识别(stt)系统对 deepdml/mtedx 数据集的逐片段(per-clip)转录预测结果。每个数据集分割对应一种语言,本数据集专为西班牙语(es-ES)语种提供预测数据。

数据结构

  • 每个竞争的语音识别系统(fighter)对应一个 JSONL 文件,存放于 predictions/es-ES/<competitor_id>.jsonl
  • 每一行记录遵循 arena 协议(3.2节),包含固定的 dataset_revisionplugin_versionlatency_ms 等字段

用途与生成流程

  • 预测结果由可复现的基准测试脚本(位于 arena 代码仓库中)生成
  • arena 的 assemble 工作流使用这些数据生成基准排行榜(benchmark boards)、盲战池(blind battle pools),并构建基于基准的 ELO 梯度排名

资金来源

该项目由 NGI0 Commons Fund / NLnet 资助,资助协议编号为 101135429,隶属于欧盟委员会的 Next Generation Internet 计划。

搜集汇总
数据集介绍
ovos-stt-bench-mtedx-es-ES 数据集图片
构建方式
本数据集旨在为自动语音识别(ASR)系统提供标准化的性能评估基准。其构建基于OVOS插件竞技场框架,针对deepdml/mtedx数据集中的西班牙语(es-ES)子集,汇集了多个已注册的语音识别引擎的逐片段转录预测结果。数据组织方式严谨:每个预测文件以JSONL格式存储,命名为<competitor_id>.jsonl,置于predictions/es-ES/目录下,每行记录严格遵循竞技场协议,包含数据集修订版本、插件版本及推理延迟等关键元数据,确保了数据来源的可追溯性和实验的可复现性。此构建流程由竞技场仓库中的可复用脚本自动执行,实现了从原始音频到结构化预测结果的标准化流水线。
特点
该数据集具有鲜明的基准评测导向与社区协作特色。其核心特征在于提供了多系统在同一测试集上的横向对比数据,每个条目均关联固定的数据修订版和插件版本,为公平比较奠定基础。预测结果以JSONL格式存储,兼容性强,便于下游工具链处理,而竞技场的'组装'工作流则擅长将这些原始预测升级为排行榜、盲测池及基于基准的ELO等级分,极大提升了数据的分析价值。数据来源于NGI0基金资助的开放生态项目,体现了开放科学与协作创新的精神,为语音技术社区的模型迭代提供了实证土壤。
使用方法
使用者可利用此数据集开展多维度分析。研究者可加载各预测文件,通过对比不同语音识别引擎在西班牙语MTEDX测试集上的文字转录,量化其词错误率等关键指标,进而评估系统性能。对于竞技场开发者而言,可运行仓库中的复现脚本来校验或更新预测,或利用'组装'工作流将这些结果整合至全局排行榜与ELO竞技体系。数据集结构支持按需筛选,例如按语言划分的split专门指向es_ES,方便聚焦特定语种的精细化评估。此外,记录的延迟与版本元数据为探索系统鲁棒性与环境适配性研究提供了宝贵素材。
背景与挑战
背景概述
该数据集由OpenVoiceOS团队创建,隶属于OVOS STT基准测试系列,旨在评估自动语音识别(ASR)系统在西班牙语(es-ES)上的性能。其基于MTEDX数据集,记录了多个ASR插件在特定音频片段上的预测结果,并遵循OVOS Plugin Arena的标准化协议,确保了评测的可复现性。该数据集于近期发布,受欧盟NGI0 Commons基金资助,反映了当前开源社区对多语言、多系统ASR评测体系的需求,为后续模型优化和对比提供了重要参考。
当前挑战
该数据集主要面临的挑战包括:针对西班牙语语音识别的领域问题,如口音多样性、语速变化及背景噪声等,导致模型性能评估的复杂性;构建过程中,由于需要整合来自不同ASR系统的预测,需确保数据格式一致性和接口兼容性,同时处理插件版本更新、延迟测量等非确定性因素,以保证评测结果的公平性和可复现性。此外,大规模数据的存储和高效检索也是构建中的实际困难。
常用场景
经典使用场景
该数据集为语音识别领域提供了一套标准化的评测基准,专注于西班牙语(es-ES)的自动语音识别(ASR)性能验证。研究人员可据此对不同的语音识别插件进行公平的横向对比,通过统一的预测输出结构(如延迟时间和识别文本)评估其在真实世界录音上的表现。此评测框架旨在推动开放语音操作系统(如OpenVoiceOS)中语音识别组件的优化与迭代。
解决学术问题
数据集回应了语音识别社区中一个长期存在的挑战:即缺乏统一的、可复现的基准来比较不同模型或系统的性能。通过固定数据集版本、插件版本及评估协议,该资源消除了因测试环境差异而导致的混淆因素,使得学术研究者能够精准诊断识别错误、衡量技术进展,并为跨平台、跨模型的性能对比提供了可信的依据,从而推动了ASR技术向着更严谨的实证方向发展。
衍生相关工作
该数据集的产出伴随并促进了多个关联工作的创生,其中包括对模型间进行盲测比较的战斗池,以及基于海量评测数据计算出的ELO等级榜单。上述成果勾勒出社区驱动型评测的全新范式,并衍生出一批专注于语音识别错误分析、延迟优化和跨语言泛化能力的研究论文。这些工作共同构建了一个闭环生态,通过持续的反馈循环,引领语音技术向更高精尖水准演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务