遇见数据集

ovos-stt-bench-mls-pt-PT

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 OVOS 语音转文本(STT)基准测试套件的一部分,专门针对葡萄牙语(pt-PT)语音识别任务。它包含多个注册在 OVOS Plugin Arena 中的 STT 系统(称为“fighters”)对 Facebook 多语言 LibriSpeech 数据集(mls-pt-PT)中每个音频片段的转录预测结果。数据以 JSONL 格式组织,每个文件对应一个竞争者,存放在 predictions/pt-PT/ 目录下。每行记录包含预测文本、数据集版本、插件版本和延迟(毫秒)等元数据。该数据集由可复现的基准脚本生成,用于评估不同 STT 系统的性能,并支持构建基准排行榜、盲战池以及基于种子的 ELO 排名系统。项目由 NGI0 Commons Fund 和 NLnet 资助,属于欧盟下一代互联网计划。

This dataset is part of the OVOS Speech-to-Text (STT) benchmark suite, specifically targeting Portuguese (pt-PT) speech recognition tasks. It contains transcription predictions for each audio segment from the Facebook Multilingual LibriSpeech dataset (mls-pt-PT) by multiple STT systems (called fighters) registered in the OVOS Plugin Arena. The data is organized in JSONL format, with each file corresponding to a competitor, stored under the predictions/pt-PT/ directory. Each row includes metadata such as predicted text, dataset version, plugin version, and latency (in milliseconds). The dataset is generated by a reproducible benchmark script to evaluate the performance of different STT systems and supports building benchmark leaderboards, blind battle pools, and seed-based ELO ranking systems. The project is funded by the NGI0 Commons Fund and NLnet as part of the European Unions Next Generation Internet initiative.

创建时间:
2026-09-02
原始信息汇总

OVOS STT 基准测试 — MLS 葡萄牙语(pt-PT)数据集

数据集概览

该数据集是 OVOS(OpenVoiceOS)语音识别(STT)基准测试 的预测结果数据集,专注于 MLS(Multilingual LibriSpeech)葡萄牙语(pt-PT) 语言子集。数据集以 Apache 2.0 许可证发布,属于自动语音识别(ASR)领域的基准测试与预测数据。

数据内容与结构

  • 存储形式:每个音频片段的转录预测以 JSONL(JSON Lines)格式存储。
  • 数据组织
    • 每个受测系统(即 OVOS 插件竞技场中的参赛者,称为 "fighter")对应一个独立的 JSONL 文件。
    • 文件存放路径为 predictions/<语言代码>/<系统ID>.jsonl,具体到葡萄牙语为 predictions/pt-PT/ 目录下。
  • 默认数据分割:数据集仅包含一个名为 pt_PT 的数据分割。

数据来源与字段说明

  • 基准数据基础:预测基于 facebook/multilingual_librispeech 数据集。
  • 记录字段:每一行数据遵循 OVOS 插件竞技场(ovos-plugin-arena)协议 §3.2 规范,包含固定的数据集版本(dataset_revision)、插件版本(plugin_version)及延迟时间(latency_ms)等元数据。

生成与用途

  • 生成方式:由竞技场代码仓库中的可复现基准测试脚本产生。
  • 应用场景:竞技场的 assemble 工作流利用这些数据生成基准排行榜、盲测对战池,并计算基于基准测试的 ELO 评分体系。

资金支持

该项目由 NGI0 Commons Fund / NLnet 资助,资助协议编号为 101135429,资金来源于欧盟委员会的 Next Generation Internet 计划。

搜集汇总
数据集介绍
ovos-stt-bench-mls-pt-PT 数据集图片
构建方式
在语音识别技术评估领域,构建标准化的基准数据集对于衡量不同系统性能至关重要。该数据集依托OVOS Plugin Arena框架,针对facebook/multilingual_librispeech中的葡萄牙语(pt-PT)语音样本,收集了多个注册参赛语音识别插件的逐片段转录预测结果。每个插件对应一个JSONL文件,存放于predictions/pt-PT/路径下,包含固定数据集修订版本、插件版本及毫秒级延迟等元数据,确保评估过程可复现。生成流程由竞技场仓库中的基准测试脚本自动完成,保证数据的一致性与透明度。
使用方法
使用者可通过HuggingFace datasets库加载该数据集,指定配置名default及分割名pt_PT,即可获取所有插件的预测记录。每条记录包含转录文本、延迟等字段,可直接用于计算词错误率(WER)等指标,或输入竞技场的assemble工作流以生成基准看板、盲测对战池及ELO阶梯排名。研究者亦可基于此数据复现基准测试,或将其作为评估新语音识别插件的参考基线。使用时需注意引用固定的数据集修订版本,以确保结果的可比性与可重复性。
背景与挑战
背景概述
随着多语言语音交互技术的快速发展,自动语音识别(ASR)系统的性能评估愈发依赖于标准化、可复现的基准测试。ovos-stt-bench-mls-pt-PT数据集由OpenVoiceOS社区于近年构建,旨在为葡萄牙语(pt-PT)语音识别插件提供统一的预测基准。该数据集基于facebook/multilingual_librispeech语料库,通过OVOS Plugin Arena框架收集多种STT插件的逐片段转录结果,并记录延迟、版本等元数据。其核心研究问题在于建立公平、透明的插件竞技场,推动开源语音识别技术的可比性评估。该数据集受到欧洲Next Generation Internet计划资助,对多语言语音识别基准测试的社区协作具有示范意义。
当前挑战
该数据集所应对的领域挑战在于葡萄牙语语音识别的多样性:不同口音、语速及录音条件导致识别难度显著,而现有基准往往缺乏针对特定语言插件的细粒度评估。构建过程中亦面临多重挑战:确保各插件在固定数据集修订版上运行,以维持结果可复现性;精确记录延迟与插件版本,避免因环境差异引入偏差;协调多插件输出格式,使其符合统一的JSONL契约。此外,盲测池与ELO阶梯的生成需要严格的数据对齐与统计处理,以保障排名公正。这些挑战共同凸显了在开源生态中实施标准化语音识别基准测试的复杂性。
常用场景
经典使用场景
在语音识别技术迭代进程中,构建标准化、可复现的评测基准乃是推动领域发展的基石。ovos-stt-bench-mls-pt-PT数据集依托多语言LibriSpeech语料库,聚焦葡萄牙语(pt-PT)场景,为自动语音识别系统提供逐片段转写预测的基准测试环境。其经典使用场景在于,研究者将不同语音识别插件在统一数据集划分下的转写结果与该基准进行比对,以量化评估各系统在葡萄牙语语音上的识别精度与响应延迟。该数据集通过固定数据集修订版本、记录插件版本及推理时延,确保了评测过程的可追溯性与公平性,成为开放语音操作系统生态中衡量语音转写性能的核心参照。
解决学术问题
语音识别研究长期面临评测标准不一、复现困难等挑战,尤其在低资源语言或特定方言变体上,缺乏统一基准导致性能对比缺乏说服力。该数据集通过提供标准化的逐片段预测记录,解决了跨系统比较中因数据版本漂移、预处理差异而引入的偏差问题。其意义在于,为葡萄牙语语音识别研究建立了一个可复现的评测基线,使得不同学术团队或工业界方案能够在相同条件下进行公平竞技,从而加速模型迭代与错误分析。此外,该数据集所采用的竞技场契约机制,为语音识别领域的基准测试方法学提供了新范式,有助于推动评测协议向更严谨、更透明的方向发展。
实际应用
在智能语音交互产品落地过程中,选择适配目标语言与场景的语音识别引擎至关重要。ovos-stt-bench-mls-pt-PT数据集为开发者提供了针对葡萄牙语市场的实证依据,使其能够依据基准测试结果,从多个候选语音识别插件中甄选出识别准确率高、延迟低的方案。实际应用中,该数据集支撑的评测看板与盲测对战池,可辅助产品团队在部署前完成性能预估与风险规避。同时,基于该数据集生成的ELO等级分梯,为语音识别服务的持续集成与版本更新提供了量化监控手段,确保产品在迭代过程中语音转写质量始终符合预期,有效降低因识别错误导致的用户体验损失。
数据集最近研究
最新研究方向
在语音识别技术不断演进的背景下,ovos-stt-bench-mls-pt-PT数据集为葡萄牙语语音识别系统的公平比较提供了关键基准。该数据集基于facebook/multilingual_librispeech构建,记录了多种语音识别插件在片段级别的转录预测,并遵循OVOS插件竞技场的标准化契约(如固定数据集版本、插件版本及延迟指标),从而支持可复现的基准测试。当前研究热点聚焦于利用此类基准数据构建盲测对战池和ELO评级阶梯,以客观评估不同语音识别模型的性能差异。该数据集不仅推动了开放语音识别生态的透明化评估,还为欧洲下一代互联网计划下的多语言语音技术发展提供了重要支撑,对促进语音识别领域的可重复研究和社区协作具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务