遇见数据集

ovos-wake-word-bench-mlsw-negatives-pl-PL

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是一个样本集清单,专为OVOS插件竞技场设计,用于评估唤醒词检测插件的负样本性能。它包含从Multilingual Spoken Words Corpus(MLCommons, CC-BY-4.0)中选取的波兰语(pl-PL)剪辑标识符列表,该列表基于预设种子随机生成且可复现,并记录了种子和源数据行数,确保不同插件在完全相同的剪辑上进行评分,从而实现假接受率(false-accept rates)的公平比较。音频文件本身不在此仓库中重新分发,需从原始来源获取。本数据集采用Apache-2.0许可证发布。

This dataset is a sample list designed for the OVOS Plugin Arena to evaluate the negative sample performance of wake word detection plugins. It contains a list of Polish (pl-PL) clip identifiers selected from the Multilingual Spoken Words Corpus (MLCommons, CC-BY-4.0), generated randomly based on a preset seed and reproducible, with seed and source data row counts recorded. This ensures that different plugins are scored on exactly the same clips, enabling fair comparison of false-accept rates. The audio files themselves are not redistributed in this repository and must be obtained from the original source. This dataset is released under the Apache-2.0 license.

创建时间:
2026-09-02
原始信息汇总

数据集概述

该数据集是一个用于 OVOS 插件竞技场(Plugin Arena)的样本清单(manifest),而非实际的音频语料库。

核心内容

  • 用途:为 OVOS 唤醒词插件提供一组固定的负样本(negatives)测试集,用于评估各插件的误唤醒率(false-accept rates)。
  • 数据来源:从 Multilingual Spoken Words Corpus(MLCommons,CC-BY-4.0 许可)中选取的片段标识符列表。
  • 选择机制:记录种子值(seed)和源行数,确保可复现;每个唤醒词插件在完全相同的音频片段上进行评分,从而实现公平比较。
  • 音频状态:音频文件不在此重新分发,仍归 MLCommons 所有,并遵循其原始许可与署名要求。

技术属性

  • 语言:波兰语(pl)
  • 许可证:Apache-2.0(与竞技场其他基准仓库一致)

外部链接

搜集汇总
数据集介绍
ovos-wake-word-bench-mlsw-negatives-pl-PL 数据集图片
构建方式
该数据集并非一个独立的音频语料库,而是一份精心设计的样本清单(manifest),源自MLCommons的多语言口语词汇语料库。它通过固定的随机种子,以可复现的方式从源语料库中筛选出一系列音频片段标识符,并记录了种子值与源行数,确保所有唤醒词插件在完全相同的声音样本上进行负面测试,从而实现误唤醒率的公平比较。音频文件本身不随清单分发,仍保留在源数据集中,遵循其原始的CC-BY-4.0许可条款。
特点
该数据集的核心特质在于其严谨的可复现性与比较基准功能。作为OVOS插件竞技场的基准套件之一,它专为评估唤醒词插件的抗干扰能力而设计,所有参赛插件面对同一批负面样本,从而确保误接受率指标的可比性。数据集以Apache-2.0许可证发布,与竞技场其他基准存储库保持一致,并附带详细的规格说明文档,为开发者提供清晰、标准化的使用指引。
使用方法
该数据集主要供唤醒词插件开发者使用,用于测试其唤醒词模型在非目标语音上的误触发情况。开发者可依据清单中的音频标识从MLCommons语料库获取对应音频,并利用此清单运行基准测试,评估插件性能。结果可提交至OVOS插件竞技场,并参考其公开排行榜进行对比分析。使用方法详见OVOS插件竞技场仓库中的规格文档,便于无缝集成至现有基准测试流程。
背景与挑战
背景概述
该数据集由OpenVoiceOS团队于2024年创建,旨在为OVOS插件竞技场提供标准化的负样本测试清单。其核心研究问题在于评估不同唤醒词插件在波兰语环境下的误唤醒率,以促进公平比较与优化。该数据集基于MLCommons的多语言口语词语语料库,通过可重复的采样方法生成固定子集,确保各插件在相同音频片段上接受测试,从而提升基准测试的可信度与可复现性。作为开放式语音生态的一部分,它为多语言唤醒词检测领域提供了重要的评估工具,影响力体现在推动了插件性能的透明化与社区协作。
当前挑战
该数据集面临的挑战一方面源于领域问题,即唤醒词检测在真实环境中需应对多说话者、噪声及口音差异,误唤醒率成为关键瓶颈,尤其是波兰语等资源较少语言,高质量负样本稀缺。另一方面,构建时需从大规模语料中精准筛选并固定样本集,确保跨插件可比性,同时避免音频重分发带来的许可复杂度,这要求妥善记录来源与知识产权。此外,如何平衡样本的代表性与规模,以及维护基准的持续更新,亦构成显著挑战。
常用场景
经典使用场景
该数据集作为唤醒词插件竞技场中的负样本清单,其经典使用场景在于对各类波兰语唤醒词检测插件进行统一的鲁棒性评估。通过固定随机种子,从多语言口语词汇语料库中选取清晰可复现的音频片段,确保不同插件在完全相同的干扰集上进行测试,从而实现对虚警率(False Accept Rate)的标准化横向比较。研究者可基于此清单构建统一的负样本测试集,旨在验证唤醒词系统在非目标语音下的抗干扰能力,是语音交互领域评估插件性能不可或缺的基准工具。
实际应用
在实际应用中,该数据集主要用于语音助手、智能家居及车载系统等场景下唤醒词插件的性能筛选。开发者或集成商在选用或部署波兰语唤醒词方案时,可凭借此清单快速测评候选插件在嘈杂环境或非唤醒语音干扰下的稳定性,从而甄别出误唤醒率最低、最适于产品化的模型。同时,该清单的Apache-2.0许可和标准化设计简化了内部质检流程,帮助团队在开发迭代中持续监控虚警表现,最终提升终端用户体验的流畅度与隐私安全性。
衍生相关工作
该数据集作为OVOS插件竞技场生态的重要组成部分,衍生出了多项关键工作。最直接的关联是竞技场基准测试平台,它汇总了不同插件的性能榜单;此外,数据清单格式规范被独立成文,方便其它语种或任务构建同类基准。受其启发,研究者扩展了多语言负样本清单,并开发了自动化评估工具链,促进社区对唤醒词插件进行持续、可仿效的性能跟踪。这些后续工作共同推动了开放语音技术评测体系的完善,使其成为智能语音系统研发中可信赖的参考资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务