遇见数据集

ovos-wake-word-bench-mlsw-negatives-en-US

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是 OVOS 唤醒词基准测试的负样本清单,仅包含剪辑标识符,而非音频文件。它从 Multilingual Spoken Words Corpus(MLCommons, CC-BY-4.0)中通过固定种子选取可复现的剪辑标识符列表,并记录种子和源行数,用于评估唤醒词插件在非唤醒词音频上的误接受率,确保不同插件之间的评分具有可比性。该清单以 Apache-2.0 许可证发布,音频数据需从原始语料库获取。

This dataset is a negative sample list for the OVOS wake word benchmark, containing only clip identifiers, not audio files. It selects a reproducible list of clip identifiers from the Multilingual Spoken Words Corpus (MLCommons, CC-BY-4.0) using a fixed seed, recording the seed and source line count, to evaluate the false acceptance rate of wake word plugins on non-wake-word audio, ensuring comparability of scores across different plugins. The list is released under the Apache-2.0 license, and audio data must be obtained from the original corpus.

创建时间:
2026-09-02
原始信息汇总

数据集概述

数据集名称ovos-wake-word-bench-mlsw-negatives-en-US

数据集类型:样本集清单(Manifest),非音频语料库

许可证:Apache-2.0

语言:英语(en)


核心功能与用途

该数据集是 OVOS 插件竞技场(Plugin Arena) 的基准测试样本集,并非直接提供音频内容。它主要用于:

  • 唤醒词插件测试提供固定、可复现的负样本集(即非唤醒词的干扰音频)
  • 实现不同唤醒词插件在相同音频片段上的公平性能比较,特别是误唤醒率(False-Accept Rate)的对比

数据来源与构建方式

  • 底层音频来源:从 Multilingual Spoken Words Corpus(MLCommons,许可证为 CC-BY-4.0)中选取音频片段
  • 抽样机制:使用固定随机种子(seeded)进行可复现的抽样,并记录了种子值及源数据行数
  • 不重新分发音频:原始音频仍由 MLCommons 独立存储,本数据仅提供片段标识符列表

许可与归属说明

项目 说明
本清单数据集 采用 Apache-2.0 许可证
底层音频数据 归属 MLCommons,遵循其 CC-BY-4.0 许可证及归属条款

相关链接

搜集汇总
数据集介绍
ovos-wake-word-bench-mlsw-negatives-en-US 数据集图片
构建方式
该数据集为OVOS Plugin Arena基准测试体系中的一项清单资源,并非直接存储音频的语料库。其构建过程基于固定随机种子,从MLCommons发布的多语种口语词语语料库(Multilingual Spoken Words Corpus)中精选出可复现的音频片段标识符列表,同时记录种子参数与源行数,确保不同唤醒词插件在评估时使用完全一致的负样本集合,从而保证误唤醒率指标的可比性。音频文件本身保留于原始语料库,不在此重复分发。
使用方法
此数据集主要面向OVOS Plugin Arena的基准评测流程,开发者可依据清单中记录的标识符,从MLCommons原始语料库中获取对应音频并加载至评测环境。具体使用规范及清单格式详见仓库内的规范文档,评测结果可实时公布于公开平台,以追踪各唤醒词插件的误激活表现。该数据集适用于学术研究与工业界的模型对比验证,助力唤醒词技术迭代优化。
背景与挑战
背景概述
智能语音交互系统的普及推动了唤醒词检测技术的快速发展,而针对不同唤醒词插件的性能评估亟需统一、可复现的基准测试资源。该数据集由OpenVoiceOS社区在OVOS Plugin Arena框架下创建,旨在为英语唤醒词插件提供一个标准化的负面样本集。其核心研究问题在于如何通过固定随机种子和来源数据行数,确保不同插件在同一组音频片段上进行公平评测,从而消除样本差异对误唤醒率比较的干扰。该清单基于MLCommons的多语种口语词汇语料库构建,虽不直接分发音频,但通过记录明确的标识符与复现机制,为插件开发者提供了可控的测试环境。自发布以来,它已成为OVOS插件竞技场中评估唤醒词误唤醒性能的重要参照,推动了相关插件在真实场景下的鲁棒性优化,对语音助手生态的规范化测评具有积极意义。
当前挑战
构建该负面样本清单的主要挑战源于语音领域的固有复杂性和评测公平性的严格要求。领域问题层面,唤醒词检测需抵御日常环境中千差万别的非目标语音干扰,而负面样本缺乏统一来源与筛选标准时,不同插件的误唤醒率难以跨实现对比,成为限制技术迭代的瓶颈。构建过程层面,由于原始语料库规模庞大,选取代表性片段需兼顾多样性和可复现性,固定随机种子虽保证了样本一致性,却也可能引入选择偏差,无法全面代表真实声学场景。同时,遵循Apache-2.0与CC-BY-4.0协议平衡了数据共享与版权归属,但音频不随清单分发,要求研究者额外访问MLCommons资源,增加了使用门槛。这些问题共同构成了公平、可扩展的评测体系设计的核心挑战。
常用场景
经典使用场景
该数据集在智能语音交互领域占据重要地位,作为唤醒词系统的负样本基准,其主要应用场景集中于评估各类唤醒词引擎的误唤醒率。研究者利用MLCommons Multilingual Spoken Words Corpus中的英文语音片段,通过固定随机种子挑选出具有代表性与挑战性的负样本集合,以此构建标准化的测试协议。此协议确保了评测过程的可复现性与公平性,使得不同唤醒词插件在相同条件下接受检验,为技术选型提供客观依据,进而促进该领域模型的良性迭代与优化。
解决学术问题
该数据集精妙地回应了唤醒词评估中固有的样本偏差与结果不可比性难题。通过锚定具体的随机种子,系统性地排除音频来源与采样过程中的随机干扰,创建了一个严格统一的评测基准,令各项研究报告之间具备可对照性。它有效降低了评估成本,免去各家重复构建负样本的繁冗工作。此基准的建立,对于提高唤醒词引擎鲁棒性、减少因背景噪声及非目标语言词汇引发的虚警,具有显著的推动作用,并为构建更严苛的噪声场景评估方案奠定基石。
实际应用
在实际应用中,该基准数据集深度融入OpenVoiceOS插件竞技场(Plugin Arena)的自动化评测管线,充当测评智能音箱、移动终端及车载系统内唤醒词算法的核心工具。通过严格比对各插件在同一负样本集上的表现,开发者得以精准定位误唤醒频发的语音学诱因,继而针对性地优化后端声学模型及阈值调整策略。该数据集同样适用于唤醒词门槛的校准与降误触设计,为用户于起居室、办公室等多噪声场景下提供更为可靠、沉浸的免提交互体验。
数据集最近研究
最新研究方向
在智能语音交互领域,唤醒词系统的鲁棒性评估正日益受到重视,而OVOS唤醒词基准测试的负样本清单恰好为这一前沿探索提供了标准化基石。该数据集通过从多语言口语词汇语料库中精挑细选并固定种子,构建了可复现的音频片段列表,使得不同唤醒词插件能在完全一致的负样本上进行性能比对,从而显著提升误唤醒率测试的公平性与可比性。这一创新方法不仅推动了开源语音助手生态中唤醒词模型的透明化评估,还为跨平台、跨设备的性能基准树立了新范式,其影响深远,为构建更可靠、更个性化的语音交互体验奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务