遇见数据集

ovos-wake-word-bench-mlsw-negatives-es-ES

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是一个样本集清单,用于OVOS插件竞技场(OVOS Plugin Arena),而非音频语料库。它包含一个可重复的、经过种子设定的剪辑标识符列表,这些标识符选自Multilingual Spoken Words Corpus(MLCommons,CC-BY-4.0),并记录了种子和源行数,以确保所有针对这些负样本进行评分的唤醒词插件都在完全相同的剪辑上评分,从而使误接受率在不同插件之间具有可比性。音频未在此重新分发,仍保留在MLCommons下,受其自身许可和署名条款约束。此清单以Apache-2.0许可证发布,与竞技场的其他基准测试仓库一致。

This dataset is a sample set list for the OVOS Plugin Arena, not an audio corpus. It contains a reproducible, seeded list of clip identifiers selected from the Multilingual Spoken Words Corpus (MLCommons, CC-BY-4.0), along with the seed and source line numbers, to ensure that all wake word plugins scoring on these negative samples are evaluated on exactly the same clips, making false acceptance rates comparable across plugins. The audio is not redistributed here and remains under MLCommons, subject to its own license and attribution terms. This list is released under the Apache-2.0 license, consistent with other benchmark repositories in the arena.

创建时间:
2026-09-02
原始信息汇总

数据集概述:ovos-wake-word-bench-mlsw-negatives-es-ES

数据集类型与用途

这是一个样本集清单(manifest),而非音频语料库,专为 OVOS 插件竞技场(Plugin Arena)设计,用于评估西班牙语(es)唤醒词插件的误唤醒率(false-accept rates)。

数据来源与筛选机制

  • 源数据:来自 Multilingual Spoken Words Corpus(MLCommons 发布,许可协议为 CC-BY-4.0)。
  • 生成方式:通过固定随机种子,从源语料库中可重复地选取一批音频片段标识符,并记录种子值及源数据行数,确保不同唤醒词插件在完全相同的片段上接受评分,从而实现跨插件的误唤醒率可比性。

音频与授权说明

  • 音频文件不在此数据集中重新分发,仍归属于 MLCommons 原始许可与署名条款下。
  • 本清单本身以 Apache-2.0 许可发布,与竞技场其他基准测试仓库一致。

相关资源链接

  • 评测结果:https://openvoiceos.github.io/ovos-plugin-arena/
  • 清单格式规范:详见 https://github.com/OpenVoiceOS/ovos-plugin-arena 中的 docs/SPECIFICATION.md 文档。

语言与授权信息

  • 语言:西班牙语(es)
  • 许可证:Apache-2.0
搜集汇总
数据集介绍
ovos-wake-word-bench-mlsw-negatives-es-ES 数据集图片
构建方式
该数据集为OVOS唤醒词基准测试框架下的负面样本清单,并非音频语料库本身。其构建方式是从MLCommons发布的多语种口语词汇语料库中,依据一个固定的随机种子,可重复地抽取一批音频样本的标识符。清单中明确记录了种子值及源数据集的行数,确保任何在此负面样本集上评估的唤醒词插件都面对完全一致的测试音频,从而实现跨插件的误唤醒率可比性。音频内容本身并未重新分发,仍留在MLCommons语料库中,遵循其原始许可协议。此清单以Apache-2.0许可发布,与基准测试框架下的其他仓库保持一致。
使用方法
使用该数据集时,研究人员和开发者需先遵循MLCommons语料库的许可条款访问底层音频,然后依据清单中记录的种子和标识符,从语料库中精确提取对应的负面样本音频。随后,将这些音频输入至待评估的唤醒词插件中,记录其触发情况。根据基准测试规范,即可计算该插件的误唤醒率。若要比较不同插件的性能,需确保所有插件均使用此同一清单所指定的音频集进行测试,以保证公平性和结果的可比性。详细的使用明细可参考OVOS插件竞技场文档中的规范说明,其提供了清单格式及评估流程的完整指引。最终结果可提交至竞技场官方页面,以参与社区排行榜的排名。
背景与挑战
背景概述
该数据集源于OpenVoiceOS项目,由OVOS Plugin Arena团队于近期创建,旨在为西班牙语语音助手唤醒词插件的性能评估提供标准化基准。其核心研究问题在于解决多说话人、多场景下唤醒词误唤醒率的可比性问题,通过从MLCommons的多语种口语词汇语料库中精选样本集,构建可复现的负样本清单,从而推动唤醒词技术在不同插件间的公平比较。作为开源语音生态的重要基础设施,该工作填补了西班牙语唤醒词评估资源的空白,对提升智能语音交互的鲁棒性与用户体验具有深远影响。
当前挑战
面临的领域挑战在于唤醒词检测系统需在真实环境中区分目标词与海量语音干扰,而现有评估方案往往因样本集不一致导致误唤醒率难以横向对比,尤其在西班牙语等低资源语言中,数据稀缺且口音差异大,进一步加剧了算法泛化难题。构建过程中遭遇的挑战包括确保所选负样本的跨插件公平性,即所有插件须基于完全相同的剪辑进行测试,同时需严格遵循MLCommons的许可条款,不重新分发音频,仅提供可复现的标识清单,这要求精心设计种子与记录机制,以平衡数据代表性、可重复性与合规性。
常用场景
经典使用场景
在语音交互系统的研发过程中,唤醒词引擎的鲁棒性评估是一项至关重要的环节。该数据集以清单形式,从多语言口语词语语料库中精心挑选并固定了一组负样本片段。这些样本专门用于测试唤醒词插件在非目标语音输入下的拒绝能力,为不同插件在统一基准上的性能对比提供了客观依据。研究者可利用此清单复现一致的测试条件,准确衡量各系统在误唤醒率上的差异。
解决学术问题
在学术界,唤醒词检测研究常面临一个核心难题:不同研究工作采用各自的负样本集,导致实验结果难以横向比较。此数据集的问世,通过引入可复现的、种子化的负样本清单,解决了评估标准不统一的问题。它使研究者能在完全相同的音频片段上验证算法,显著提升了实验结果的可信度与可比性,进而推动了该领域验证方法的规范化进程,为构建更可靠的基准测试体系奠定了坚实基础。
实际应用
在产业实践层面,智能音箱、车载助手及移动设备中的语音激活功能,均依赖高性能的唤醒词插件。本清单可直接服务于OpenVoiceOS插件竞技场,为不同插件提供公平的“考官”,从而筛选出在嘈杂或无关语音环境下误报率更低的方案。产品团队借助此清单,能在开发阶段提前评估并优化插件性能,确保最终搭载的语音交互系统具备更佳的实用性与用户体验。
数据集最近研究
最新研究方向
该数据集聚焦于唤醒词检测领域中的负样本基准测试方法学研究,通过可复现的样本清单设计,为多语种唤醒词插件的性能比较提供了严谨的评估框架。其最新研究方向在于构建跨插件可比的误唤醒率度量体系,从而推动个性化语音交互设备在嘈杂环境中的可靠性提升。结合MLCommons多语种口语词汇语料库的开放生态,该工作促进了唤醒词引擎的公平性评测与标准化进程,对智能家居、移动设备等场景下低功耗语音激活技术的迭代具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务