遇见数据集

ovos-wake-word-bench-mlsw-negatives-de-DE

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是用于 OVOS 插件竞技场(OVOS Plugin Arena)的样本集清单(manifest),并非音频语料库。它包含一个基于种子可复现的剪辑标识符列表,这些标识符选自 Multilingual Spoken Words Corpus(MLCommons, CC-BY-4.0),并记录了种子和源行数。该清单的目的是确保所有针对这些负样本进行评分的唤醒词插件都在完全相同的剪辑上运行,从而使不同插件之间的误接受率具有可比性。音频文件并未在此重新分发,用户需自行从原始来源获取。该清单采用 Apache-2.0 许可证。

This dataset is a manifest for the OVOS Plugin Arena, not an audio corpus. It contains a reproducible list of clip identifiers based on a seed, selected from the Multilingual Spoken Words Corpus (MLCommons, CC-BY-4.0), with records of the seed and source line numbers. The purpose of this manifest is to ensure that all wake word plugins scoring on these negative samples run on exactly the same clips, making false acceptance rates comparable across different plugins. Audio files are not redistributed here; users must obtain them from the original source. This manifest is licensed under Apache-2.0.

创建时间:
2026-09-02
原始信息汇总

数据集概述

数据集名称ovos-wake-word-bench-mlsw-negatives-de-DE

许可协议:Apache-2.0
语言:德语(de)

核心用途

这是为 OVOS 插件竞技场(Plugin Arena)构建的样本集清单(manifest),并非音频语料库本身。其主要用途是为德语唤醒词插件的性能评估提供统一的负面样本集合,确保不同插件在完全相同的音频片段上进行测试,从而保证误唤醒率(false-accept rates)的可比性。

数据来源与构建方式

  • 源数据集Multilingual Spoken Words Corpus(MLCommons 发布,采用 CC-BY-4.0 许可)
  • 构建逻辑:通过固定的随机种子,从源数据集中可复现地选取一组片段标识符(clip identifiers),并记录种子信息及源数据行数。任何唤醒词插件在对抗这些负面样本进行评测时,都会使用完全相同的音频片段。

分发说明

  • 音频文件并不在此仓库中重新分发,原始音频仍归 MLCommons 所有,遵循其本身的许可与署名条款。
  • 本清单以 Apache-2.0 许可发布,与竞技场其他基准存储库保持一致。

相关链接

  • 评测结果页面:https://openvoiceos.github.io/ovos-plugin-arena/
  • 清单格式规范(docs/SPECIFICATION.md):详见 https://github.com/OpenVoiceOS/ovos-plugin-arena
搜集汇总
数据集介绍
ovos-wake-word-bench-mlsw-negatives-de-DE 数据集图片
构建方式
该数据集为OVOS插件竞技场量身定制的负样本清单,并非传统音频语料库,而是从MLCommons发布的多语种口语词汇语料库中,依据既定随机种子,以可复现的方式筛选出一系列音频片段标识符。构建过程严格记录种子值与源数据行数,确保任何唤醒词插件在评测时均面对完全相同的音频样本,从而保证各插件误唤醒率之比较具备严谨的公平性与可对照性。
特点
此清单的设计精妙之处在于其元数据导向的形态,不直接分发音频,而是通过清单形式引导使用者至原始语料库,规避了版权与分发上的繁复约束,同时以Apache-2.0许可发布,与竞技场其他基准仓库保持许可一致性。种子固定与来源记录机制赋予了数据极强的可复现性,使得不同时间、不同研究者所进行的评测结果能够在同一基准上无缝对齐,有力支撑了唤醒词领域模型性能的横向比较与纵向跟踪。
使用方法
使用时,研究者需依据清单中列出的剪辑标识符,前往MLCommons多语种口语词汇语料库获取对应音频。该清单专供OVOS插件竞技场使用,评测流程遵循其GitHub仓库中docs/SPECIFICATION.md所规定的格式,最终评测结果可于OpenVoiceOS官方网页上查询。旨在为德语环境下的唤醒词插件提供统一的标准负样本集,以客观评估各插件的误唤醒指标。
背景与挑战
背景概述
随着智能语音助手的普及,唤醒词检测作为人机交互的入口,其性能评估日益重要。ovos-wake-word-bench-mlsw-negatives-de-DE数据集由OpenVoiceOS社区创建,旨在为德语唤醒词插件提供标准化的负面样本基准。该数据集并非传统音频语料库,而是一个基于MLCommons多语言口语词库(Multilingual Spoken Words Corpus)的样本清单,通过固定种子选取可复现的音频剪贴标识符,确保不同唤醒词插件在相同负面样本上测试,从而公平比较误触发率。其研究成果通过OVOS插件竞技场平台发布,对开源语音助手生态的评测标准化具有重要影响。
当前挑战
该数据集面临多重挑战。在领域层面,唤醒词检测的核心难点在于区分目标词与相似语音,尤其在噪声环境和多口音场景下,负面样本的多样性对降低误唤醒率至关重要。该数据集通过从MLCommons语料库中精选德语负面样本,旨在模拟真实环境中的干扰语音,但需要确保样本的代表性和均衡性。在构建过程中,挑战在于维护样本的可复现性和跨插件可比性,同时遵守原始语料库的许可协议,不直接分发音频,仅提供元数据清单,这要求精确记录种子信息和源数据行数,以支持后续扩展和验证。
常用场景
经典使用场景
该数据集作为唤醒词插件竞技场(OVOS Plugin Arena)的基准测试清单,并非独立的音频语料库。它从多语言口语词汇语料库(Multilingual Spoken Words Corpus)中精心挑选并固定种子,生成可复现的音频片段标识列表,专门用于德国语言环境下唤醒词插件的负样本测试。研究者和开发者可依据此清单,在统一条件下评估不同唤醒词插件的误唤醒率,确保各插件在完全相同的音频片段上进行性能比较,从而实现公平、可验证的横向评测。
解决学术问题
该数据集有效解决了语音唤醒词领域长期存在的评测标准不统一、结果难以复现的学术痛点。通过提供固定的、带种子的负样本清单,它使得不同唤醒词插件在相同条件下进行测试成为可能,消除了因样本差异导致的性能偏差,显著提升了误唤醒率评估的可靠性与跨系统可比性。这一机制为学术研究提供了严谨的基准,促进了唤醒词检测算法的客观比较与迭代优化,对推动语音交互技术的稳健发展具有基础性意义。
衍生相关工作
该数据集衍生并支撑了OpenVoiceOS生态下的系统化评测工作,其相关结果公开于OVOS Plugin Arena的官方页面,并形成了规范化的清单格式说明文档(SPECIFICATION)。这些工作激励了更多研究者与开发者以统一的逻辑构建本地化、多语言的负样本评测资源集,推动了跨语种唤醒词评测体系的建立。此外,该模式也启发其他语音任务(如命令词识别)构建类似的固定样本清单,促进了整个开源语音社区在可重复性基准测试方面的实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务