遇见数据集

OpenVoiceOS/intents-for-eval

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

OVOS意图基准数据集是一个用于语音助手意图分类和槽位填充的多语言基准测试数据集,旨在评估不同意图引擎(如基于关键词、模板或嵌入的引擎)的泛化能力。数据集覆盖12种语言(包括英语、葡萄牙语、西班牙语、法语、德语、意大利语、荷兰语、加泰罗尼亚语、加利西亚语、丹麦语和巴斯克语),包含50个意图和10个领域(如媒体、定时器警报、智能家居、通信等)。数据集分为训练集和测试集:训练集包括模板文件(每语言20个模板×50个意图,共12,000行)和关键词文件(每语言50个规则,共600行);测试集包含自然语言句子(每语言1,750行,共21,000行),分为模板、释义、近OOD、远OOD、ASR噪声和打字错误等桶。数据集通过人工指导生成,使用Claude Opus模型,并遵循严格的验证流程。数据集用于意图分类和槽位提取的评估,支持多种指标(如准确率、F1分数、假阳性率等),并遵循Apache-2.0许可证。

The OVOS Intent Benchmark Dataset is a multilingual benchmark dataset tailored for intent classification and slot filling tasks in voice assistant systems, aiming to evaluate the generalization performance of diverse intent engines (e.g., keyword-based, template-based, or embedding-based engines). It covers 12 languages including English, Portuguese, Spanish, French, German, Italian, Dutch, Catalan, Galician, Danish, and Basque, and contains 50 intents across 10 domains such as media, timer/alarm, smart home, communication, and more. The dataset is split into training and test sets: the training set consists of template files (20 templates × 50 intents per language, totaling 12,000 lines) and keyword files (50 rules per language, totaling 600 lines); the test set contains natural language sentences (1,750 lines per language, totaling 21,000 lines) divided into buckets such as templates, paraphrases, near out-of-distribution (OOD), far OOD, ASR noise, and typos. The dataset was generated under human guidance using the Claude Opus model and follows a strict validation pipeline. It is used for evaluating intent classification and slot extraction, supports multiple metrics such as accuracy, F1-score, false positive rate, and more, and is released under the Apache-2.0 license.

提供机构:
OpenVoiceOS
原始信息汇总

数据集概述

该数据集是 OVOS Intent Benchmark,专为语音助手意图分类和槽位提取任务设计的基准数据集。

核心信息

  • 目的:用于 意图解析器(intent-parser)基准测试,衡量 OVOS 意图插件(如基于关键词、模板或嵌入的引擎)的泛化能力,而非记忆能力。作为 OVOS 意图分类数据集的一部分,用于 OVOS 插件竞技场(OVOS Plugin Arena)基准测试。
  • 任务:文本分类(Text Classification)、词元分类(Token Classification)。
  • 数据模态:文本(Text)。
  • 数据格式:json。
  • 数据集大小:10K - 100K 条。
  • 许可证:Apache-2.0。

具体数据统计

项目 内容
意图数量 50 个(覆盖 10 个领域)
语言数量 12 种
训练集(模板) 每语言 1,000 行(50 个意图 × 20 个模板),共 12,000 行
训练集(关键词) 每语言 50 行
测试集 每语言约 1,750 行
子集 (Subsets) 36 个子集,按语言-类型(如 ca-ES-keywords, en-US-templates, de-DE-test)划分
分割 (Splits) 包含 train 分割

语言

涵盖 12 种语言:英语(en-US)、葡萄牙语(pt-PT, pt-BR)、西班牙语(es-ES)、法语(fr-FR)、德语(de-DE)、意大利语(it-IT)、荷兰语(nl-NL)、加泰罗尼亚语(ca-ES)、加利西亚语(gl-ES)、丹麦语(da-DK)、巴斯克语(eu-ES)。

领域与意图

数据集覆盖 10 个领域,包含 50 个意图,例如:

  • 媒体 (media):播放歌曲、暂停、恢复、设置音量、跳过曲目。
  • 计时器与闹钟 (timers_alarms):设置/取消计时器、设置/列出/小睡闹钟。
  • 智能家居 (smarthome):开关灯、设置亮度/恒温器、锁门。
  • 通讯 (communication):呼叫联系人、发送/阅读消息、挂断、视频通话。
  • 导航 (navigation):导航至某地、查找附近、查询ETA/交通状态、取消路线。
  • 搜索与问答 (search_qa):定义单词、事实查询、人物查询、翻译短语、拼写单词。
  • 天气 (weather):今日天气、天气预报、特定地点天气、湿度、风速。
  • 日历 (calendar):创建/列出/取消/重新安排事件、下一个事件。
  • 系统控制 (system_control):关机、重启、设置屏幕亮度、静音、更改语言。
  • 新闻 (news):阅读头条、阅读特定主题新闻、下一条/上一条新闻、选择新闻源。

数据生成与文件结构

  • 三文件布局:每种语言包含三种类型的文件:
    • train_templates.jsonl:基于模板的短语。
    • train_keywords.jsonl:基于关键词的短语(Adapt 风格规则)。
    • test.jsonl:测试集。
  • 数据生成:通过编写规则(Authoring rules)、测试桶(Test-bucket authoring)和关键词规则(Keyword-rule authoring)生成。

其他信息

  • 标签:包含 intent-classification, slot-filling, voice-assistant, ovos, multilingual
  • 库 (Libraries):支持 Datasets, pandas, Polars 等。
  • 资金:由 TigreGotico 为 OpenVoiceOS 开发,作为“OpenVoiceOS — 从测试版到突破”(From Beta to Breakthrough)项目的一部分,由欧盟委员会下一代互联网计划下的 NGI0 Commons Fund 资助(授权协议号 101135429)。
搜集汇总
数据集介绍
OpenVoiceOS/intents-for-eval 数据集图片
构建方式
该数据集由Claude Opus在人工深度指导下生成,严格遵循一份包含10个领域、50个意图的固定分类体系。每个意图与语言的配对单元均经过手工创作,而非通过基于英语模板的机械翻译流水线产出,从而确保各语言获得地道的本地化词汇。数据生成采用批处理与质量门控机制,每完成一个意图在12种语言中的创作批次后,即通过验证脚本与覆盖率图进行检查,约20%的批次需经修正方可进入下一轮。训练集分为模板型与关键词型两种格式,分别服务于不同的意图解析引擎;测试集则包含模板变体、语义改写、近域外、远域外、ASR噪声以及拼写错误等多种子集,旨在全面评估模型的泛化能力与鲁棒性。
特点
该数据集专为语音助手的意图分类与槽位抽取任务设计,具备多范式兼容性,可同时用于基于关键词、模板及嵌入表示的意图引擎的性能评估。数据集覆盖12种语言,每种语言独立配置,包含完整的训练与测试划分,且测试集通过精细化的桶结构实现多层次评估,包括对近域外与远域外样本的区分,有效衡量模型在语义混淆与无意义输入上的表现。其特征在于严格避免复用现有OVOS技能中的意图名称,并精心设计槽位密集型与槽位缺失型意图,以挑战引擎的边界情况。同时,关键词规则中引入了礼貌标记等常见噪声词汇,使评估场景更贴近真实交互。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,每种语言提供三种配置项:模板训练集、关键词训练集与测试集,三者具有不同的行结构与模式。模板训练集适用于Padacioso、Padatious、Nebulento及基于嵌入的引擎,每意包含20条槽位占位符模板;关键词训练集则专为Adapt与Palavreado引擎设计,每意图一条完整的规则,包含必需词汇组与可选词汇组。测试集为完全自然化的句子,附带标准答案意图与槽位信息。用户若开发适配器,需实现指定的训练与预测接口,即可利用内置的基准评测脚本进行性能排名、混淆矩阵分析与延迟测量。
背景与挑战
背景概述
随着智能语音助手的普及,意图分类与槽位填充(slot-filling)技术成为自然语言处理领域的核心研究方向,尤其在多语言、多领域场景下,模型泛化能力与鲁棒性的评估至关重要。OVOS Intent Benchmark数据集(intents-for-eval)由OpenVoiceOS团队在TigreGotico主导下创建,依托欧盟Next Generation Internet计划的NGI0 Commons Fund资助,旨在为语音助手意图解析引擎(如Adapt、Padatious等)提供一套范式中立、可复现的评测基准。该数据集涵盖50个意图、10个领域(如媒体、智能家居、导航等)及12种语言(包括英语、葡萄牙语、西班牙语、巴斯克语等低资源语言),总计33,600条数据,重点关注模型对训练模板的泛化能力而非机械记忆,对推动多语言语音助手系统的公平比较与标准化评测具有显著影响力。
当前挑战
该数据集在构建与应用中面临多重挑战。首先,在领域问题层面,语音助手意图分类需处理来自不同语言的词汇差异(如西班牙语"pon"与英语"play")、近义词混淆(如媒体领域内"next_story"与"previous_story"的区分)以及离域(out-of-domain)话语的拒识能力,这对模型在多语言、多意图间的鲁棒泛化提出高要求。其次,在构建过程中,为保证语言独立性,研究人员逐意图逐语言手工标注模板与测试用例,避免依赖英语模板的机器翻译流程,但因此面临跨语言专家审核缺失的局限(如巴斯克语、加利西亚语等低资源语言仍需母语者验证)。此外,测试集设计的多样性(如反义改写、近域干扰、ASR噪声、拼写错误等)增加了数据构建的复杂度,而训练集与测试集间槽位值共享的问题则可能导致评测结果对真实开放词汇场景的反映不够充分。
常用场景
经典使用场景
在语音助手与对话系统的学术研究与工业实践中,意图识别(Intent Classification)与槽位填充(Slot Filling)始终是支撑人机交互理解能力的核心任务。OVOS Intent Benchmark(intents-for-eval)数据集正是为此而生,提供了一个覆盖12种语言、50种意图及10个领域的多语言、多范式基准测试集。其最经典的使用场景在于评估和比较不同意图解析引擎的泛化能力,包括基于关键词的Adapt与Palavreado、基于模板的Padatious与Padacioso,以及基于嵌入向量的M2V与层次化KNN等方法。通过精心设计的测试样本,该数据集能够衡量模型在面对模板变体、同义改写、领域内近义词混淆乃至领域外噪声输入时的鲁棒性,从而真实反映模型是真正理解用户意图,还是仅仅机械记忆训练数据。
衍生相关工作
该数据集催生了一系列围绕多语言意图理解评测与引擎优化的经典工作。最为直接的是OVOS Plugin Arena意图基准测试框架,该框架基于此数据集为OVOS生态内的所有意图插件提供标准化的排行榜,成为开发者选择与对比不同解析方案的核心参考。此外,研究者基于该数据集衍生了对比不同意图解析范式(如关键词规则、模板匹配与基于嵌入的检索)在跨语言场景下性能差异的系列实验,揭示了模板方法在小样本多语言设置下的数据效率优势,以及嵌入方法在自然语言改述上的鲁棒性。数据集细粒度的测试分桶还启发了关于意图引擎抗噪声能力与域外拒识能力的专项研究,推动了如层次化KNN与混合解析器等改进方法的诞生,这些工作均被收录于OVOS技术博客与社区论文中,持续影响开源语音交互系统的设计方向。
数据集最近研究
最新研究方向
面向多语言语音助手的意图分类与槽填充范式无关基准测评,重点关注跨语言泛化能力与域内外混淆度量,涵盖12种语言、50个意图及10个领域,通过模板、关键词与嵌入驱动的多种引擎对比,系统评估模型在近义改写、近域混淆及ASR噪声等挑战场景下的鲁棒性,为开源语音助手生态提供标准化评测框架,推动意图解析技术从记忆式匹配向通用化理解的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务