遇见数据集

OpenVoiceOS/massive-templates

收藏
Hugging Face2026-06-13 更新2026-05-31 收录
官方服务:

资源简介:

MASSIVE Templates数据集是AmazonScience/massive数据集的机械转换版本,格式与OpenVoiceOS/intents-for-eval数据集兼容。该转换通过单一正则表达式处理MASSIVE的annot_utt字段,将每个话语转换为一个训练行,包含带槽位占位符(如{slot})的模板以及仅从该话语中提取的槽位示例列表。数据集涵盖52种语言/地区(包括英语、中文、西班牙语等),训练集每语言约13,500行(总计约704,000行),测试集每语言2,974行(总计约155,000行)。数据用于意图分类和槽位填充任务,支持多语言自然语言理解研究。数据集采用Apache-2.0许可证,转换工具和加载方法在OpenVoiceOS/ovos-intent-benchmark仓库中提供。

MASSIVE Templates is a mechanical re-cast of the AmazonScience/massive dataset into the same row shape as OpenVoiceOS/intents-for-eval. The conversion uses a single regex pass over MASSIVEs annot_utt field to transform each utterance into a training row with a bracket template (containing {slot} placeholders) and a list of slot examples drawn only from that single utterance. The dataset covers 52 BCP-47 locales (including English, Chinese, Spanish, etc.), with approximately 13.5k train rows per locale (~704k total) and 2,974 test rows per locale (~155k total). It is designed for intent classification and slot-filling tasks, supporting multilingual natural language understanding research. The dataset is licensed under Apache-2.0, and conversion tools and loading methods are available in the OpenVoiceOS/ovos-intent-benchmark repository.

提供机构:
OpenVoiceOS
原始信息汇总

数据集概述:OpenVoiceOS/massive-templates

  • 任务类型: 文本分类、Token 分类。
  • 数据模态: 纯文本。
  • 数据格式: JSON (具体为 JSON Lines 格式)。
  • 数据集规模: 总计约 100K - 1M 条样本。
  • 语言: 覆盖 52 个 BCP-47 区域设置(包括南非荷兰语、阿姆哈拉语、阿拉伯语等 48 种以上语言)。
  • 标签: 意图分类 (intent-classification), 槽位填充 (slot-filling), 多语言 (multilingual), OVOS, MASSIVE。
  • 许可证: Apache-2.0。
  • 相关论文: arXiv: 2204.08582 (MASSIVE 论文)。

数据集来源与目的

该数据集是 AmazonScience/massive 数据集的一个机械重构版本,旨在与 OpenVoiceOS/intents-for-eval 数据集的行格式保持一致。其核心目的是用于 意图解析器的基准测试,以评估 OVOS 意图插件的泛化能力,而非记忆能力。

数据分割与构成

  • 训练集: 每个区域设置约 13,500 行(由原始训练集和开发集合并而成),总计约 704,000 条。
  • 测试集: 每个区域设置 2,974 行,总计约 155,000 条。
  • 子集: 每个语言区域都包含 -templates-test 两个子集。训练数据中仅包含 train 分片。

数据转换方法

转换过程未使用任何大语言模型,仅通过一个正则表达式从 MASSIVE 数据集的 annot_utt 字段中提取信息:

  • 模板 (Template): 将原始标注中的 [slot : value] 替换为 {slot} 占位符得到。
  • 槽位 (Slots): 每个槽位的 examples 列表仅包含该条具体语句中的值,不会跨语句聚合。

数据示例 (训练集行结构)

一个典型的数据行包含以下字段:

  • intent_id: 意图标识符 (如 alarm:alarm_set)。
  • domain: 领域 (如 alarm)。
  • template: 带槽位占位符的模板 (如 wake me up at {time} on {date})。
  • slots: 槽位列表,每个槽位包含 nameexamples 字段。

文件布局

  • <locale>/train_templates.jsonl: 训练数据。
  • <locale>/test.jsonl: 测试数据。
  • 不包含 train_keywords.jsonl 文件。

加载方式

  1. 通过 OVOS 基准测试加载器: python from benchmark.datasets import get ds = get("massive_templates") train, test = ds.load("en-US")

  2. 直接通过 datasets 库加载: python from datasets import load_dataset templates = load_dataset("OpenVoiceOS/massive-templates", "en-US-templates", split="train") test = load_dataset("OpenVoiceOS/massive-templates", "en-US-test", split="test")

许可证与引用

  • 许可证: Apache-2.0 (继承自 MASSIVE 数据集)。
  • 引用: 使用该数据集时,请引用原始的 MASSIVE 论文 (arXiv: 2204.08582)。
搜集汇总
数据集介绍
OpenVoiceOS/massive-templates 数据集图片
构建方式
在自然语言理解与多语言意图识别的研究领域,数据集的构建方式直接影响模型泛化能力的评估。MASSIVE Templates 数据集源自 AmazonScience/massive,通过纯正则表达式方法对其中的注释化话语进行机械式重铸,转化为与 OpenVoiceOS/intents-for-eval 兼容的行格式。具体而言,该过程解析每条话语中标注的槽位-值对,将值替换为模板占位符,并将当前话语的槽位值作为单独示例记录,从而生成训练用的模板行与对应的测试行。整个转换不依赖任何大语言模型,确保了数据处理的简洁性与可复现性。
特点
该数据集最显著的特质在于其广泛的多语言覆盖与意图-槽位结构化标注体系。它横跨 52 个 BCP-47 语言区域,总计包含约 70.4 万训练行与 15.5 万测试行,每个区域的数据规模均保持均衡。数据形式以模板+槽位示例为核心,每条训练记录仅包含源自原始单条话语的槽位填充实例,避免了跨话语聚合带来的信息混淆。测试数据则直接采用原始话语形式,与训练模板形成结构差异,专门用于评测意图解析引擎的泛化能力而非记忆效果,为多语言 NLU 基准测试提供了可靠数据支撑。
使用方法
该数据集具备灵活的加载方式,既可通过专用基准加载器调用,也可直接利用 HuggingFace datasets 库进行访问。用户可指定特定语言区域及其数据分割,例如通过 load_dataset 加载英语区域的模板训练集或测试集。数据格式与 intents-for-eval 完全一致,使得任何兼容该格式的意图解析引擎均可无缝接入。其 Apache-2.0 许可证继承自原始 MASSIVE 数据集,允许广泛的学术研究与商业应用。若在研究中引用,建议同时注明 MASSIVE 原始论文及本转换版本的来源,以维护学术引用规范。
背景与挑战
背景概述
MASSIVE Templates数据集诞生于2024年,由TigreGotico为OpenVoiceOS项目开发,旨在解决多语言自然语言理解中意图分类与槽填充任务的泛化性评估难题。该数据集基于AmazonScience的MASSIVE语料库,通过正则解析将原始标注转化为模板格式,覆盖52种BCP-47语言区域,包含约70.4万训练样本和15.5万测试样本。其核心贡献在于为OpenVoiceOS插件竞技场提供独立于特定技能模板的评测基准,有效衡量模型在多样化语言表达中的泛化能力,而非对训练短语的机械记忆,对推动多语言对话系统的公平评估具有里程碑意义。
当前挑战
领域层面,该数据集针对多语言NLU系统在低资源语言中意图识别准确率低、对模板化表达过拟合的固有问题,提供了跨51种语系的标准化评测框架,特别强调检测模型能否从有限模板泛化至未见变体。构建过程中,挑战在于将MASSIVE原有的内联注释(如'[time : five am]')无损转化为{slot}模板与独立槽值列表,且严格避免跨语句聚合导致的数据泄露;同时需确保52个语言区域的数据格式与OpenVoiceOS现有评测接口完全兼容,这对正则表达式的鲁棒性和大规模多语言文本处理的一致校验构成严峻考验。
常用场景
经典使用场景
在自然语言理解领域,意图识别与槽位填充常被视作任务驱动的对话系统之核心。MASSIVE Templates数据集凭借其涵盖52种语言区域的庞大规模,为多语言意图解析模型提供了标准化评测框架,尤其适用于衡量模型对未见表述的泛化能力,而非对训练数据的机械记忆。
解决学术问题
该数据集有效解决了跨语言意图解析中训练数据与评测数据同源所导致的过拟合问题。通过将原始MASSIVE语料重组为模板形式,剥离了具体槽位值的干扰,使得研究者能够专注于模型对意图结构的理解能力。这一创新推动了多语言NLU模型的鲁棒性评估,对低资源语言的算法迁移研究具有深远影响。
衍生相关工作
衍生自该数据集的工作包括OVOS Plugin Arena基准测试平台,它利用MASSIVE Templates对多个意图解析插件进行横向比较,推动了语音助手生态系统的透明化评估。此外,自动模板转换工具集的发布为其他大规模NLU数据集的结构化复用提供了技术范例,促进了基于模板的意图解析研究分支的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务