IntentGrasp
收藏资源简介:
IntentGrasp是一个大规模、全面且标准化的基准,用于评估跨多个领域和不同实例类型的意图理解能力。它源自49个高质量、开放许可的语料库,涵盖12个不同领域,通过源数据集整理、意图标签上下文化和任务格式统一构建而成。IntentGrasp包含一个包含262,759个实例的大规模训练集,以及两个评估集:一个包含12,909个测试案例的All Set和一个更平衡且具有挑战性的包含470个案例的Gem Set。
IntentGrasp is a large-scale, comprehensive and standardized benchmark for evaluating intent understanding capabilities across multiple domains and diverse instance types. Derived from 49 high-quality, open-licensed corpora spanning 12 distinct domains, it is constructed through source dataset curation, intent label contextualization and task format unification. IntentGrasp includes a large-scale training set with 262,759 instances, as well as two evaluation datasets: the All Set containing 12,909 test cases, and the more balanced and challenging Gem Set with 470 cases.
IntentGrasp 数据集概述
基本信息
- 数据集名称:IntentGrasp
- 发布机构:不列颠哥伦比亚大学(UBC)NLP 研究组
- 论文链接:https://arxiv.org/abs/2605.06832
- 数据集下载地址:https://huggingface.co/datasets/yuweiyin/IntentGrasp
- 许可协议:数据集采用 CC BY-NC-SA 4.0 许可,代码采用 Apache 2.0 许可
数据集构建
IntentGrasp 是通过以下流程构建的综合性意图理解基准数据集:
- 来源:源自 49 个高质量、开源许可的语料库
- 覆盖领域:涵盖 12 个不同领域
- 构建步骤:包括源数据整理、意图标签语境化以及任务格式统一
数据集规模
| 数据集划分 | 样本数量 |
|---|---|
| 训练集 | 262,759 条 |
| All Set(测试集) | 12,909 条 |
| Gem Set(均衡高难度测试集) | 470 条 |
数据集目录结构
数据集在 Hugging Face 上组织为以下结构:
data/intent_grasp/all/:包含全部测试集的元数据、训练和测试数据(parquet 和 jsonl 格式)data/intent_grasp/gem/:包含 Gem Set 的元数据、测试数据(parquet 和 jsonl 格式)
评估结果
主要发现
- 对 20 个 LLM(涵盖 7 个模型家族,包括 GPT-5.4、Gemini-3.1-Pro、Claude-Opus-4.7 等前沿模型)的评估显示性能不佳
- All Set 上的得分低于 60%,Gem Set 上低于 25%
- 在 Gem Set 上,20 个测试模型中有 17 个表现低于随机猜测基线(15.2%)
- 估计的人类表现约为 81.1%,显示 LLM 在意图理解方面仍有较大提升空间
意图微调(IFT)效果
- 在 IntentGrasp 训练集上进行 IFT 后,模型在 All Set 上获得 30 以上的 F1 分数提升
- Gem Set 上获得 20 以上的 F1 分数提升
- 留一领域交叉验证(Lodo)实验证明了 IFT 强大的跨领域泛化能力
数据集关键信息
- 核心任务:评估和提升大语言模型的意图理解能力
- 论文关键词:意图理解、数据集、基准测试、大语言模型、评估、意图微调
- 主要贡献:提供了一个全面的意图理解基准,并提出了 Intentional Fine-Tuning(IFT)方法以显著增强 LLM 的意图理解能力




