遇见数据集

MAVEN

收藏
arXiv2020-10-08 更新2024-06-21 收录
官方服务:

资源简介:

MAVEN是由清华大学开发的大规模通用领域事件检测数据集,包含4,480篇维基百科文档,118,732个事件提及实例,涵盖168种事件类型。该数据集旨在解决现有数据集数据稀缺和覆盖率低的问题,通过人工标注确保数据质量,适用于训练和评估现代神经网络方法。MAVEN的应用领域广泛,可用于提升事件检测模型的性能,尤其是在处理复杂和多样化的文本事件描述时。

MAVEN is a large-scale general-domain event detection dataset developed by Tsinghua University. It comprises 4,480 Wikipedia articles, 118,732 event mention instances, and covers 168 event types. This dataset aims to address the problems of data scarcity and low coverage in existing datasets, with data quality guaranteed through manual annotation, making it suitable for training and evaluating modern neural network methods. MAVEN has a wide range of application scenarios, and can be used to enhance the performance of event detection models, especially when processing complex and diverse textual event descriptions.

提供机构:
清华大学
创建时间:
2020-04-28
搜集汇总
数据集介绍
MAVEN 数据集图片
构建方式
MAVEN数据集的构建始于事件类型体系的精心设计。研究团队以FrameNet中定义的语义框架为基础,通过递归筛选与事件相关的框架,并经过人工抽象、合并与泛化,最终凝练出168种细粒度事件类型,并组织成树状层次结构。数据源选取自英文维基百科,借助EventWiki知识库筛选出包含丰富事件的文章,并仅保留其引言部分以确保内容质量。为提高标注效率,系统首先通过词性标注和框架语义解析器自动生成触发词候选及事件类型推荐,随后由121名众包标注者进行两轮独立标注,再由17名经验丰富的标注员进行最终审核与整合,从而构建出包含4,480篇文档、118,732个事件提及的大规模数据集。
特点
MAVEN数据集最显著的特点在于其规模与覆盖度的双重突破。相较于仅含33种事件类型的ACE 2005数据集,MAVEN涵盖了168种事件类型,大幅提升了通用领域事件的覆盖范围。其数据量达到了ACE 2005的二十倍以上,有效缓解了数据稀缺问题。此外,该数据集保留了真实世界中固有的长尾分布特性,41%的事件类型拥有超过500个实例,为研究类别不平衡问题提供了宝贵资源。数据集中单句包含多个事件的现象更为普遍,层次化的事件类型体系也为区分相似事件类型和进行知识迁移提供了可能。
使用方法
MAVEN数据集的使用遵循事件检测任务的标准范式,即识别文本中的事件触发词并分类至预定义的事件类型。研究人员可直接采用官方划分的训练、验证和测试集进行模型开发与评估。数据集已提供官方负样本实例,确保了不同方法间比较的公平性。实验表明,现有最先进的事件检测模型在MAVEN上的性能较在小规模数据集上有显著下降,凸显了通用领域事件检测的挑战性。研究者可利用其层次化事件类型体系探索长尾类型处理、事件间关联建模以及基于迁移学习的低资源事件检测等前沿方向。
背景与挑战
背景概述
事件检测作为信息抽取的基石性任务,旨在从非结构化文本中识别事件触发词并归类至预定义类型。长期以来,该领域受制于标注数据的匮乏与事件类型覆盖的狭隘性,以ACE 2005为代表的经典数据集仅包含33种事件类型及五千余条标注实例,难以支撑现代数据驱动型神经网络的稳定训练与泛化评估。为突破这一瓶颈,清华大学与腾讯微信AI团队于2020年联合发布了MAVEN数据集,其基于维基百科文档与FrameNet语义框架,构建了包含4480篇文档、168种事件类型及逾11万条事件提及的大规模通用领域事件检测资源。该数据集不仅将数据规模提升至现有基准的二十倍以上,更通过树状层次化事件类型体系实现了对通用事件语义的广泛覆盖,为事件检测研究开辟了新的疆域。
当前挑战
MAVEN所面临的核心挑战首先源于通用领域事件检测的固有复杂性。相较于ACE等小规模数据集,MAVEN中单句多事件共现现象更为普遍且关联关系错综复杂,现有模型在此场景下性能显著下降,如最优的BERT+CRF模型F1值仅达67.8%,远低于其在ACE上的74.1%。其次,168种事件类型的细粒度分类带来了严峻的类别混淆问题,错误分析表明模型常混淆父子类型或兄弟类型,难以捕捉语义间的微妙差异。再者,数据集遵循真实世界长尾分布,51%的事件类型实例数不足500,导致模型易偏向高频类型。此外,构建过程中需协调121名众包标注者在复杂层次化体系下的一致性,尽管通过候选筛选与自动标注策略将专家验证准确率提升至90.1%,但通用事件语义的模糊性仍使初标阶段的一致性仅达42.7%。
常用场景
经典使用场景
在自然语言处理领域,事件检测作为信息抽取的基石任务,旨在从非结构化文本中精准识别触发词并归类事件类型。MAVEN数据集凭借其海量规模与广泛覆盖,成为训练和评估现代事件检测模型的标杆资源。其经典使用场景集中于通用领域事件检测,研究者可基于该数据集构建端到端的触发词识别与类型分类系统,利用其包含的4,480篇维基百科文档、118,732个事件提及实例及168种事件类型,全面检验模型在复杂真实文本中的泛化能力。该数据集通过提供标准化的负例样本与层次化事件类型体系,为模型性能的稳定基准测试与公平对比奠定了坚实基础。
衍生相关工作
MAVEN数据集的发布催生了一系列标志性衍生工作。在模型架构层面,研究者基于其层次化事件类型体系开发了多阶图注意力网络(MOGANED),通过建模句法依存树中的高阶关系提升事件检测精度。在预训练范式上,DMBERT与BERT+CRF等模型利用MAVEN的大规模标注数据,验证了条件随机场输出层在建模多事件共现现象中的有效性。此外,该数据集推动了迁移学习在事件检测中的应用,如通过中间预训练策略将MAVEN学到的通用事件知识迁移至ACE 2005等小样本数据集。在长尾处理方面,层次化事件类型促进了数据增强与类别平衡方法的研究,为细粒度事件区分提供了新的优化路径。
数据集最近研究
最新研究方向
MAVEN数据集作为大规模通用领域事件检测基准,当前研究前沿聚焦于利用其丰富的层次化事件类型架构和庞大的数据规模,探索多事件共现建模、长尾类型处理以及跨任务迁移学习。相关热点工作包括基于CRF的结构化输出模型以捕捉句子内多事件关联,以及通过层级事件模式区分细粒度语义差异。该数据集的出现显著缓解了传统小规模基准(如ACE 2005)的数据稀疏与覆盖不足问题,为评估现代神经方法在真实世界事件检测中的鲁棒性提供了关键平台,推动了从受限领域向通用场景的范式转变。
相关研究论文
  • 1
    MAVEN: A Massive General Domain Event Detection Dataset清华大学 · 2020年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务