遇见数据集

Tverous/anli-amr

收藏
Hugging Face2023-07-30 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: uid dtype: string - name: premise dtype: string - name: hypothesis dtype: string - name: label dtype: class_label: names: '0': entailment '1': neutral '2': contradiction - name: reason dtype: string - name: claim_cleaned_amr dtype: string - name: amr_penman dtype: string - name: amr_tokens sequence: string - name: amr_nodes dtype: string - name: amr_alignments dtype: string - name: amr_edges sequence: sequence: string splits: - name: train num_bytes: 146374351 num_examples: 100459 - name: dev num_bytes: 1919899 num_examples: 1200 - name: test num_bytes: 1907283 num_examples: 1200 download_size: 44471917 dataset_size: 150201533 --- # Dataset Card for "anli-amr" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 名称:uid,数据类型:字符串 - 名称:premise(前提),数据类型:字符串 - 名称:hypothesis(假设),数据类型:字符串 - 名称:label,数据类型: class_label(类别标签): 类别映射: '0': entailment(蕴含) '1': neutral(中立) '2': contradiction(矛盾) - 名称:reason(原因),数据类型:字符串 - 名称:claim_cleaned_amr(清理后的抽象意义表示(Abstract Meaning Representation,AMR)声明),数据类型:字符串 - 名称:amr_penman(AMR Penman格式文本),数据类型:字符串 - 名称:amr_tokens(AMR Token序列),数据类型:Token序列 - 名称:amr_nodes(AMR节点信息),数据类型:字符串 - 名称:amr_alignments(AMR对齐信息),数据类型:字符串 - 名称:amr_edges(AMR边序列),数据类型:字符串序列的序列 数据集划分: - 名称:train(训练集),字节大小:146374351,样本数量:100459 - 名称:dev(验证集),字节大小:1919899,样本数量:1200 - 名称:test(测试集),字节大小:1907283,样本数量:1200 下载大小:44471917,数据集总大小:150201533 --- # "anli-amr" 数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
Tverous
原始信息汇总

数据集概述

数据集名称

  • 名称: anli-amr

数据集特征

  • uid: 字符串类型
  • premise: 字符串类型
  • hypothesis: 字符串类型
  • label: 分类标签,包括:
    • 0: entailment
    • 1: neutral
    • 2: contradiction
  • reason: 字符串类型
  • claim_cleaned_amr: 字符串类型
  • amr_penman: 字符串类型
  • amr_tokens: 序列,字符串类型
  • amr_nodes: 字符串类型
  • amr_alignments: 字符串类型
  • amr_edges: 序列,字符串类型

数据集分割

  • train:
    • num_bytes: 146374351
    • num_examples: 100459
  • dev:
    • num_bytes: 1919899
    • num_examples: 1200
  • test:
    • num_bytes: 1907283
    • num_examples: 1200

数据集大小

  • download_size: 44471917
  • dataset_size: 150201533
搜集汇总
数据集介绍
构建方式
自然语言推理任务中,语义表示的精确性对模型推理能力至关重要。Tverous/anli-amr数据集基于ANLI(Adversarial Natural Language Inference)语料库,通过引入抽象意义表示(AMR)结构进行增强构建。原始ANLI数据集包含前提与假设的文本对及其蕴含、中立、矛盾三类标签,而本数据集进一步为每条样本中的假设(claim)生成对应的AMR图,并以Penman格式、令牌序列、节点、对齐关系及边结构等形式呈现。构建过程遵循标准AMR解析流程,确保语义结构的完整性与一致性,最终形成包含约10万训练样本及各1200条验证与测试样本的增强型资源。
使用方法
研究者可直接通过HuggingFace Datasets库加载该数据集,指定‘train’、‘dev’或‘test’分片进行使用。对于自然语言推理任务,可提取‘premise’、‘hypothesis’及‘label’字段构建标准分类模型;对于语义表示学习任务,则可利用‘amr_penman’、‘amr_tokens’、‘amr_nodes’及‘amr_edges’等字段训练图神经网络或序列到图模型。数据集还支持将AMR结构作为额外输入特征,与文本表示进行联合编码,以探索符号知识对推理性能的提升。数据格式为JSON Lines,便于高效加载与预处理。
背景与挑战
背景概述
在自然语言理解领域中,文本蕴含识别(NLI)是一项核心任务,旨在判断前提与假设之间的逻辑关系(蕴含、矛盾或中立)。Tverous/anli-amr数据集由研究团队于近年创建,基于ANLI(Adversarial NLI)语料库进行扩展,引入了抽象语义表示(AMR)结构。其核心研究问题在于如何将深层语义图结构融入NLI任务,以提升模型对复杂逻辑关系的理解能力。该数据集通过为每条样本提供AMR图、对齐信息及推理原因,为语义解析与推理的交叉研究提供了宝贵资源。其发布推动了可解释性NLI模型的发展,对语义计算领域产生了重要影响。
当前挑战
该数据集所解决的领域挑战在于传统NLI模型多依赖表面词汇特征,难以捕捉蕴含关系中的深层语义结构。AMR的引入虽补充了语义信息,却带来构建过程中的显著困难:首先,AMR图的自动生成与对齐存在噪声,影响数据质量;其次,大规模标注AMR结构需要大量人工与计算资源,导致数据规模受限(训练集约10万例)。此外,不同标注者对于AMR节点和边的定义可能不一致,增加了标注一致性维护的复杂性。这些挑战共同制约了数据集在复杂推理任务中的泛化能力与应用广度。
常用场景
经典使用场景
Tverous/anli-amr数据集将抽象意义表示(AMR)结构融入自然语言推理(NLI)任务,为经典的三分类推理(蕴含、中立、矛盾)提供了结构化的语义标注。研究者可借助该数据集训练模型,在前提与假设之间建立更细粒度的语义对齐,从而提升对复杂逻辑关系的理解能力。其经典使用场景包括基于AMR图结构的推理增强、语义角色标注与推理联合建模,以及跨句语义关系解析。
解决学术问题
该数据集有效解决了传统NLI任务中语义表示浅层化的问题。通过引入AMR图,使模型能够捕捉句子深层的谓词-论元结构,从而更准确地识别推理中的隐含信息与语义冲突。它推动了可解释性推理研究,帮助学术界探索如何将结构化知识融入神经推理模型,缓解了黑箱推理与逻辑一致性不足的困境。
实际应用
在实际应用中,该数据集可服务于智能问答系统中的事实一致性检验、机器阅读理解中的假设验证,以及对话系统中用户意图的精准判别。例如,在医疗领域辅助诊断推理或法律文书矛盾检测中,基于AMR增强的推理模型能够更稳健地处理专业术语与复杂句式,提升系统可靠性。
数据集最近研究
最新研究方向
在自然语言推理(NLI)领域,Tverous/anli-amr数据集通过引入抽象语义表示(AMR)结构,为推理任务提供了更深层的语义解析维度。当前前沿研究聚焦于利用AMR图结构增强模型对前提与假设之间逻辑关系的理解,尤其是在处理复杂因果、时序及常识推理时,AMR的显式语义对齐能够有效缓解传统基于文本嵌入的模型在长距离依赖与歧义消解上的局限性。该数据集与可解释AI热潮紧密相关,研究者通过AMR节点与边的关系可追溯推理链,提升模型透明度。其影响在于推动NLI从表面匹配向结构化语义推理演进,为机器阅读理解、对话系统及知识验证等应用提供更鲁棒的基础,尤其在对抗性样本检测与跨语言推理中展现出独特价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务