遇见数据集

SemEval_NLI4CT_MaelAnnotated2023

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集包含多个配置子集,每个子集均具有相同的字段结构,用于存储与临床试验文档相关的文本对比较或推理任务数据。字段包括唯一标识符、类型、章节ID、主文档和辅助文档的ID、陈述文本、标签、证据索引、主文档和辅助文档的具体内容(包括不良事件、入选标准、干预措施、结果四个部分)、对应的章节信息以及推理类型。所有配置仅提供测试集,样本数量从12到500不等。

This dataset contains multiple configuration subsets, each with the same field structure, used to store text pair comparison or reasoning task data related to clinical trial documents. Fields include unique identifier, type, section ID, main document and auxiliary document IDs, statement text, label, evidence index, specific content of the main document and auxiliary document (including adverse events, inclusion criteria, interventions, outcomes), corresponding section information, and reasoning type. All configurations only provide test sets, with sample sizes ranging from 12 to 500.

创建时间:
2026-08-12
原始信息汇总

数据集概述:SemEval_NLI4CT_MaelAnnotated2023

基本信息

  • 数据集名称:SemEval_NLI4CT_MaelAnnotated2023
  • 来源平台:Hugging Face
  • 数据集地址:https://huggingface.co/datasets/araag2/SemEval_NLI4CT_MaelAnnotated2023

数据集简介

该数据集基于SemEval 2023 NLI4CT任务构建,包含自然语言推理(NLI)相关的临床文本数据,用于研究临床文本中的推理与证据分析。

配置与数据划分

数据集包含 6 个子配置,每个配置均仅包含 test 分割:

配置名称 测试样本数 数据集大小 下载大小
2023_processed 500 4,887,838 字节 1,189,523 字节
paraphrase_abstraction 12 69,942 字节 24,989 字节
paraphrase_lexical 12 70,070 字节 25,043 字节
paraphrase_syntactic 12 69,914 字节 24,813 字节
paraphrase_tonal_shift_clinical 12 69,942 字节 24,933 字节
paraphrase_tonal_shift_lay 12 69,980 字节 24,778 字节

数据特征

所有配置包含相同的特征字段:

  • id (string):样本唯一标识符
  • Type (string):数据类型
  • Section_id (string):章节标识
  • Primary_id (string):主要文档标识
  • Secondary_id (string):次要文档标识
  • Statement (string):推理陈述
  • Label (string):推理标签
  • Primary_evidence_index (sequence of int64):主要证据索引
  • Secondary_evidence_index (sequence of int64):次要证据索引
  • Primary_Document(结构体):包含不良事件、资格条件、干预措施、结果等四个子字段(序列类型)
  • Primary_Section (sequence of string):主要文档章节
  • Secondary_Document(结构体):包含不良事件、资格条件、干预措施、结果等四个子字段(序列类型)
  • Secondary_Section (sequence of string):次要文档章节
  • reasoning_types (sequence of string):推理类型

数据用途

该数据集适用于临床文本自然语言推理、证据抽取、多文档对比分析等研究任务,特别用于评估模型在两篇临床文档之间的推理能力。

搜集汇总
数据集介绍
SemEval_NLI4CT_MaelAnnotated2023 数据集图片
构建方式
该数据集源自SemEval-2023年NLI4CT(自然语言推理与临床试验)任务的精细化标注成果,由Mael团队精心构建。其构建过程融合了结构化的临床试验证据抽取与多维度推理类型标注,将临床试验文档按不良事件、资格标准、干预措施及结果四大关键板块进行划分,并以成对形式组织主要与次要证据,辅以细粒度的证据索引和段落归属。数据涵盖原始处理版本(含500个测试实例)及五种特定释义变体(各含12个实例),分别针对抽象化、词汇替换、句法改写及临床与平民语境下的语气转变进行扰动,从而构建出对模型鲁棒性极具挑战性的评测基准。
特点
该数据集的核心特点在于其多层面、高仿真性的任务设计,能够深刻拷问模型在医学文本推理上的精准度与泛化能力。每个实例不仅包含论断(Statement)与二元标签(支持或反驳),还携带类型分类、段落标识及推理类型注解,为深入分析模型决策依据提供了丰富素材。尤为独特的是,数据集的释义变体系统性地引入不同类型的语言变异,涵盖抽象概括、词义替换、句法重构以及临床与日常语言的语气切换,从而揭露模型在面对同义异形表述时的脆弱性,推动医学自然语言处理向更稳健、更贴近临床实用场景的方向发展。
使用方法
该数据集主要面向临床试验领域的事实核查与自然语言推理任务,研究者可将其作为基准测试集,用于评估模型在医学证据与临床论断之间关系判定上的表现。使用过程中,模型需输入结构化的临床试验文档(含四个预定义板块)及目标论断,输出二元支持/反驳标签,并需在必要时追溯具体证据索引以解释决策逻辑。数据集提供了统一的JSON格式,配置名(如"2023_processed"及"paraphrase_*"系列)便于用户按需加载不同版本,既可评估模型在原始数据上的能力,亦可检验其对各类语言学变异的鲁棒性,为优化医学文本推理引擎提供严格的测试平台。
背景与挑战
背景概述
该数据集源于2023年SemEval任务,专注于自然语言推断在临床试验证据上的应用,特别是针对临床试验报告(CTRs)的推理。由国际研究团队构建,核心研究问题在于如何利用语言模型从临床试验文献中推断医学陈述的真实性,以支持证据-based医学决策。该数据集对自然语言处理与医学信息学的交叉领域产生了重要影响,推动了可解释AI在医疗文本分析中的发展。
当前挑战
数据集面临的主要挑战包括:1) 临床试验文本的领域专有术语和复杂句式,使得语义推断难度提升;2) 证据的跨文档推理,需整合多个临床报告的信息,对模型的上下文理解能力要求高;3) 构建过程中,需确保标注的一致性和准确性,尤其处理矛盾的证据和不同文献间的差异;4) 测试数据中的对抗性样本(如释义变换)旨在评估模型的鲁棒性,但增加了构建时的人工干预复杂度。
常用场景
经典使用场景
该数据集源自SemEval-2023自然语言推理与临床试验任务,旨在评估模型在对比两个临床试验摘要时推断陈述真实性的能力。经典使用场景涵盖临床自然语言推断、证据抽取与推理类型分类,要求模型综合结构化的临床试验信息(如不良事件、合格标准、干预措施和结果)进行多跳推理,是检验医学文本蕴含技术的基准平台。
衍生相关工作
该数据集衍生了一系列相关研究,包括基于预训练语言模型的微调策略、多任务学习框架及证据感知的推理网络。后续工作探索了外部知识注入、图神经网络建模文档结构,以及利用对比学习增强语义表示。此外,数据集启发了对领域适应和跨语言迁移的研究,成为临床NLP社区评估推理能力的标准测试集之一。
数据集最近研究
最新研究方向
该数据集聚焦于临床文本蕴含识别任务的鲁棒性评估,其核心挑战在于验证语言模型面对句法变换、词汇替换、抽象概括及语气调整等改写对抗时能否保持推理一致性。前沿研究正致力于分析模型在跨域迁移中的脆弱性,并构建更契合临床语篇细粒度结构的证据链推理框架,以提升医疗决策支持系统的可信度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务