遇见数据集

SciClaim

收藏
arXiv2021-09-22 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

SciClaim数据集是由SIFT和Northeastern University联合创建,专注于科学声明的细粒度知识图谱构建。该数据集包含12,738个标注,涵盖了社会与行为科学、PubMed和CORD19论文中的901个句子。数据集通过创新的图注释模式,不仅包括粗粒度的实体跨度作为节点和关系作为边,还包含了细粒度的属性,用以修改实体及其关系。SciClaim数据集旨在捕捉实验变量间的因果、比较、预测、统计和比例关联,以及它们的限定、子类型和证据,适用于科学声明的细粒度信息提取和知识图谱构建。

The SciClaim dataset was jointly created by SIFT and Northeastern University, focusing on fine-grained knowledge graph construction for scientific claims. This dataset contains 12,738 annotations, covering 901 sentences from social and behavioral sciences, PubMed and CORD19 papers. Adopting an innovative graph annotation schema, it not only includes coarse-grained entity spans as nodes and relationships as edges, but also incorporates fine-grained attributes to modify both entities and their corresponding relationships. The SciClaim dataset aims to capture causal, comparative, predictive, statistical and proportional associations between experimental variables, as well as their qualifications, subtypes and supporting evidence, making it suitable for fine-grained information extraction and knowledge graph construction for scientific claims.

创建时间:
2021-09-22
搜集汇总
数据集介绍
构建方式
在科学文献的知识图谱构建领域,现有数据集多聚焦于研究过程的高层描述,而忽略了实验关联的细微呈现。SciClaim数据集应运而生,旨在捕捉科学主张中细粒度的关联信息。其构建过程由两位NLP研究人员协作完成,从社会与行为科学论文、PubMed及CORD-19摘要中筛选出901个句子,涵盖专家识别的主张、因果语言及启发式标注的关联表述。通过迭代式训练部分模型并利用其预测作为标注建议,研究者高效完成了密集标注,并在100个测试样本中禁用建议以确保评估无偏。最终采用共识流程与领域专家协商,对250个重叠样本进行模式迭代与重新标注,形成了包含12,738个标签的高密度语料库。
特点
SciClaim数据集在科学信息抽取领域中独树一帜,其核心特点在于极致的细粒度与高密度标注。相较于以往数据集,SciClaim不仅提取实体跨度与关系边,还引入了多标签属性以修饰实体及其关联,涵盖因果、比较、预测、统计和比例等关联类型,并附加了限定词、子类型及证据等元信息。其标签密度高达每词63.47%,远超同类数据集,如SciERC的23.81%。此外,图模式设计精巧,通过实体节点、关系边与属性括号的协同,能够精准表达因子间的单调性、认知状态与定性比例,从而捕捉科学主张中复杂而微妙的论证逻辑。
使用方法
使用SciClaim数据集时,研究者可基于其标注的图结构进行联合实体与关系抽取任务。数据以句子为单位,包含训练集(721句)、验证集(80句)和测试集(100句),支持Span-based模型如SpERT的扩展应用。具体操作中,需将句子输入预训练语言模型(如SciBERT),通过注意力机制生成跨度表示,依次预测实体类型、多标签属性及有向关系。模型需采用级联推理策略,先识别实体再推断关系,并通过二元交叉熵损失联合训练。研究者可参照论文提供的超参数(如学习率5e-5、最大跨度20词)进行调优,以复现其在实体、属性与关系上的高F1值(分别为88.83%、87.01%和75.05%),从而有效提取细粒度的科学主张知识图谱。
背景与挑战
背景概述
在科学文献日益增长的背景下,从非结构化文本中提取结构化知识已成为自然语言处理领域的重要研究方向。2021年,来自SIFT与东北大学的Ian H. Magnusson和Scott E. Friedman等研究者构建了SciClaim数据集,旨在捕捉科学论断中精细化的知识图谱。该数据集从社会与行为科学、PubMed及CORD-19论文中精心选取901个句子,标注了12,738个标签,涵盖了因果、比较、预测、统计及比例等多种关联类型。SciClaim不仅关注实体与关系,更引入细粒度属性修饰,显著提升了标签密度与表达力,为后续基于Transformer的联合实体关系抽取模型提供了新的基准,推动了科学信息抽取向更精细、更具推理能力的方向发展。
当前挑战
SciClaim数据集面临的核心挑战在于其精细标注带来的复杂性。首先,科学论断的领域问题挑战在于如何准确识别并区分因果、比较、预测等多样化的关联类型,以及处理属性修饰与关系之间的语义依赖。其次,构建过程中,由于标注涉及重叠的实体跨度与多标签属性,微小的边界决策可能影响多个实体,导致标注一致性难以保证。此外,部分关系类型如subtype出现频率低,模型难以充分学习;而因果属性在测试集中样本稀缺,进一步加剧了评估的偏差。这些挑战要求模型具备更强的上下文理解与鲁棒推理能力,以实现对科学论断知识图谱的高效抽取。
常用场景
经典使用场景
在科学文献挖掘领域,SciClaim数据集被广泛用于构建细粒度的科学声明知识图谱。其经典使用场景是从非结构化文本中提取声明性关联,涵盖因果、比较、预测、统计和比例关系,并捕捉修饰这些关系的属性(如量级、限定词和证据)。研究者利用该数据集训练基于Transformer的联合实体与关系抽取模型,以解析实验变量间的复杂关联,例如从社会与行为科学、PubMed和CORD-19论文中抽取独立变量与依赖变量之间的正向或负向关联,并标注其限定范围与证据来源。
实际应用
在实际应用中,SciClaim支持自动化科学文献分析系统,帮助研究人员快速提取实验结论中的关键变量及其关系,例如在医学领域识别药物疗效的因果证据或社交行为研究中的相关性模式。它被集成到学术搜索引擎和文献管理工具中,用于生成结构化的声明摘要,辅助系统性综述和元分析。此外,在公共卫生应急响应中,如COVID-19研究,SciClaim可快速抽取大规模论文中的假设与证据链,加速知识发现与决策支持。
衍生相关工作
基于SciClaim数据集,衍生出一系列经典工作,包括改进的Span-based联合抽取模型(如SpERT扩展版本)用于多标签属性预测,以及注意力机制增强的跨度表示方法。研究者还借鉴其图模式开发了跨领域细粒度信息抽取框架,应用于道德推理文本和民族志文献。此外,SciClaim的标注模式被用于构建更大型的文档级知识图谱数据集,推动了从句子级到文档级科学声明推理的演进,并启发了因果语言检测与科学论证验证等下游任务的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务