遇见数据集

copenlu/citeworth

收藏
Hugging Face2022-08-17 更新2024-03-04 收录
官方服务:

资源简介:

CiteWorth数据集是一个用于检测科学文档中引用价值(cite-worthiness)的英文数据集。该数据集基于S2ORC数据集构建,包含了大量从科学文档中提取的纯文本数据,并经过严格的清理和标注。数据集的主要任务是文本分类,具体是判断一个句子是否引用了外部来源。数据集的创建过程在相关论文中有详细描述,且数据集的质量高、具有挑战性,适合用于研究领域适应等问题。

The CiteWorth Dataset is an English-language dataset designed for detecting cite-worthiness in scientific documents. Built upon the S2ORC dataset, it comprises a large quantity of plain text data extracted from scientific documents, which has undergone rigorous cleaning and annotation. The core task of this dataset is text classification, specifically to determine whether a sentence cites an external source. The creation process of the dataset is thoroughly described in the relevant research paper, and the dataset features high quality and challenging characteristics, making it suitable for research on issues such as domain adaptation.

提供机构:
copenlu
原始信息汇总

数据集概述:CiteWorth

数据集描述

  • 名称:CiteWorth
  • 语言:英语
  • 许可证:CC-BY-NC-4.0
  • 多语言性:单语种
  • 大小:1M<n<10M
  • 来源数据集:S2ORC(扩展)
  • 标签
    • 引用检测
    • 引用
    • 科学
    • 学术文档
    • 生物
    • 医学
    • 计算机科学
    • 引用价值
  • 任务类别:文本分类

数据集结构

  • paper_id:S2ORC论文ID
  • section_idx:原始S2ORC数据中章节数组索引
  • file_index:S2ORC数据集中论文所属卷
  • file_offset:S2ORC论文PDF文件中论文JSON的起始字节偏移
  • mag_field_of_study:论文所属领域
  • original_text:段落原文
  • section_title:段落所属章节标题
  • samples:段落中句子数组,每个句子包含:
    • text:句子清理后的文本
    • label:句子标签,check-worthy(引用价值)或non-check-worthy(非引用价值)
    • original_text:句子原文
    • ref_ids:句子中引用的论文在S2ORC数据集中的ID列表
    • citation_text:句子中的所有引用文本列表

数据集创建

  • 来源:S2ORC数据集20200705v1版本
  • 许可证:CC By-NC 2.0
  • 详细创建过程:参见论文第3节

引用信息

@inproceedings{wright2021citeworth, title={{CiteWorth: Cite-Worthiness Detection for Improved Scientific Document Understanding}}, author={Dustin Wright and Isabelle Augenstein}, booktitle = {Findings of ACL-IJCNLP}, publisher = {Association for Computational Linguistics}, year = 2021 }

搜集汇总
数据集介绍
copenlu/citeworth 数据集图片
构建方式
CiteWorth数据集源自S2ORC大规模学术文献语料库(20200705v1版本),通过系统化地提取纯文本科学文档段落构建而成。构建过程严格遵循文献计量学原理,对每个句子进行上下文感知的标注,判断其是否包含对外部文献的引用。标注工作由领域专家完成,确保了数据的高质量与可靠性。数据集以段落为单位组织,每条数据包含论文标识符、章节索引、研究领域等元信息,以及经清洗后的句子序列及其对应的二分类标签(cite-worthy或non-cite-worthy)。
特点
该数据集规模庞大,包含超过百万条标注样本,覆盖生物医学、计算机科学等多个学科领域,突破了以往科学文本数据集规模小、领域单一的局限。其突出特点在于提供了段落级别的上下文信息,而非孤立的句子,使得模型能够捕捉引用决策的语境依赖性。此外,数据集还保留了引用文本、参考文献ID等丰富结构信息,为深入研究科学文本的引用行为与领域适应性提供了宝贵资源。实验表明,基于该数据集训练的Longformer模型在引用检测任务上显著优于仅考虑单句的SciBERT。
使用方法
CiteWorth主要面向文本分类任务,特别是引用必要性检测。研究人员可直接加载HuggingFace上的数据集,利用其提供的句子级标签进行有监督学习。推荐采用基于Transformer的序列标注模型,如Longformer,以充分利用段落级上下文信息。数据集中的paper_id、section_title等字段可用于跨领域适应实验,而ref_ids与citation_text则支持更细粒度的引用分析。使用时需遵循CC BY-NC 4.0许可协议,并引用原始论文。
背景与挑战
背景概述
在科学文献理解领域,自动识别文本中哪些句子需要引用外部来源(即引文价值检测)是提升学术文档解析与知识挖掘效率的关键任务。CiteWorth数据集由哥本哈根大学自然语言处理研究组(CoAStaL NLP)的Dustin Wright与Isabelle Augenstein于2021年提出,旨在解决现有标注数据集规模小、领域覆盖窄的瓶颈。该数据集基于S2ORC大规模开放学术语料库构建,通过半自动化清洗流程生成了超过百万级别的英文句子级标注,涵盖生物医学、计算机科学等多个学科。其核心研究问题在于探索上下文感知的引文价值判断模型,并验证了段落级Longformer模型相较单句分类器的显著优势。CiteWorth的发布为科学文档理解中的领域自适应、多任务学习等方向提供了高质量基准,推动了学术文本自动化处理技术的发展。
当前挑战
CiteWorth所应对的领域挑战在于科学文本中引文价值判别的复杂性:不同学科对引用行为的规范差异显著,同一段落内引用句与非引用句的语义边界模糊,且学术写作中隐含的领域特定术语与论证逻辑增加了模型泛化难度。在数据集构建过程中,挑战尤为突出:原始S2ORC语料包含大量格式不规范的文本(如缺失引文标记、乱码字符),需设计多阶段清洗流水线以去除噪声;跨学科标注的一致性难以保证,需通过人工校验与规则过滤平衡召回率与精确率;此外,处理百万级文档时需兼顾计算效率与标注质量,最终通过字节偏移索引与段落级上下文结构设计,实现了大规模、高纯净度的数据产出。
常用场景
经典使用场景
CiteWorth数据集的核心经典用途在于对科学文献中的句子进行引文价值二元分类,即判断一个句子是否需要引用外部文献。该数据集依托S2ORC大规模语料库,提供了百万级别的段落级上下文标注,使得研究者能够训练出超越单句判断的深度学习模型。通过将引文检测任务转化为细粒度的句子级别分类,CiteWorth为科学文本理解领域树立了一个标准化的基准测试平台,尤其适用于评估模型在不同学科间的泛化与迁移能力。
解决学术问题
该数据集精准回应了科学文献理解中标注数据稀缺与领域特异性强的双重困境。传统人工标注耗费高昂且规模有限,难以覆盖生物医学、计算机科学等多学科;而CiteWorth利用引文作为天然弱监督信号,自动构建大规模高质量标注集,解决了跨领域引文价值检测的学术难题。其引入的段落级上下文建模思路,显著提升了模型对引文动机与逻辑关系的捕捉能力,为后续科学文本结构分析、知识图谱构建等研究奠定了数据与方法基础。
衍生相关工作
基于CiteWorth,学界衍生出一系列重要工作。例如,将引文价值检测作为辅助任务进行语言模型微调,已被证明能提升模型在科学问答、论文分类等下游任务上的表现。此外,研究者借鉴其段落级上下文标注框架,拓展了引文意图分类、引文网络影响力预测等方向。该数据集还促进了跨学科迁移学习研究,推动了面向生物医学与计算机科学等领域的多任务联合建模范式,成为科学文献智能处理领域的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务