遇见数据集

taln-ls2n/pubmed

收藏
Hugging Face2022-10-26 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - unknown language_creators: - unknown language: - en license: - unknown multilinguality: - monolingual size_categories: - 1k<n<10k task_categories: - text-generation task_ids: [] pretty_name: PubMed tags: - keyphrase-generation - keyphrase-extraction - text-mining --- # Schutz 2008 PubMed dataset for keyphrase extraction ## About This dataset is made of 1320 articles with full text and author assigned keyphrases. Details about the dataset can be found in the original paper: Keyphrase extraction from single documents in the open domain exploiting linguistic and statistical methods. Alexander Thorsten Schutz. Master's thesis, National University of Ireland (2008). Reference (indexer-assigned) keyphrases are also categorized under the PRMU (<u>P</u>resent-<u>R</u>eordered-<u>M</u>ixed-<u>U</u>nseen) scheme as proposed in the following paper: - Florian Boudin and Ygor Gallina. 2021. [Redefining Absent Keyphrases and their Effect on Retrieval Effectiveness](https://aclanthology.org/2021.naacl-main.330/). In Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pages 4185–4193, Online. Association for Computational Linguistics. Text pre-processing (tokenization) is carried out using spacy (en_core_web_sm model) with a special rule to avoid splitting words with hyphens (e.g. graph-based is kept as one token). Stemming (Porter's stemmer implementation provided in nltk) is applied before reference keyphrases are matched against the source text. ## Content The details of the dataset are in the table below: | Split | # documents | # keyphrases by document (average) | % Present | % Reordered | % Mixed | % Unseen | | :--------- | ----------: | -----------: | --------: | ----------: | ------: | -------: | | Test | 1320 | 5.40 | 84.54 | 9.14 | 3.84 | 2.47 | The following data fields are available: - **id**: unique identifier of the document. - **title**: title of the document. - **text**: full article minus the title. - **keyphrases**: list of reference keyphrases. - **prmu**: list of <u>P</u>resent-<u>R</u>eordered-<u>M</u>ixed-<u>U</u>nseen categories for reference keyphrases. **NB**: The present keyphrases (represented by the "P" label in the PRMU column) are sorted by their apparition order in the text (title + text).

The Schutz 2008 PubMed dataset contains 1,320 articles with full texts and author-assigned keywords. The keywords of this dataset are categorized under the PRMU (Present-Reordered-Mixed-Unseen) scheme. Text preprocessing was performed using spaCy for tokenization and NLTK's Porter Stemmer for stemming. The dataset includes unique document identifiers, titles, full text bodies, keyword lists, and the PRMU classification of the keywords.

提供机构:
taln-ls2n
原始信息汇总

Schutz 2008 PubMed dataset for keyphrase extraction

数据集概述

  • 语言: 英语 (en)
  • 许可证: 未知
  • 多语言性: 单语种
  • 大小: 1k<n<10k 文档
  • 任务类别: 文本生成
  • 标签: 关键词生成, 关键词提取, 文本挖掘

数据集内容

  • 文档数量: 1320篇
  • 平均每文档关键词数量: 5.40
  • 关键词分类:
    • Present (P): 84.54%
    • Reordered (R): 9.14%
    • Mixed (M): 3.84%
    • Unseen (U): 2.47%

数据字段

  • id: 文档唯一标识符
  • title: 文档标题
  • text: 全文(不含标题)
  • keyphrases: 参考关键词列表
  • prmu: 参考关键词的<u>P</u>resent-<u>R</u>eordered-<u>M</u>ixed-<u>U</u>nseen分类列表

数据预处理

  • 分词: 使用spacy (en_core_web_sm模型),特殊规则避免分割带有连字符的单词
  • 词干提取: 使用nltk中的Porters stemmer实现
搜集汇总
数据集介绍
构建方式
在学术文献挖掘与自然语言处理领域,关键词提取作为信息检索与知识组织的基础任务,其数据集的构建质量直接影响模型性能。该数据集源自Schutz于2008年发表的硕士论文,精选了1320篇生物医学领域全文文献,每篇均配有作者标注的关键词作为黄金标准。构建过程中,文本预处理采用spacy库的'en_core_web_sm'模型进行分词,并特别设定规则保留连字符词汇(如graph-based)的完整性。参考关键词与源文本的匹配则基于nltk库实现的Porter词干提取算法,以确保语义层面的对齐。此外,参考关键词依据PRMU分类体系被细分为呈现(Present)、重排(Reordered)、混合(Mixed)与未见(Unseen)四种类型,这一分类框架由Boudin与Gallina在2021年提出,旨在深化对缺失关键词的理解及其对检索效果的影响。
特点
该数据集的核心特点在于其精细化的标注结构与领域针对性。首先,1320篇文档均提供完整全文及标题,平均每篇包含5.40个参考关键词,其中高达84.54%的关键词在原文中直接呈现,9.14%为重组形式,3.84%为混合类型,仅2.47%为完全未见词汇,这一分布揭示了生物医学文献中关键词与正文的高度相关性。其次,PRMU分类的引入为关键词提取任务提供了多维度评估视角,不仅区分关键词是否出现在原文,还进一步刻画其形态变换(如词序调整或部分匹配)。此外,数据集采用统一的预处理流程与词干化技术,确保了跨文档的一致性,为后续模型训练与评测奠定了可靠基准。
使用方法
该数据集主要面向文本生成与关键词提取任务,尤其适用于监督学习场景下的模型训练与性能评估。使用者可通过Hugging Face平台直接加载数据集,获取每个样本的id、标题、全文、参考关键词列表及其对应的PRMU分类标签。在应用时,建议将标题与文本拼接作为输入,以充分利用上下文信息。对于关键词提取任务,可基于PRMU标签分别评估模型在呈现、重排、混合及未见关键词上的表现,从而全面衡量其泛化能力。此外,数据集提供了明确的训练-测试划分,用户可直接使用默认的1320篇测试集进行基准测试,或依据需求重新划分以适配特定实验设计。
背景与挑战
背景概述
在自然语言处理与文本挖掘领域,关键短语提取作为信息检索与知识图谱构建的基础任务,长期以来备受关注。Schutz于2008年在其硕士论文中提出的PubMed数据集,由爱尔兰国立大学的研究团队构建,包含1320篇来自生物医学文献库PubMed的全文文章及其作者标注的关键短语。该数据集旨在解决开放域单文档关键短语提取的统计与语言学方法评估问题,为后续研究提供了标准化的测试基准。其影响力体现在推动了关键短语生成与提取任务的系统化发展,特别是通过引入PRMU分类方案(Present-Reordered-Mixed-Unseen),为评估模型对显式与隐式关键短语的识别能力提供了精细化的度量框架,成为该领域广泛引用的经典资源。
当前挑战
该数据集所解决的领域挑战在于关键短语提取任务中模型对文本语义深度的把握不足,尤其是区分显式出现与隐式重排、混合及未见关键短语的能力,这要求算法超越简单词汇匹配,具备上下文理解与知识迁移的智能。构建过程中面临的主要挑战包括:1)从PubMed海量文献中筛选出具有高质量作者标注的全文文章,确保数据代表性;2)采用spacy与nltk工具对文本进行分词与词干化预处理时,需处理连字符词汇(如graph-based)的完整性保留,避免信息碎片化;3)参考关键短语与源文本的匹配策略需兼顾准确性,通过词干化降低形态变体带来的偏差,同时应对PRMU分类中“Unseen”类别的界定模糊性,以提升评估的鲁棒性。
常用场景
经典使用场景
在自然语言处理与文本挖掘领域,taln-ls2n/pubmed数据集因其收录了1320篇带有全文和作者标注关键词的PubMed文献而备受青睐。该数据集最经典的使用场景是关键词生成与关键词抽取任务的基准评测,研究者可基于其完整的文章内容与人工标注的关键词集合,训练和评估模型从学术文本中自动提炼核心术语的能力。
衍生相关工作
基于该数据集,衍生了一系列经典研究工作。例如,Boudin与Gallina在2021年NAACL会议上提出了重新定义缺失关键词及其对检索效果影响的理论框架,并利用此数据集验证了PRMU分类的有效性。此外,Schutz的硕士论文首次系统性地探讨了开放域单文档关键词抽取的语言学与统计学方法,其构建的数据集成为后续众多关键词生成模型(如基于序列标注、生成式预训练模型)性能对比的标准基准,推动了该领域的持续创新。
数据集最近研究
最新研究方向
在生物医学文本挖掘领域,PubMed数据集作为关键短语抽取与生成的标准基准,正推动着前沿研究向细粒度语义理解与跨任务泛化能力迈进。当前热点聚焦于利用PRMU分类体系(Present-Reordered-Mixed-Unseen)深化对关键短语存在形态的认知,尤其是针对“未见”(Unseen)关键短语的生成式建模,这直接关联到学术文献自动索引与知识图谱构建的瓶颈突破。随着大规模语言模型在专业领域的渗透,该数据集被广泛用于评估模型在长文本中捕捉隐含语义关联的能力,其包含的1320篇全文文章与作者标注的关键短语,成为检验无监督与弱监督方法在开放域单文档中抽取效果的关键试金石。这一研究方向不仅提升了生物医学文献的检索效率,更为精准医学与科学知识发现提供了可量化的技术支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务