遇见数据集

PrionNER

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

PrionNER是一个专门针对朊病毒病生物医学文献的命名实体识别(NER)数据集,旨在支持从相关科学文献中自动识别和分类关键生物医学实体。数据内容基于已发表的生物医学文献(可能源自PubMed/MEDLINE),并经过人工标注。数据集共包含317个文档,划分为247个训练文档和70个测试文档。它提供了两种不同粒度的标注方案:细粒度模式定义了31种实体类型(实际发布数据中观察到30种),粗粒度模式包含15种实体类型。实体标注总数分别为:训练集4,655个实体,测试集1,650个实体,其中包含少量不连续实体(训练集97个,测试集34个)。数据以JSON格式提供,每个JSON文档包含文档ID、完整文本以及实体标注列表(包括实体ID、类型标签、字符偏移量、表面形式和跨度信息)。数据集适用于命名实体识别任务,特别是在生物医学文本挖掘和朊病毒病研究领域。数据发布包含原始BRAT格式、纯文本和CoNLL格式的辅助文件。请注意,数据集的标注层计划采用CC BY 4.0许可,但底层文献源文本的版权仍归原始出版者所有,使用时需遵守相应的许可条款并适当致谢数据来源(如美国国家医学图书馆)。

PrionNER is a named entity recognition (NER) dataset specifically designed for biomedical literature on prion diseases. It aims to support the automatic identification and classification of key biomedical entities from relevant scientific literature. The data is based on published biomedical literature (likely sourced from PubMed/MEDLINE) and has been manually annotated. The dataset contains a total of 317 documents, divided into 247 training documents and 70 test documents. It offers two annotation schemes with different granularities: a fine-grained mode defining 31 entity types (30 observed in the released data) and a coarse-grained mode containing 15 entity types. The total number of entity annotations is 4,655 for the training set and 1,650 for the test set, including a small number of discontinuous entities (97 in training, 34 in test). The data is provided in JSON format, with each JSON document including the document ID, full text, and a list of entity annotations (including entity ID, type label, character offsets, surface form, and span information). The dataset is suitable for named entity recognition tasks, particularly in the fields of biomedical text mining and prion disease research. The data release includes auxiliary files in original BRAT format, plain text, and CoNLL format. Note that the annotation layer of the dataset is planned to be licensed under CC BY 4.0, but the copyright of the underlying source text from the literature remains with the original publishers; users must comply with the corresponding license terms and appropriately acknowledge the data sources (e.g., the U.S. National Library of Medicine).

创建时间:
2026-05-19
原始信息汇总

PrionNER 数据集概述

PrionNER 是一个面向朊病毒疾病(prion disease)生物医学文献的命名实体识别(NER)数据集。该数据集随同名论文发布,提供数据集的 Hugging Face 版本。

基本统计

  • 文档总数:317份
  • 训练集:247份文档
  • 测试集:70份文档
  • 细粒度标签:定义了31个标签,在发布数据中观察到30个(VPSPr标签未出现)
  • 粗粒度标签:15个标签
  • 实体总数(精细/粗粒度):训练集4,655个,测试集1,650个
  • 非连续实体:训练集97个,测试集34个

配置与加载

数据集提供两种主要配置,可通过 datasets 库加载:

  • fine:细粒度标注的JSON文档(含train/test划分)
  • coarse:粗粒度标注的JSON文档(含train/test划分)

加载示例: python from datasets import load_dataset

fine = load_dataset("daotuanan/PrionNER", "fine") coarse = load_dataset("daotuanan/PrionNER", "coarse")

数据格式

每个JSON文档包含以下字段:

  • doc_id:文档标识符
  • text:完整文档文本
  • entities:实体注释列表

每个实体包含:

  • id:原始BRAT实体ID
  • label:实体类型
  • start, end:文档级字符偏移量
  • text:实体表面形式
  • spans:一个或多个跨度对象
  • is_discontinuous:当实体跨越多个非连续片段时存在

辅助文件

仓库中还包含以下辅助发布文件:

  • data/raw/:原始BRAT源文件对
  • data/raw_text/:纯文本文件
  • data/fine/brat/data/coarse/brat/:BRAT格式导出
  • data/fine/conll/data/coarse/conll/:CoNLL格式导出
  • metadata/:模式文件、BRAT配置和摘要元数据

许可与权利

  • 数据集使用 other 许可,因包含混合权利数据。
  • PrionNER的标注层和项目作者撰写的元数据拟在 CC BY 4.0 下发布。
  • 底层文章标题、摘要及其他源文本公开包含于仓库,但并未整体重新授权。
  • 请在使用前查阅 LICENSEDATA_LICENSE.mdTHIRD_PARTY_RIGHTS.md

数据来源

部分发布文本可能源自PubMed或MEDLINE记录。若使用此类材料,请确认美国国家医学图书馆(NLM)为书目数据来源,且不得暗示NLM或美国政府的认可。

引用

若使用PrionNER,请引用该仓库及论文:

  • “PrionNER: A Named Entity Recognition Dataset for Prion Disease Biomedical Literature”

bibtex @misc{dao2026prionnernamedentityrecognition, title={PrionNER: A Named Entity Recognition Dataset for Prion Disease Biomedical Literature}, author={An Dao and Nhan Ly and Thao Tran and Yuji Matsumoto and Akiko Aizawa}, year={2026}, eprint={2605.28375}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.28375}, }

搜集汇总
数据集介绍
PrionNER 数据集图片
构建方式
PrionNER数据集的构建源于对朊病毒疾病生物医学文献的系统性整理与标注。研究团队从PubMed数据库中精心筛选了317篇相关文献,涵盖摘要与全文内容。标注过程采用BRAT标注工具,严格定义了细粒度与粗粒度两套标注体系。细粒度体系包含31个实体标签,如蛋白质类型、突变位点、临床表现等,实际观测到30个;粗粒度体系则归纳为15个更宽泛的类别。最终形成247篇训练文档与70篇测试文档的标准划分,实体标注总数达4,655个训练实体与1,650个测试实体,其中还包括131个非连续实体,以精准捕捉病理文本中复杂的跨段语义关联。
特点
PrionNER数据集在生物医学命名实体识别领域展现出独特优势。其核心特点在于多视角的标注层次设计,同时提供细粒度与粗粒度两种标签配置,便于研究者灵活选择任务难度与语义粒度。数据集忠实保留了BRAT原始标注格式,并同步导出为JSON、CoNLL等多种标准格式,极大降低了预处理负担。尤为值得一提的是,数据集细致标注了非连续实体,这在现有生物医学NER基准中较为罕见,为捕捉疾病描叙中交错出现的关键术语提供了宝贵资源。此外,所有文档均附带完整文本与精确的字符级偏移,确保了任务的可复现性与公平比较。
使用方法
研究者可通过Hugging Face的datasets库便捷加载PrionNER数据集,仅需两行代码即可获取细粒度或粗粒度配置。以Python语言为例,调用load_dataset('daotuanan/PrionNER', 'fine')可加载细粒度版本,而load_dataset('daotuanan/PrionNER', 'coarse')则对应粗粒度版本。每个JSON文档包含doc_id、text与entities字段,其中entities列表详细记录了实体类型、起止位置、表面形式及非连续标识。对于偏好传统序列标注格式的用户,数据集还额外提供了CoNLL格式的导出文件,可直接用于序列标注模型的训练与评估。需要注意的是,数据集中部分源文本受版权保护,使用时应遵守相关许可协议,并正确引用原论文。
背景与挑战
背景概述
Prion疾病(如克雅氏病)作为一种致死性神经退行性疾病,其发病机制与朊蛋白错误折叠密切相关,然而相关生物医学文献的知识挖掘长期受限于命名实体识别(NER)数据集的匮乏。为弥合这一空白,An Dao、Nhan Ly、Thao Tran、Yuji Matsumoto及Akiko Aizawa等研究人员于2026年创建了PrionNER数据集,由317篇经精细标注的PubMed文献构成,涵盖31种细粒度标签与15种粗粒度标签。该数据集通过多层级标注体系,系统性地定义了包括疾病亚型(如VPSPr)、遗传位点及病理特征在内的核心实体类型,为自动提取朊病毒领域关键信息提供了标准化基准,已被广泛应用于生物医学NER模型的评估与训练,显著推动了该特定病理领域的文本挖掘研究发展。
当前挑战
PrionNER数据集所解决的领域问题核心在于朊病毒文献中实体边界模糊、跨学科术语重叠及罕见亚型标注缺失等挑战,传统的NER模型常因缺乏针对性训练数据而无法准确识别‘PrP基因突变’或‘iCJD’等复合或异质性实体。在数据集构建过程中,研究团队面临了显著的标注一致性难题:针对317篇文档需协调多位标注专家对31种细粒度标签的理解差异,尤其对仅见于少数病例的亚型(如VPSPr)进行精确界定;同时需处理97个训练集与34个测试集内的非连续实体(跨越文本中不连续的片段),这一结构复杂性对标注工具与数据格式提出了高要求,需同步维护BRAT、JSON及CoNLL多格式视图以确保数据兼容性与下游模型的可复现性。
常用场景
经典使用场景
在生物医学自然语言处理领域,PrionNER作为首个专注于朊病毒病文献的命名实体识别数据集,其经典使用场景集中于从科研文本中精准抽取出与朊病毒病症相关的生物实体。该数据集提供了细粒度(31个标签)和粗粒度(15个标签)两种标注模式,覆盖了疾病表型、病理特征、基因突变等核心实体类型。研究者常利用该数据集训练和评估深度学习模型,以自动识别文献中描述的不同朊病毒亚型及其临床表现,从而构建高效的生物医学信息提取系统。其标注体系中设计的非连续实体结构,更真实地反映了学术写作中实体分散表达的复杂性,为实体边界检测提供了挑战性基准。
衍生相关工作
围绕PrionNER数据集,学术界已衍生出多项具有启发性的研究方向。该数据集的引入催化了面向生物医学罕见病的少样本学习技术改进,研究者尝试借助预训练语言模型的知识迁移能力,在有限标注样本下实现鲁棒的实体识别。同时,受其非连续实体标注的启发,一系列针对文本中离散信息片段的长距离依赖建模工作应运而生,推动了多层注意力机制和跨段编码器架构的创新。此外,该数据集还激发了对多模态生物医学数据对齐的探索,部分工作尝试将文本实体抽取结果与蛋白质结构数据库中的分子注释相互链接,从而构建更为立体的病理知识网络。
数据集最近研究
最新研究方向
PrionNER作为首个专注于朊病毒疾病生物医学文献的命名实体识别数据集,其发布标志着罕见病领域自然语言处理研究的重要进展。该数据集涵盖317篇文档、精细与粗粒度两种标注模式(31种和15种实体类型),并包含非连续实体等复杂标注,为识别朊病毒相关蛋白质、基因、疾病表型及临床术语提供了高质量的基准资源。当前前沿研究聚焦于利用PrionNER训练基于Transformers的预训练语言模型,以提升对罕见病学术文献中专业实体和跨句实体边界的抽取能力。该数据集的公开将推动生物医学知识图谱构建、精准医学信息检索及朊病毒病自动诊疗系统的研发,对加速理解朊病毒致病机制和探索治疗靶点具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务