遇见数据集

gabrielaltay/pubtator-central-bigbio-kb-2022-12-18

收藏
Hugging Face2023-01-07 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: string - name: document_id dtype: string - name: passages list: - name: id dtype: string - name: type dtype: string - name: text sequence: string - name: offsets sequence: list: int32 - name: entities list: - name: id dtype: string - name: type dtype: string - name: text sequence: string - name: offsets sequence: list: int32 - name: normalized list: - name: db_name dtype: string - name: db_id dtype: string - name: events list: - name: id dtype: string - name: type dtype: string - name: trigger struct: - name: text sequence: string - name: offsets sequence: list: int32 - name: arguments list: - name: role dtype: string - name: ref_id dtype: string - name: coreferences list: - name: id dtype: string - name: entity_ids sequence: string - name: relations list: - name: id dtype: string - name: type dtype: string - name: arg1_id dtype: string - name: arg2_id dtype: string - name: normalized list: - name: db_name dtype: string - name: db_id dtype: string - name: text dtype: string splits: - name: train num_bytes: 101493304127 num_examples: 33653973 - name: validation num_bytes: 2115702473 num_examples: 701124 - name: test num_bytes: 2117460487 num_examples: 701125 download_size: 49786905438 dataset_size: 105726467087 --- # Dataset Card for "pubtator-central-bigbio-kb-2022-12-18" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征字段: - 字段名:id,数据类型:字符串 - 字段名:document_id,数据类型:字符串 - 字段名:段落(passages):列表类型,包含以下子字段: - 字段名:id,数据类型:字符串 - 字段名:type,数据类型:字符串 - 字段名:text:字符串序列 - 字段名:offsets:int32整型列表序列 - 字段名:实体(entities):列表类型,包含以下子字段: - 字段名:id,数据类型:字符串 - 字段名:type,数据类型:字符串 - 字段名:text:字符串序列 - 字段名:offsets:int32整型列表序列 - 字段名:归一化信息(normalized):列表类型,包含: - 字段名:数据库名称(db_name),数据类型:字符串 - 字段名:数据库ID(db_id),数据类型:字符串 - 字段名:事件(events):列表类型,包含以下子字段: - 字段名:id,数据类型:字符串 - 字段名:type,数据类型:字符串 - 字段名:触发词(trigger):结构体,包含: - 字段名:text:字符串序列 - 字段名:offsets:int32整型列表序列 - 字段名:论元(arguments):列表类型,包含: - 字段名:角色(role),数据类型:字符串 - 字段名:引用ID(ref_id),数据类型:字符串 - 字段名:共指关系(coreferences):列表类型,包含以下子字段: - 字段名:id,数据类型:字符串 - 字段名:实体ID序列(entity_ids),数据类型:字符串序列 - 字段名:关系(relations):列表类型,包含以下子字段: - 字段名:id,数据类型:字符串 - 字段名:type,数据类型:字符串 - 字段名:参数1 ID(arg1_id),数据类型:字符串 - 字段名:参数2 ID(arg2_id),数据类型:字符串 - 字段名:归一化信息(normalized):列表类型,包含: - 字段名:数据库名称(db_name),数据类型:字符串 - 字段名:数据库ID(db_id),数据类型:字符串 - 字段名:全文本(text),数据类型:字符串 数据集划分: - 划分名称:train(训练集),字节数:101493304127,样本数:33653973 - 划分名称:validation(验证集),字节数:2115702473,样本数:701124 - 划分名称:test(测试集),字节数:2117460487,样本数:701125 下载大小:49786905438字节 总数据集大小:105726467087字节 --- # 「pubtator-central-bigbio-kb-2022-12-18」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
gabrielaltay
原始信息汇总

数据集概述

数据集名称

  • 名称:pubtator-central-bigbio-kb-2022-12-18

数据集特征

  • id:字符串类型
  • document_id:字符串类型
  • passages:列表类型,包含以下子特征:
    • id:字符串类型
    • type:字符串类型
    • text:字符串序列类型
    • offsets:整数序列列表类型
  • entities:列表类型,包含以下子特征:
    • id:字符串类型
    • type:字符串类型
    • text:字符串序列类型
    • offsets:整数序列列表类型
    • normalized:列表类型,包含以下子特征:
      • db_name:字符串类型
      • db_id:字符串类型
  • events:列表类型,包含以下子特征:
    • id:字符串类型
    • type:字符串类型
    • trigger:结构类型,包含以下子特征:
      • text:字符串序列类型
      • offsets:整数序列列表类型
    • arguments:列表类型,包含以下子特征:
      • role:字符串类型
      • ref_id:字符串类型
  • coreferences:列表类型,包含以下子特征:
    • id:字符串类型
    • entity_ids:字符串序列类型
  • relations:列表类型,包含以下子特征:
    • id:字符串类型
    • type:字符串类型
    • arg1_id:字符串类型
    • arg2_id:字符串类型
    • normalized:列表类型,包含以下子特征:
      • db_name:字符串类型
      • db_id:字符串类型
  • text:字符串类型

数据集分割

  • 训练集
    • 字节数:101493304127
    • 示例数:33653973
  • 验证集
    • 字节数:2115702473
    • 示例数:701124
  • 测试集
    • 字节数:2117460487
    • 示例数:701125

数据集大小

  • 下载大小:49786905438
  • 数据集大小:105726467087
搜集汇总
数据集介绍
gabrielaltay/pubtator-central-bigbio-kb-2022-12-18 数据集图片
构建方式
在生物医学文本挖掘领域,PubTator Central作为一个重要的知识库,为实体识别与关系抽取提供了丰富的标注数据。gabrielaltay/pubtator-central-bigbio-kb-2022-12-18数据集基于PubTator Central的2022年12月18日快照构建,遵循BigBio KB格式进行规范化处理。数据集的构建过程涉及从海量生物医学文献中抽取篇章、实体、事件、共指与关系等结构化信息,每一篇文档均包含完整的文本内容及其对应的标注信息。实体部分不仅记录了文本片段与偏移量,还提供了标准化标识符,映射到多个外部知识库。事件与关系的定义则通过触发词、角色与引用标识符实现复杂语义结构的编码。整个数据集分为训练、验证与测试三个子集,确保了模型评估的客观性。
特点
该数据集最显著的特点在于其规模庞大且结构高度复合,训练集包含超过3300万个样本,充分覆盖了生物医学领域的多样性与复杂性。数据集的模式设计精细,支持多种信息层次的联合学习,从基础的实体识别到高级的事件抽取与共指消解均可在此框架下进行。每个实体均附带标准化引用信息,便于跨库知识整合。事件结构通过触发词与参数列表清晰刻画了生物过程的动态关系,而共指与关系字段则进一步增强了语义网络的连贯性。此外,数据集中文本、偏移量与标识符的严格对齐,为基于序列标注与图神经网络的方法提供了可靠的基础。
使用方法
使用该数据集时,研究人员可利用HuggingFace Datasets库直接加载,无需额外预处理。数据以字典形式组织,每个样本包含完整的文本、篇章信息以及多层级标注。对于实体识别任务,可提取entities字段中的类型与偏移量进行监督学习;事件抽取则需结合events中的触发词与参数角色进行结构化预测。共指解析可借助coreferences字段将分散的实体提及关联至同一概念。关系抽取任务则通过relations字段中的类型与参数标识符实现。标准化标识符的存在使得模型输出能够直接映射到外部知识库,便于下游应用中的知识推理与整合。
背景与挑战
背景概述
在生物医学文本挖掘领域,海量文献中蕴含的知识亟待系统化提取与整合,而PubTator Central作为一款强大的生物医学文本注释工具,为知识库构建提供了关键支撑。该数据集由Gabriel Altay等研究人员于2022年12月18日创建,依托BigBio项目,旨在将PubTator Central中丰富的实体、事件、共指与关系注释转化为标准化的知识库格式。其核心研究问题在于如何高效、精准地将非结构化的生物医学文本转化为结构化知识,以推动文献挖掘、信息检索及下游应用的发展。该数据集的发布,为生物医学自然语言处理领域提供了大规模、多层次的标注资源,显著促进了实体识别、关系抽取及事件抽取等任务的模型训练与评估。
当前挑战
该数据集所解决的领域挑战在于生物医学文本的复杂性与多样性,包括跨实体类型的精准识别、事件与关系的深层语义建模以及共指消解的准确性,这些任务在传统文本挖掘中常因术语歧义和上下文依赖而表现不佳。在构建过程中,面临的主要挑战包括:从PubTator Central海量且持续更新的原始数据中提取一致性标注,需克服数据异构与格式转换的困难;确保跨数据库(如NCBI、UniProt)归一化标识符的准确映射,以维持实体链接的高可靠性;以及处理超过3300万训练样本的庞大规模,对存储、清洗与校验流程提出了严苛的计算与工程要求。
常用场景
经典使用场景
PubTator Central BigBio KB 2022-12-18 数据集作为生物医学文本挖掘领域的标杆性资源,其经典使用场景集中于大规模生物医学文献的实体识别与关系抽取任务。研究者在处理PubMed及PMC全文时,常利用该数据集进行基因、蛋白质、疾病、化学物质等命名实体的边界识别与类型分类,同时结合其丰富的归一化标识(如NCBI Gene、MeSH、OMIM等数据库ID),构建跨数据库的知识关联。该数据集还广泛用于事件抽取,例如蛋白质-基因相互作用、化学-疾病关联等复杂语义关系的建模,为后续知识图谱构建提供结构化基础。
实际应用
在实际应用中,该数据集支撑了药物重定位、精准医学文献筛选等关键场景。通过解析文献中隐含的基因-疾病-药物三元组,研究人员可快速生成候选靶点列表,加速新药研发的早期发现阶段。此外,医院与科研机构利用该数据集训练的模型自动标注临床病例报告,提取症状、诊断与治疗方案间的逻辑链条,辅助临床决策支持系统。在公共卫生领域,该数据被用于实时监测文献中新兴病原体(如SARS-CoV-2变种)的基因突变与宿主互作关系,为流行病学预警提供数据驱动依据。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于跨度预测的实体识别模型(如BioBERT+CRF)和基于图神经网络的关系抽取框架(如GCN-based RE)。其中,将PubTator Central作为预训练语料的BioSyn模型在归一化任务中取得了突破性进展,而MTL-BioNER则通过多任务学习结构同时优化实体与关系预测。在事件抽取领域,基于该数据集的PURE模型及联合解码方法被广泛引用。此外,其结构化输出格式直接启发了BigBio与BLUE Benchmarks的构建,推动了生物医学NLP评估体系的标准化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务