遇见数据集

cvlt-mao/bc5cdr

收藏
Hugging Face2024-01-11 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含文本序列(tokens)及其对应的标签序列(tags),标签用于标注化学物质(Chemical)和疾病(Disease)。数据集分为训练集、验证集和测试集,分别包含5228、5330和5865个示例。

该数据集包含文本序列(tokens)及其对应的标签序列(tags),标签用于标注化学物质(Chemical)和疾病(Disease)。数据集分为训练集、验证集和测试集,分别包含5228、5330和5865个示例。

提供机构:
cvlt-mao
原始信息汇总

数据集概述

特征

  • tokens: 序列类型,字符串。
  • tags: 序列类型,包含类别标签,具体标签如下:
    • 0: O
    • 1: B-Chemical
    • 2: B-Disease
    • 3: I-Disease
    • 4: I-Chemical

数据分割

  • train:
    • 字节数: 1888772
    • 样本数: 5228
  • validation:
    • 字节数: 1881130
    • 样本数: 5330
  • test:
    • 字节数: 2000887
    • 样本数: 5865

数据集大小

  • 下载大小: 1118925 字节
  • 数据集大小: 5770789 字节

配置

  • default:
    • 训练数据路径: data/train-*
    • 验证数据路径: data/validation-*
    • 测试数据路径: data/test-*
搜集汇总
数据集介绍
构建方式
在生物医学文本挖掘领域,实体识别是信息抽取的核心任务之一。BC5CDR数据集源自BioCreative V竞赛中的化学-疾病关系提取任务,旨在推动化学物质与疾病名称的自动识别研究。该数据集通过整合PubMed文献摘要,由领域专家对文本中的化学物质和疾病实体进行人工标注,采用BIO标注体系(B-Chemical、B-Disease、I-Chemical、I-Disease及O标签)对每个token赋予语义标签,构建了包含5228条训练样本、5330条验证样本和5865条测试样本的高质量语料库。
特点
该数据集最显著的特征在于其专注于化学与疾病两类核心生物医学实体的联合标注,为多实体识别任务提供了标准化基准。数据规模适中但标注精细,所有样本均源自真实科研文献,确保了领域术语的权威性与覆盖度。此外,数据集预设了明确的训练、验证与测试划分,便于模型性能的横向对比与复现。其标签体系简洁且具有领域特异性,有效降低了标注歧义,为后续关系抽取任务奠定了坚实基础。
使用方法
使用者可通过HuggingFace Datasets库直接加载该数据集,指定配置名‘default’即可获取按split划分的token序列与对应标签。典型应用场景包括训练序列标注模型(如BiLSTM-CRF或Transformer架构),以预测每个token的实体类别。建议在输入阶段将tokens字段进行分词对齐,并利用tags字段作为监督信号。评估时可采用精确率、召回率与F1分数等指标,尤其关注化学与疾病实体的独立表现,以全面衡量模型在生物医学NER任务中的泛化能力。
背景与挑战
背景概述
BC5CDR数据集由美国国立生物技术信息中心(NCBI)于2016年创建,旨在推动生物医学文本挖掘领域中化学物质与疾病关系自动识别的研究。该数据集聚焦于从生物医学文献中抽取化学诱导疾病关系,涵盖1500篇PubMed摘要,经过领域专家精细标注,包含化学物质、疾病实体及其相互作用。作为BioCreative V挑战赛的核心资源,BC5CDR为命名实体识别和关系抽取任务提供了标准化基准,显著促进了生物医学信息抽取技术的发展,成为该领域评估模型性能的重要参考标准。
当前挑战
BC5CDR数据集面临的核心挑战在于生物医学文本中化学物质与疾病实体的复杂语义关系。化学物质名称存在同义词、缩写和拼写变体,疾病名称则涉及多种分类体系和层级结构,增加了实体识别的难度。此外,实体边界模糊、跨句子关系抽取以及嵌套实体识别等问题进一步提升了任务复杂性。在构建过程中,标注一致性难以保证,需要多轮专家审核以降低歧义,而数据规模有限(仅5228条训练样本)也限制了深度学习模型的泛化能力,对细粒度关系抽取提出了更高要求。
常用场景
经典使用场景
BC5CDR数据集在生物医学自然语言处理领域占据着举足轻重的地位,其核心应用场景集中于命名实体识别与关系抽取两大任务。该数据集精心标注了化学物质与疾病两类实体,并提供了实体间的关联关系,为构建和评估生物医学文本挖掘模型提供了标准化的基准平台。研究人员常利用其训练集与测试集,开展序列标注模型的训练与性能验证,例如利用BiLSTM-CRF或预训练语言模型(如BioBERT)来精准识别文本中的化学物质和疾病名称。
解决学术问题
该数据集有效解决了生物医学文献中化学物质与疾病实体自动识别及两者关联关系抽取的学术难题。在传统方法中,从海量非结构化文献中手工提取这些关键信息效率低下且难以规模化,BC5CDR的发布为评估和对比不同算法在实体边界界定、多义性消歧以及复杂关系推理上的表现提供了可靠依据。其意义在于推动了信息抽取技术的进步,使得从文献中自动构建化学-疾病知识图谱成为可能,显著促进了药物发现、毒理学研究和疾病机制探索等领域的自动化进程。
衍生相关工作
BC5CDR数据集衍生了一系列影响深远的经典工作,其中最具代表性的是基于预训练语言模型的生物医学信息抽取系统,如BioBERT和PubMedBERT在BC5CDR上的微调应用,显著提升了实体识别与关系抽取的F1分数。此外,该数据集还催生了多任务学习框架的提出,研究者将命名实体识别与关系抽取联合建模,利用共享的上下文表示来增强跨任务的信息交互。这些工作不仅巩固了BC5CDR作为基准测试的地位,也推动了生物医学NLP领域向更深层次语义理解的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务