遇见数据集

francescoocurcio/ncbi-disease

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于命名实体识别(NER)任务的文本数据集,专注于疾病实体的标注。数据集中每条样本包含id、tokens(分词后的文本序列)和ner_tags(对应的命名实体标签)三个字段。标签体系采用BIO标注方案,包括O(非疾病实体)、B-Disease(疾病实体起始)和I-Disease(疾病实体内部)。数据集划分为训练集(5432个样本)、验证集(923个样本)和测试集(940个样本),总大小约3.19MB。

This dataset is a text dataset for Named Entity Recognition (NER) tasks, focusing on disease entity annotation. Each sample in the dataset includes three fields: id, tokens (tokenized text sequence), and ner_tags (corresponding named entity labels). The labeling scheme uses the BIO format, with categories including O (non-disease entity), B-Disease (beginning of disease entity), and I-Disease (inside of disease entity). The dataset is split into training set (5,432 samples), validation set (923 samples), and test set (940 samples), with a total size of approximately 3.19MB.

提供机构:
francescoocurcio
搜集汇总
数据集介绍
francescoocurcio/ncbi-disease 数据集图片
构建方式
ncbi-disease数据集源自NCBI(美国国家生物技术信息中心)对生物医学文献的系统性挖掘,专注于疾病命名实体的识别与标注。该数据集以PubMed摘要为语料基础,通过专家手工标注的方式,对文本中的疾病提及进行精细化的实体边界界定与类别划分。其标注体系采用经典的BIO(Begin、Inside、Outside)模式,将每个词语标注为‘B-Disease’(疾病实体起始)、‘I-Disease’(疾病实体内部)或‘O’(非疾病实体),从而构建起高质量、无歧义的序列标注任务语料。数据集的构建严格遵循平衡性与代表性原则,确保涵盖多种疾病类型的表述方式,为后续的自然语言处理模型训练提供了可靠的金标准参考数据。
特点
ncbi-disease数据集的核心特点在于其专业性与精准性,作为生物医学领域疾病命名实体识别的基准数据集,它被广泛应用于各类序列标注模型的评测与对比。数据集包含训练集5432个样本、验证集923个样本以及测试集940个样本,每个样本均由原始的单词序列(tokens)及其对应的标注序列(ner_tags)组成。其标注标签仅聚焦于‘疾病’这一单一实体类型,结构简洁而聚焦,避免了多类型实体混杂带来的评估干扰。此外,数据集源自真实生物医学文献,词汇丰富、表述多样,能够有效考验模型在复杂专业术语和上下文语境中的实体边界识别能力。
使用方法
ncbi-disease数据集的使用方法高度契合自然语言处理中序列标注任务的标准流程。研究者可通过Hugging Face的datasets库便捷加载该数据集,利用其提供的‘train’、‘validation’和‘test’三个固定分割直接进行模型训练与评估。在使用时,通常需要将文本的‘tokens’字段作为输入特征输入至预训练语言模型(如BERT、BioBERT等),并将‘ner_tags’字段作为预测目标,通过计算交叉熵损失函数进行参数优化。数据集提供了清晰的config_name为‘default’,用户可按split参数指定所需子集,亦可结合transformers库中的TokenClassification类快速搭建疾病命名实体识别模型,极大降低了生物医学文本挖掘领域的实验门槛。
背景与挑战
背景概述
ncbi-disease数据集由美国国立生物技术信息中心(NCBI)于2014年发布,专注于从生物医学文献中自动识别疾病命名实体。该数据集的核心研究问题在于构建一个高质量、人工标注的语料库,以支持自然语言处理模型在生物医学文本中准确提取疾病名称。通过对PubMed摘要进行细粒度标注,ncbi-disease推动了命名实体识别技术在精准医学和文献挖掘领域的发展,成为评估疾病实体识别系统的基准之一。其影响力体现在被广泛用于训练和评测深度学习模型,如BioBERT等,显著提升了医学文本的自动化处理能力。
当前挑战
ncbi-disease数据集面临的主要挑战体现在领域问题与构建过程两方面。在领域问题上,生物医学文本中的疾病名称具有多义性、缩写多变、以及新出现术语频繁等特征,导致实体边界模糊,模型需区分疾病与其他医学概念(如药物、症状)。构建过程中,标注者需处理复杂的长命名实体(如“chronic obstructive pulmonary disease”),并解决跨上下文同一实体表述不一致的问题,同时确保高标注一致性。此外,数据集规模有限(训练集仅5432例),限制了模型对罕见疾病的泛化能力,且需持续更新以应对医学知识的快速演化。
常用场景
经典使用场景
ncbi-disease数据集是生物医学文本挖掘领域中用于疾病命名实体识别(Disease Named Entity Recognition, Disease NER)的经典基准资源。该数据集包含从PubMed文献中精心标注的句子级文本,每个词都被标记为‘O’(非实体)、‘B-Disease’(疾病实体起始)或‘I-Disease’(疾病实体内部),为训练和评估序列标注模型提供了标准化的输入格式。研究者常利用该数据集构建基于双向长短期记忆网络(BiLSTM)、条件随机场(CRF)或近年来盛行的预训练语言模型(如BioBERT、PubMedBERT)的NER系统,以精准识别医学文献中提及的疾病名称。其结构简洁、划分明确的训练、验证与测试集(分别包含5432、923和940个样本),使其成为对比不同算法性能的可靠平台,在计算语言学与生物信息学交叉领域发挥着奠基作用。
解决学术问题
ncbi-disease数据集的核心学术贡献在于解决了生物医学文献中海量非结构化文本中疾病实体的自动识别难题。在信息爆炸的精准医学时代,手动从超过三千万篇PubMed摘要中提取疾病关联信息已不现实,而该数据集提供了高质量的标注范例,使得基于监督学习的模型能够学习到疾病名称的词汇模式与上下文规律。它有效规避了传统规则方法泛化能力弱的缺陷,推动生成式与判别式序列标注模型的迅速发展。该数据集解决了跨术语变体识别(如‘breast cancer’与‘carcinoma of the breast’)与歧义消解(如‘cold’可能指普通感冒而非低温)等关键自然语言处理挑战,显著提升了信息抽取的准确率与召回率,为后续的生物医学关系抽取、临床试验筛选及知识图谱构建奠定了方法论与评价基础。
衍生相关工作
ncbi-disease数据集的发布催生了一批具有里程碑意义的衍生工作。最具代表性的包括BioBERT(Lee et al., 2020),该模型在包括ncbi-disease在内的多个生物医学NER基准上进行微调,证明了领域预训练的重要性,其F1分数在该数据集上达到91.5%以上。随后,PubMedBERT(Gu et al., 2021)通过从零预训练进一步提升性能,确立了新的标杆。在架构创新方面,LEE et al.引入跨模态注意力机制融合字符与词级特征,而最新的大语言模型如GPT-4与LLaMA经过指令微调后也在该数据集上进行零样本与少样本评估,推动了生成式NER范式的发展。此外,该数据集还被整合进多任务学习框架中,与药物-疾病关系抽取、基因-疾病关联发现等任务联合训练,展示了疾病识别作为基础组件在复杂生物医学分析中的枢纽作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务