遇见数据集

Adapting/chinese_biomedical_NER_dataset

收藏
Hugging Face2022-09-21 更新2024-03-04 收录
官方服务:

资源简介:

--- license: mit --- # 1 Source Source: https://github.com/alibaba-research/ChineseBLUE # 2 Definition of the tagset ```python tag_set = [ 'B_手术', 'I_疾病和诊断', 'B_症状', 'I_解剖部位', 'I_药物', 'B_影像检查', 'B_药物', 'B_疾病和诊断', 'I_影像检查', 'I_手术', 'B_解剖部位', 'O', 'B_实验室检验', 'I_症状', 'I_实验室检验' ] tag2id = lambda tag: tag_set.index(tag) id2tag = lambda id: tag_set[id] ``` # 3 Citation To use this dataset in your work please cite: Ningyu Zhang, Qianghuai Jia, Kangping Yin, Liang Dong, Feng Gao, Nengwei Hua. Conceptualized Representation Learning for Chinese Biomedical Text Mining ``` @article{zhang2020conceptualized, title={Conceptualized Representation Learning for Chinese Biomedical Text Mining}, author={Zhang, Ningyu and Jia, Qianghuai and Yin, Kangping and Dong, Liang and Gao, Feng and Hua, Nengwei}, journal={arXiv preprint arXiv:2008.10813}, year={2020} } ```

--- 许可证:MIT许可证 --- # 1 数据集来源 数据集来源链接:https://github.com/alibaba-research/ChineseBLUE # 2 标签集定义 python tag_set = [ 'B_手术', 'I_疾病和诊断', 'B_症状', 'I_解剖部位', 'I_药物', 'B_影像检查', 'B_药物', 'B_疾病和诊断', 'I_影像检查', 'I_手术', 'B_解剖部位', 'O', 'B_实验室检验', 'I_症状', 'I_实验室检验' ] tag2id = lambda tag: tag_set.index(tag) id2tag = lambda id: tag_set[id] # 3 引用规范 若在学术研究中使用本数据集,请引用以下文献: Ningyu Zhang, Qianghuai Jia, Kangping Yin, Liang Dong, Feng Gao, Nengwei Hua. Conceptualized Representation Learning for Chinese Biomedical Text Mining @article{zhang2020conceptualized, title={Conceptualized Representation Learning for Chinese Biomedical Text Mining}, author={Zhang, Ningyu and Jia, Qianghuai and Yin, Kangping and Dong, Liang and Gao, Feng and Hua, Nengwei}, journal={arXiv preprint arXiv:2008.10813}, year={2020} }

提供机构:
Adapting
原始信息汇总

数据集概述

1. 数据来源

2. 标签集定义

  • 标签集包含以下类别:
    • B_手术
    • I_疾病和诊断
    • B_症状
    • I_解剖部位
    • I_药物
    • B_影像检查
    • B_药物
    • B_疾病和诊断
    • I_影像检查
    • I_手术
    • B_解剖部位
    • O
    • B_实验室检验
    • I_症状
    • I_实验室检验

3. 引用信息

  • 引用文献:Conceptualized Representation Learning for Chinese Biomedical Text Mining

  • 作者:Ningyu Zhang, Qianghuai Jia, Kangping Yin, Liang Dong, Feng Gao, Nengwei Hua

  • 发表年份:2020

  • 引用格式:

    @article{zhang2020conceptualized, title={Conceptualized Representation Learning for Chinese Biomedical Text Mining}, author={Zhang, Ningyu and Jia, Qianghuai and Yin, Kangping and Dong, Liang and Gao, Feng and Hua, Nengwei}, journal={arXiv preprint arXiv:2008.10813}, year={2020} }

搜集汇总
数据集介绍
Adapting/chinese_biomedical_NER_dataset 数据集图片
构建方式
在中文生物医学文本挖掘领域,命名实体识别(NER)是信息抽取的关键任务之一。该数据集源自阿里巴巴研究团队发布的ChineseBLUE基准测试资源,通过对中文生物医学文献与临床文本进行系统化标注而构建。其标签体系涵盖七类核心实体,包括疾病和诊断、症状、解剖部位、药物、手术、影像检查及实验室检验,采用BIO(Begin-Inside-Outside)标注范式,将每个实体类别细分为起始标签(B_)与内部标签(I_),并辅以非实体标签(O),总计15个标签类别,形成层次分明、覆盖全面的标注框架。
特点
该数据集具有鲜明的领域适配性与标注精细度。其标签集不仅囊括了生物医学文本中高频出现的实体类型,如‘疾病和诊断’与‘药物’,还特别纳入‘影像检查’与‘实验室检验’等临床实践中的关键要素,使其在中文临床NER任务中展现出卓越的实用性。通过BIO编码的严格划分,数据集有效捕捉了实体的边界信息,支持模型对多词实体与嵌套结构的精准识别,为训练高泛化能力的生物医学NER模型提供了坚实的数据基础。
使用方法
该数据集专为序列标注任务设计,可直接用于训练与评估中文生物医学NER模型。使用时,研究人员需依据预定义的tag2id与id2tag映射函数,将文本中的每个字符转换为对应的标签索引,以构建模型输入。推荐采用基于Transformer的预训练语言模型(如BERT、RoBERTa)进行微调,通过交叉熵损失函数优化实体边界与类型预测。此外,引用该数据集时需遵循其学术出处,即引用Zhang等人2020年的相关工作,以确保研究可复现与学术诚信。
背景与挑战
背景概述
在自然语言处理领域,中文生物医学文本挖掘因其独特的语言复杂性和专业术语体系而面临显著挑战。为应对这一需求,阿里巴巴研究团队联合多位学者于2020年发布了Adapting/chinese_biomedical_NER数据集,该数据集源自ChineseBLUE基准,由张宁宇、贾强辉、尹康平、董亮、高峰、华能伟等研究人员共同构建。其核心研究问题聚焦于中文生物医学命名实体识别,涵盖手术、疾病诊断、症状、解剖部位、药物、影像检查、实验室检验等15类细粒度实体标签,旨在推动中文医学文本的结构化信息提取。该数据集为概念化表示学习提供了标注基础,显著促进了中文生物医学自然语言处理的研究进展,成为评估模型在专业领域性能的重要基准之一。
当前挑战
当前数据集面临的核心挑战首先在于中文生物医学领域实体边界的模糊性与嵌套结构的复杂性,例如症状与疾病诊断在语境中常存在语义重叠,导致标注一致性难以保障。其次,构建过程中需处理医学文本中大量存在的缩写、术语变体以及跨领域引用,原始数据来源于多源临床语料,需经过严格清洗与专家审核,以确保标签集覆盖的全面性与准确性。此外,数据集的规模相对有限,难以覆盖罕见疾病或新兴医学术语,这限制了模型在真实临床场景中的泛化能力。最后,跨机构合作中的数据隐私与伦理合规要求,也为数据集的持续扩展与更新带来了额外障碍。
常用场景
经典使用场景
在中文生物医学文本挖掘领域,命名实体识别(NER)是信息抽取的基础任务,旨在从非结构化临床文本中精准识别出疾病、药物、手术、解剖部位等关键实体。该数据集作为ChineseBLUE基准的重要组成部分,为中文医学NER提供了标准化的标注语料,涵盖15种细粒度实体标签,被广泛用于训练和评估序列标注模型,如BiLSTM-CRF和预训练语言模型(BERT、RoBERTa)在该任务上的性能表现。
衍生相关工作
基于该数据集,衍生出一系列经典工作,如Zhang等人提出的概念化表示学习方法,通过融合医学本体知识增强实体表征,显著提升了NER性能。后续研究进一步探索了跨领域迁移学习、少样本学习以及多模态医学文本分析等方向。该数据集也成为ChineseBLUE榜单的核心评测任务之一,持续激励着中文医学自然语言处理算法的创新与迭代。
数据集最近研究
最新研究方向
在当前自然语言处理与生物医学交叉领域的前沿探索中,中文生物医学命名实体识别(NER)正成为精准医疗与临床文本挖掘的关键技术节点。该数据集源自阿里研究院的ChineseBLUE项目,其标签体系覆盖手术、疾病、症状、药物、解剖部位及影像检查等核心医学实体类别,为中文电子病历、科研文献及临床试验记录的结构化解析提供了标准化基准。随着大语言模型在垂直行业的渗透,研究者正利用此类高质量标注数据推动少样本学习与跨模态实体对齐,尤其在新冠疫情期间,快速提取病例症状与药物关联的需求凸显了该数据集在实时疫情监控与药物重定位中的战略价值。此外,结合知识图谱的增强表示学习范式(如论文提出的概念化表示方法)进一步提升了模型对中文医学隐晦表述的泛化能力,为构建可解释的临床决策支持系统奠定了数据基础,其影响已延伸至智能问诊、药物不良反应监测等热点应用场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务