遇见数据集

bigbio/verspoor_2013

收藏
Hugging Face2022-12-22 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含关于遗传性结直肠癌的全文期刊出版物的小型语料库的注释,适用于命名实体识别(NER)和关系抽取(RE)任务。它使用了Variome Annotation Schema,该模式旨在捕捉与人类遗传变异及其与疾病关系相关的核心概念和关系。该模式受到国际胃肠道遗传性肿瘤协会(InSiGHT)数据库管理者的启发,但适用于多种疾病的遗传变异信息。

This dataset contains annotations for a small corpus of full-text journal publications regarding hereditary colorectal cancer, tailored for named entity recognition (NER) and relation extraction (RE) tasks. It uses the Variome Annotation Schema, which is designed to capture core concepts and relationships related to human genetic variations and their associations with diseases. This schema is inspired by the curators of the International Society for Gastrointestinal Hereditary Tumours (InSiGHT) database, but is applicable to genetic variation information across multiple diseases.

提供机构:
bigbio
原始信息汇总

数据集概述

基本信息

  • 名称: Verspoor 2013
  • 语言: 英语
  • 许可: 未知
  • 多语言性: 单语
  • PubMed可用性: 是
  • 公开可用性: 是

任务类型

  • 命名实体识别 (NER)
  • 关系抽取 (RE)

数据集描述

  • 内容: 包含关于遗传性结直肠癌的全文期刊出版物的标注数据。
  • 适用性: 适用于命名实体识别和关系抽取任务。
  • 标注方案: 使用Variome Annotation Schema,该方案旨在捕捉与人类遗传变异及其与疾病关系相关的核心概念和关系。
  • 应用范围: 不仅限于遗传性结直肠癌,还适用于其他疾病的遗传变异信息。

引用信息

@article{verspoor2013annotating, title = {Annotating the biomedical literature for the human variome}, author = { Verspoor, Karin and Jimeno Yepes, Antonio and Cavedon, Lawrence and McIntosh, Tara and Herten-Crabb, Asha and Thomas, Zo{"e} and Plazzer, John-Paul }, year = 2013, journal = {Database}, publisher = {Oxford Academic}, volume = 2013 }

搜集汇总
数据集介绍
bigbio/verspoor_2013 数据集图片
构建方式
该数据集基于遗传性结直肠癌主题的全文期刊文献构建,采用Variome注释模式,旨在捕捉与人类遗传变异及其疾病关联相关的核心概念与关系。注释模式受国际胃肠遗传性肿瘤学会数据库策展需求的启发,但设计上适用于多种疾病的遗传变异信息。数据集涵盖小规模语料库,支持命名实体识别与关系抽取任务。
使用方法
该数据集适用于命名实体识别与关系抽取任务,用户可直接加载用于训练和评估生物医学信息提取模型。建议结合预训练语言模型进行微调,以充分挖掘Variome注释模式中的实体与关系信息。数据集已公开于HuggingFace平台,可通过标准接口调用。
背景与挑战
背景概述
在生物医学文本挖掘领域,精准识别与遗传变异相关的实体及其关系是推动精准医学发展的关键环节。Verspoor 2013数据集由Karin Verspoor等研究人员于2013年创建,旨在应对遗传性结直肠癌相关文献中基因变异信息的结构化提取难题。该数据集以国际胃肠道遗传性肿瘤学会数据库的策展需求为灵感,采用Variome注释模式,聚焦于人类遗传变异与疾病关联的核心概念与关系。尽管规模较小,但其专注于全文本期刊论文的细粒度标注,为命名实体识别和关系抽取任务提供了宝贵的基准资源,尤其在遗传变异信息标准化方面具有开创性意义,对后续生物医学信息抽取研究产生了深远影响。
当前挑战
该数据集面临的核心挑战在于领域特异性与数据稀疏性的双重制约。首先,遗传性结直肠癌相关文献中实体类型高度专业化,如基因突变、表型描述和疾病关联等,传统通用NER模型难以准确识别这些领域特有实体。其次,关系抽取任务需捕获复杂的一对多或多对多交互,例如基因变异与多种癌症亚型之间的关联,现有模型在长距离依赖和嵌套关系建模上表现不足。此外,数据集构建过程中,注释者需严格遵循Variome模式,但不同专家对变异描述的语义边界认知差异显著,导致注释一致性维护困难。同时,小样本特性限制了深度学习模型的泛化能力,使得跨疾病领域的迁移应用面临严峻挑战。
常用场景
经典使用场景
Verspoor 2013数据集聚焦于遗传性结直肠癌领域的生物医学文献,基于全文本期刊论文构建,采用Variome注释模式对核心概念与关系进行精细标注。其经典使用场景集中于命名实体识别与关系抽取两项基础任务,旨在从文献中自动识别基因变异、疾病表型及相关实体间的语义关联,为生物医学文本挖掘提供了高质量的小规模黄金标准语料。
解决学术问题
该数据集着力解决遗传变异与疾病关系文献中信息抽取的学术难题,尤其针对人工数据库构建中耗时耗力的文献筛检与注释瓶颈。通过提供标准化的变异组学注释模式,它使研究者能够系统性地评估和提升实体识别与关系抽取算法的性能,从而推动生物医学知识自动获取技术的发展,对精准医学研究中的基因-疾病关联发现具有深远意义。
实际应用
在实际应用中,Verspoor 2013数据集主要服务于遗传性疾病数据库的自动构建与更新,例如国际胃肠道遗传性肿瘤学会数据库的文献注释。其标注模式可迁移至其他疾病领域,辅助生物医学研究人员快速从海量文献中提取关键变异信息,加速遗传咨询、疾病诊断及个性化治疗方案的制定,降低人工梳理文献的认知负荷与时间成本。
数据集最近研究
最新研究方向
在生物医学自然语言处理领域,遗传变异与疾病关系的知识提取正成为精准医学研究的重要基石。Verspoor 2013数据集聚焦于遗传性结直肠癌相关全文学术文献,采用为国际遗传性消化道肿瘤学会数据库量身定制的变异组注释模式,精准捕获人类遗传变异与疾病关联的核心概念与关系。当前前沿研究方向集中于利用该数据集推动命名实体识别与关系抽取模型的深化发展,特别是在多实体交互与复杂语义关系建模方面。随着临床基因组学数据爆炸式增长,该数据集为自动化文献挖掘提供了关键基准,助力从海量科学文本中高效提取变异-表型关联,加速遗传性癌症的机制解析与临床决策支持,对实现从实验室到病床的转化研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务