遇见数据集

Toyokolabs/retinoblastoma

收藏
Hugging Face2023-08-01 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-4.0 task_categories: - question-answering language: - en tags: - biology pretty_name: Retinoblastoma size_categories: - 1M<n<10M --- Retinoblastoma Dataset This dataset contains information related to retinoblastoma from ClinvarTuring https://github.com/ToyokoLabs/ClinvarTuring Licensing Information License: cc-by-4.0 Authors Morgan Lyu, Sebastian Bassi and Virginia Gonzalez ---

--- 许可证:知识共享署名4.0国际许可协议(CC BY 4.0) 任务类别: - 问答(question-answering) 语言: - 英语(en) 标签: - 生物学(biology) 数据集正式名称:视网膜母细胞瘤(Retinoblastoma) 数据规模类别: - 100万 < 数据量 < 1000万 --- 视网膜母细胞瘤数据集 本数据集包含源自ClinvarTuring项目(https://github.com/ToyokoLabs/ClinvarTuring)的与视网膜母细胞瘤相关的信息。 许可信息 许可证:CC BY 4.0 作者 摩根·吕(Morgan Lyu)、塞巴斯蒂安·巴西(Sebastian Bassi)与弗吉尼亚·冈萨雷斯(Virginia Gonzalez)

提供机构:
Toyokolabs
原始信息汇总

Retinoblastoma Dataset 概述

数据集基本信息

  • 许可证: cc-by-4.0
  • 任务类别: 问答
  • 语言: 英语
  • 标签: 生物学
  • 美观名称: Retinoblastoma
  • 大小范围: 1M<n<10M

数据集内容

  • 来源: 来自 ClinvarTuring https://github.com/ToyokoLabs/ClinvarTuring
  • 内容描述: 包含与视网膜母细胞瘤相关的信息

版权与作者

  • 许可证: cc-by-4.0
  • 作者: Morgan Lyu, Sebastian Bassi, Virginia Gonzalez
搜集汇总
数据集介绍
Toyokolabs/retinoblastoma 数据集图片
构建方式
视网膜母细胞瘤作为一种罕见的小儿眼部恶性肿瘤,其遗传学数据的系统化整理对精准医学研究至关重要。该数据集基于ClinvarTuring开源框架构建,通过整合ClinVar数据库中与视网膜母细胞瘤相关的变异注释信息,经标准化清洗与结构化处理形成。构建过程由Morgan Lyu、Sebastian Bassi和Virginia Gonzalez主导,确保了数据来源的权威性与可溯源性,最终以问答任务格式呈现,便于下游模型直接调用。
特点
该数据集以英文语料为主,规模介于1M至10M样本之间,覆盖视网膜母细胞瘤的临床变异与功能注释。其特点在于聚焦单一疾病领域,提供了高度专业化的生物学信息,同时采用问答对形式组织数据,兼顾了知识密集性与任务适配性。开源许可(CC-BY-4.0)进一步降低了学术与工业应用的门槛,促进了跨机构协作研究。
使用方法
数据集可直接用于生物医学领域的问答模型微调与评估,尤其适用于罕见病遗传变异的语义理解与推理任务。使用者可通过HuggingFace Datasets库加载数据,按标准问答格式拆分训练集与测试集。建议结合领域预训练模型(如BioBERT)进行迁移学习,以充分挖掘其专业注释中的潜在知识关联。
背景与挑战
背景概述
视网膜母细胞瘤(Retinoblastoma)是一种源于视网膜胚胎细胞的罕见恶性肿瘤,主要发生于婴幼儿,其早期诊断与精准治疗对预后至关重要。ToyokoLabs团队由Morgan Lyu、Sebastian Bassi和Virginia Gonzalez于近期构建的Retinoblastoma数据集,依托ClinvarTuring项目,旨在整合临床变异注释与问答任务,推动生物医学领域自然语言处理的发展。该数据集包含百万级样本,以英文呈现,聚焦于视网膜母细胞瘤相关的遗传信息与临床问题,为研究者提供结构化数据资源,助力疾病机制探索与临床决策支持。其发布在CC-BY-4.0许可下,促进了开放科学协作,对罕见肿瘤的精准医学研究具有重要影响力。
当前挑战
当前数据集面临多重挑战。首先,在领域问题上,视网膜母细胞瘤的遗传异质性与罕见性导致数据稀疏,现有问答模型难以覆盖所有突变类型与临床场景,限制了诊断与治疗建议的准确性。其次,构建过程中,数据源自ClinvarTuring的异构临床注释,需应对格式不统一、术语歧义及缺失值的清洗难题;同时,确保百万级样本的标签一致性,避免噪声干扰模型训练。此外,英文单语语料限制了跨语言应用,而隐私保护要求(如患者去标识化)增加了数据预处理复杂度。这些挑战需通过持续数据扩充、多模态融合及联邦学习等方法逐步攻克。
常用场景
经典使用场景
在生物医学自然语言处理领域,Toyokolabs/retinoblastoma数据集被广泛用于构建和评估基于临床变异数据库的问答系统。该数据集聚焦于视网膜母细胞瘤这一罕见儿科肿瘤,整合了来自ClinvarTuring的高质量变异注释信息,为研究人员提供了结构化的基因-疾病关联知识。其经典使用场景包括训练能够从大规模临床文本中精确提取基因变异、表型描述及致病性评估的深度学习模型,尤其适用于开发面向精准医学的智能信息检索工具。
解决学术问题
该数据集有效解决了临床变异数据非结构化分布与生物医学问答任务之间存在的语义鸿沟问题。通过将ClinvarTuring中的复杂变异记录转化为标准化的问答对形式,它使得研究人员能够系统性地探索基因变异与视网膜母细胞瘤发病机制之间的深层关联。这一资源显著推动了罕见病知识图谱的构建,并为验证大语言模型在专业医学文献理解中的可靠性提供了基准测试平台,对计算病理学的发展具有重要学术价值。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于对比学习的变异语义嵌入模型,以及融合基因网络拓扑结构的图神经网络推理框架。后续研究者利用该问答对集合开发了专门针对Clinvar数据库的领域预训练语言模型,显著提升了在致病性预测任务上的表现。此外,该数据集还催生了跨物种变异比较分析工具,为探索视网膜母细胞瘤在哺乳动物模型中的保守性机制提供了数据驱动的研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务