遇见数据集

Data-Gouv-FR/dataset-to-develop-diagnostic-and-predictive-tools-addressing-ia-rupture-risk

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集来自法国ICAN(颅内动脉瘤)研究项目,旨在更好地理解颅内动脉瘤(IA)的病理生理学。其中一个核心挑战是开发针对IA破裂风险的诊断和预测工具。为支持计算可重复性,这里提供了一个模拟的临床数据集,并配备了Python和R笔记本。这些材料支持题为Location of intracranial aneurysms is the main factor associated with rupture in the ICAN population的论文,该论文发表于JNNP期刊。数据集包含两个子集:匿名合成遗传数据样本和匿名合成数据集,用于辅助研究和工具开发。

ICAN (https://doi.org/10.1093/neuros/nyw135) is a French research program aimed at better understanding the pathophysiology of intracranial aneurysm (IA). One of the addressed challenges is to develop diagnostic and predictive tools addressing IA rupture risk. For computational reproducibility, we provide here a simulated clinical dataset tooled with Python and R notebooks. This material supports the paper Location of intracranial aneurysms is the main factor associated with rupture in the ICAN population published at https://jnnp.bmj.com/content/92/2/122.abstract.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/dataset-to-develop-diagnostic-and-predictive-tools-addressing-ia-rupture-risk 数据集图片
构建方式
该数据集源于法国ICAN研究计划,旨在深入解析颅内动脉瘤的病理生理机制,并着力于开发预测其破裂风险的诊断工具。数据集基于临床模拟构建,依托Python与R语言编写的Notebook脚本进行数据生成与预处理。研究者从真实临床样本中提取关键变量,通过仿真技术创建了一个标准化的数据集,以确保计算可重复性,并支持相关研究论文中的结论验证。
特点
数据集具备高度的科研导向性与实用性,专门针对颅内动脉瘤破裂风险的诊断与预测任务设计。其核心特点包括:模拟临床数据真实反映患者特征,并配套了完整的Python与R Notebook分析工具,便于研究者直接重现论文结果。此外,数据集采用Creative Commons Attribution Share-Alike许可协议,鼓励学术共享与二次开发,但当前Hugging Face页面仅作为引用入口,实际数据存储于法国政府开放数据平台。
使用方法
使用者可通过Hugging Face页面中的链接跳转至法国data.gouv.fr平台下载原始数据集。随后,可运用配套的Python或R Notebook进行数据加载、预处理及建模分析。Notebook内置了论文所述的分析流程,涵盖特征工程、统计建模及破裂风险预测等环节,适合作为颅内动脉瘤研究领域的基准测试工具或教学案例。建议结合论文《Location of intracranial aneurysms is the main factor associated with rupture in the ICAN population》进行深入理解。
背景与挑战
背景概述
颅内动脉瘤(IA)破裂是导致蛛网膜下腔出血的严重血管疾病,其临床风险预测与早期诊断一直是神经外科领域的研究热点。2016年,法国ICAN研究计划(doi:10.1093/neuros/nyw135)应运而生,旨在深入阐明IA的病理生理机制。该数据集由ICAN团队创建,核心研究问题聚焦于开发可靠的诊断与预测工具,以评估IA破裂风险。基于ICAN队列的临床数据,研究揭示了动脉瘤位置是破裂的主要决定因素,相关成果发表于《Journal of Neurology, Neurosurgery & Psychiatry》。该数据集通过提供模拟临床数据及标准化分析工具,推动了计算可复现性,为全球IA风险分层研究奠定了重要基础。
当前挑战
该数据集面临的核心挑战在于解决IA破裂风险预测的临床难题——传统的形态学参数(如大小、位置)难以准确判别个体化破裂概率,亟需多维度生物标志物的整合。构建过程中,由于真实临床数据的敏感性与隐私限制,研究者需模拟生成符合原始队列特征的数据,同时确保工具包的通用性与可复现性。此外,不同医疗机构间数据采集标准不统一、随访信息缺失等现实问题,进一步增加了数据质量控制的复杂性。跨学科协作需求与计算模型的可解释性要求,也对现有框架的优化提出了持续挑战。
常用场景
经典使用场景
该数据集源自法国ICAN研究计划,旨在深入解析颅内动脉瘤的病理生理机制。其经典使用场景在于构建诊断与预后预测模型,通过整合临床、影像及生物标志物等多维特征,量化评估动脉瘤破裂风险。研究者可借助数据集提供的模拟临床数据及Python/R分析工具,复现并验证'动脉瘤位置是破裂风险主导因素'的核心发现,从而推动基于位置亚型的风险分层策略的优化。
实际应用
在实际临床场景中,该数据集可辅助开发用于神经外科门诊的快速筛查工具,通过输入动脉瘤位置及常规临床参数,即时输出破裂风险评级。医方借此优化治疗决策,为低风险患者避免侵入性干预,同时确保高风险病例及时接受夹闭或介入治疗。此外,该数据集所配套的复现性分析框架,有助于不同医疗中心统一风险评估标准,促进多中心协作验证和指南的更新。
衍生相关工作
基于该数据集,衍生出多项标志性工作:例如利用机器学习算法(如随机森林、支持向量机)构建位置主导的破裂预测模型,以及结合影像组学特征优化风险分层体系。与之相关的经典文献包括发表于《Journal of Neurology, Neurosurgery & Psychiatry》的ICAN队列原始研究,以及后续针对动脉瘤位置、人口学特征与破裂关联性的多变量回归分析。这些工作共同推动了数据驱动的颅内动脉瘤诊疗研究范式的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务