遇见数据集

xpertsystems/hc-gen-001-sample

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

HC-GEN-001是一个合成患者级数据集,专注于特发性和遗传性肺纤维化(PF/ILD),涵盖端粒/表面活性蛋白遗传学、纵向肺功能、呼吸道感染负担、AAV基因治疗药效学、抗纤维化治疗、急性加重、生物标志物轨迹和临床结果。这是一个500名患者的样本,基于校准的模拟引擎生成,锚定于已发表的队列和试验统计,不包含真实患者数据。数据集包括162列,模块涵盖人口统计学与诊断、遗传学、肺功能、感染、基因治疗(AAV)、抗纤维化治疗、急性加重、生物标志物、结果与生活质量等。仅用于机器学习开发、基准测试、模式原型设计和教育,不适用于临床用途。

HC-GEN-001 is a synthetic patient-level dataset focused on idiopathic and hereditary pulmonary fibrosis (PF/ILD), covering telomere/surfactant protein genetics, longitudinal pulmonary function, burden of respiratory infections, pharmacodynamics of AAV gene therapy, antifibrotic therapies, acute exacerbations, biomarker trajectories and clinical outcomes. This is a 500-patient sample generated via a calibrated simulation engine, anchored to published cohort and trial statistics, and contains no real patient data. The dataset includes 162 columns, with modules covering demographics and diagnostics, genetics, pulmonary function, infections, gene therapy (AAV), antifibrotic therapies, acute exacerbations, biomarkers, outcomes and quality of life, among others. It is intended solely for machine learning development, benchmarking, pattern prototyping and education, and is not suitable for clinical use.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hc-gen-001-sample 数据集图片
构建方式
该数据集是基于校准仿真引擎生成的合成患者级数据,旨在模拟特发性及遗传性肺纤维化的临床全景。引擎锚定于已发表的队列与临床试验统计指标,通过设定14项关键校准参数,如IPF亚型患病率、MUC5B携带率、肺功能指标均值等,确保队列层面的统计数据落入文献报告的置信区间内。数据生成采用Weibull采样器与逆累积分布函数,并在六组标准随机种子上通过内部验证,获得10.00/10的完整性评分。最终产出包含500名合成患者、162个字段的单一表格数据,以CSV格式存储。
特点
数据集具备高度的领域专业性与结构性,覆盖人口学、遗传学、肺功能、感染、基因治疗、抗纤维化治疗、急性加重、生物标志物及预后等十大模块,共计162个字段。其核心特色在于嵌入纵向肺功能轨迹的横截面设计,通过JSON字符串编码41个季度的FVC变化,兼顾数据简洁性与时序分析需求。遗传模块整合了端粒酶与表面活性蛋白基因突变、MUC5B启动子多态性及外显率修饰因子,基因治疗模块则模拟了AAV载体的药效动力学与免疫原性参数,体现了前沿治疗方案的探索性建模。
使用方法
用户可通过Pandas或HuggingFace Datasets库直接加载CSV文件,并利用json.loads解析纵向FVC轨迹字段。该数据集适用于多种机器学习任务,包括罕见病亚型分型与风险分层模型开发、基因治疗试验设计中的臂分离与应答者建模、肺功能衰退的时间序列预测、以及生存竞争风险模型构建。此外,其对于合成数据方法论验证与OMOP标准模式的ETL原型设计亦具实用价值。需要注意的是,数据集遵循CC-BY-NC-4.0许可,仅限学术用途,禁止用于真实患者诊疗决策。
背景与挑战
背景概述
HC-GEN-001样本数据集由XpertSystems.ai于2026年创建,专注于特发性与遗传性肺纤维化(PF/ILD)这一罕见但致命的呼吸系统疾病。该数据集通过仿真引擎生成,锚定于ATS/ERS/JRS/ALAT 2022指南、IPFnet、PROFILE队列及Armanios端粒生物学等权威文献的统计学参数,旨在为机器学习模型开发、基准测试及临床研究设计提供标准化合成患者级数据。其涵盖端粒/表面活性蛋白遗传学、纵向肺功能、呼吸感染负担、AAV基因治疗药效学及临床结局等多维度模块,共162列特征,推动了肺纤维化亚型分类、基因治疗试验模拟及生存分析等领域的算法验证与知识发现,在合成数据方法学与罕见病精准医学研究中具有重要参考价值。
当前挑战
该数据集面临的核心挑战源自其解决的领域问题与构建过程的复杂性。首先,肺纤维化作为异质性极强的罕见病,其亚型间(IPF、FPF、HPS_PF等)的基因型-表型关联、疾病进展速率差异及治疗反应多样性难以通过真实世界小样本充分刻画,HC-GEN-001需在合成环境中复现这些复杂关联。其次,构建过程中需平衡边际校准与联合保真度:尽管单变量患病率及结构化分离(如亚型年龄差距、端粒长度差异、基因治疗臂响应分离)已锚定文献,但高阶相关性未被独立验证。此外,基因治疗模块基于前瞻性、示意性参数而非获批产品数据,纵向结构以嵌入轨迹而非独立就诊行表达,且小样本(n=500)下分类率存在抽样方差,需谨慎解读以避免过度泛化。
常用场景
经典使用场景
在间质性肺疾病与罕见遗传病研究领域,该数据集最为经典的使用场景是构建特发性与遗传性肺纤维化的亚型分类与风险分层模型。其内嵌的162维结构化特征涵盖人口学、基因变异、肺功能纵向轨迹、感染负荷、抗纤维化治疗反应及基因治疗药效学等多模态信息,尤其支持基于MU C5B启动子突变、端粒酶基因变异与表面活性蛋白突变的遗传亚型区分。研究者可借此探索IPF、家族性肺纤维化及端粒病相关肺病之间的表型异质性,并开发基于联合临床-基因组特征的预后评分工具。
解决学术问题
该数据集解 决的核心学术问题在于为罕见肺纤维化疾病提供可复现、高保真的合成对照数据,以弥补真实队列中样本量不足和隐私限制带来的研究困境。它系统锚定了14项关键文献校准指标,如MU C5B携带率、FVC年均下降速率、基因治疗组与安慰剂组的FVC分离度等,使得研究者能够在统计约束下验证亚组分析、竞争风险模型和纵向轨迹预测方法的稳健性。其结构性设计促进了多中心疗效比较和罕见事件(如急性加重)的风险建模,推动了从描述性统计到因果推断的方法学转变。
衍生相关工作
该数据集的衍生工作主要集中于三个方向:其一,基于其基因型-表型的工艺分离特性,催生了罕见病表型模拟器家族,如将端粒长度与表面活性蛋白变异纳入竞争风险生存框架的扩展模型;其二,其所嵌入的基因治疗响应分离结构被用于训练可解释性疫苗-基因治疗应答分类器,并衍生出针对AAV载体免疫原性的迁移学习研究;其三,围绕该数据的合成数据保真度验证体系,已发展出一套涵盖14项多维校准指标的质量评分协议,被多个机构采用为合成临床数据发布的标准性评估准则。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务