遇见数据集

xpertsystems/hc-end-007-sample

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

HC-END-007是一个深度试验校准的合成骨质疏松和代谢性骨病患者队列数据集,涵盖DXA骨矿物质密度(腰椎/股骨颈/全髋)、WHO分类、FRAX和Garvan骨折风险、骨转换标志物(CTX、P1NP、骨钙素、BSAP、硬化素、RANKL/OPG)、九类药物疗效、继发性骨质疏松评估、跌倒风险和神经肌肉评估以及临床骨折结局。该存储库包含一个500行、单种子的样本,完整商业产品可扩展至20,000多名患者,具有20年纵向轨迹,并提供CSV、Parquet、JSON和FHIR R4格式。药物特异性骨密度增益和骨折风险比硬锚定于关键随机对照试验(如FIT、HORIZON、FREEDOM、FRAME、ARCH),确保精确复现试验文献。数据集适用于骨折风险预测、治疗效果建模、生存分析、跌倒风险筛查、健康经济学建模等研究用途,但仅限研究/开发使用,不用于临床决策。

A deeply trial-calibrated synthetic cohort of osteoporosis and metabolic bone disease patients spanning DXA bone mineral density (lumbar/femoral neck/total hip), WHO classification, FRAX & Garvan fracture risk, bone turnover markers (CTX, P1NP, osteocalcin, BSAP, sclerostin, RANKL/OPG), treatment efficacy across nine drug classes, secondary osteoporosis workup, fall-risk & neuromuscular assessment, and incident-fracture clinical outcomes. This repository contains a 500-row, single-seed sample. The full commercial product scales to 20,000+ patients with 20-year longitudinal trajectories and CSV / Parquet / JSON / FHIR R4 delivery. Per-drug BMD gains and fracture risk ratios are hard-anchored to landmark RCTs (FIT, HORIZON, FREEDOM, FRAME, ARCH) and applied directly — so drug-specific benchmarks reproduce the trial literature precisely. Suitable for fracture-risk prediction, treatment-efficacy modeling, survival analysis, fall-risk screening, health-economics modeling, etc., but for research/development use only, not for clinical decision-making.

提供机构:
xpertsystems
搜集汇总
数据集介绍
xpertsystems/hc-end-007-sample 数据集图片
构建方式
该数据集基于内分泌学领域骨质疏松症与代谢性骨病的临床研究背景,由XpertSystems.ai的合成数据工厂生成。其构建核心采用深度临床试验校准策略,将 landmark RCT(如FIT、HORIZON、FREEDOM、FRAME、ARCH)中的药物特异性骨密度增益与骨折风险比作为硬锚点直接嵌入,而非通过统计学习拟合。数据集共包含144个变量列,覆盖人口统计学、骨密度、骨折风险评估、继发性骨质疏松症筛查、骨转换标志物、九类药物治疗疗效、跌倒风险与神经肌肉评估以及临床结局等八大模块。当前样本为500行、单一种子生成的样本集,完整商业版可扩展至20,000+患者并包含20年纵向轨迹。
特点
数据集最显著的特点在于其卓越的药物级别试验保真度:唑来膦酸、地舒单抗、阿仑膦酸盐和罗莫索珠单抗等药物的椎体相对风险与脊柱骨密度增益均精确复现对应临床试验的发表值。整体数据通过A+级验证(评分10.000/10),在六种规范种子下均能确定性复现。骨质疏松症患病率约62%,显著高于一般人群,体现了疾病富集的专科门诊队列特征。变量覆盖全面且符合FHIR R4标准,适合替代受PHI限制的真实电子健康记录与DXA数据。
使用方法
数据集以CSV格式提供,可通过Pandas的pd.read_csv()函数或HuggingFace Datasets库的load_dataset()方法直接加载使用。其设计初衷服务于骨折风险预测(如FRAX/Garvan模型复现)、治疗疗效与比较有效性建模、不良事件时间分析、跌倒风险与肌少症筛查工具开发以及卫生经济学建模等研究场景。用户需注意该数据集并非真实患者记录,仅限研究与开发用途,不适用于临床决策,且其纵向数据为事件级总结而非完整季度轨迹,部分标志间的相关性可能弱于真实队列。
背景与挑战
背景概述
骨质疏松症与代谢性骨病是影响老年人群生活质量的重大公共卫生问题,其诊断与治疗依赖于骨密度测量、骨折风险评估及药物疗效监测等多维度临床数据。然而,真实世界电子健康记录中此类数据往往因患者隐私保护、样本量不足及时间跨度有限而难以获取。XpertSystems.ai于2026年推出的HC-END-007合成数据集应运而生,由该机构旗下Synthetic Data Factory的内分泌学垂直团队创建,核心研究问题在于通过严格校准的合成队列复现骨质疏松症患者的临床特征与治疗结局。该数据集以500例患者样本为开源起点,包含144个变量,涵盖骨密度(DXA)、WHO分类、FRAX与Garvan骨折风险、骨转换标志物及九类药物治疗效果等模块,并创新性地将药物特异性骨密度增益与骨折风险比锚定于FIT、HORIZON、FREEDOM等里程碑随机对照试验(RCT),从而精确复现文献中的治疗基准。作为疾病富集的专科门诊队列,它对骨质疏松症流行病学建模、治疗方案比较效果研究及机器学习模型训练具有重要价值,尤其填补了真实数据因隐私限制而难以公开共享的空白。
当前挑战
该数据集所解决的领域问题核心在于构建一个兼具临床真实性与统计可靠性的合成队列,以克服真实世界骨质疏松症电子病历数据中普遍存在的隐私壁垒、样本稀疏性和纵向追踪缺失。具体挑战包括:一是疾病流行率偏高问题,因年龄相关骨流失轨迹的设置,该队列中骨质疏松症患病率约达62%,显著高于美国NHANES调查中50-90岁人群的18-35%范围,导致其作为“疾病富集/专科门诊队列”而非人群代表样本的定位偏差;二是药物疗效建模的简化性,尽管骨密度增益与骨折风险比被锚定为RCT的恒定均数,但该设计未能捕捉个体间对药物反应的异质性,仅通过每类药物标准差进行近似模拟;三是纵向数据仅为概述层面,样本提供基线事件标志与生存时间,而非完整的20年季度骨密度变化轨迹;四是部分指标(如跌倒风险组分与合并症标志)的条件独立性假设较强,导致患者内部的相关性弱于真实队列。此外,跨字段相关性可能低于真实数据,限制了其用于临床决策的可靠性,仅适用于研究与开发用途。
常用场景
经典使用场景
该数据集在骨质疏松症与代谢性骨病研究中扮演着至关重要的角色,其经典应用场景聚焦于骨折风险预测模型的构建与验证。凭借精确锚定FRAX、Garvan等国际公认风险评估工具的算法,研究者得以在合成数据上复现并优化传统风险评分体系,探索DXA骨密度参数、骨转换标志物与临床因素(如跌倒风险评估、继发性骨质疏松病因)间的深层关联,从而提升对髋部、椎体等关键部位脆性骨折的预测精度。
衍生相关工作
围绕该数据集已衍生出诸多经典研究工作,典型代表包括基于合成队列构建的时序骨折风险预警模型、整合骨密度变化轨迹与多重合并症的个性化治疗推荐算法,以及利用FHIR R4格式数据开发的可互操作临床决策支持系统。此外,其在联邦学习框架下作为私有数据替代品,联合多家医疗机构的真实小样本进行分布式训练,拓展了隐私保护型医学人工智能的研究边界。
数据集最近研究
最新研究方向
在骨质疏松与代谢性骨病领域,该合成数据集hc-end-007-sample通过精准锚定FIT、HORIZON、FREEDOM、FRAME、ARCH等里程碑式随机对照试验中的药物疗效参数,为比较疗效建模、骨折风险预测及卫生经济学评估提供了高保真度的研究工具。当前前沿研究聚焦于利用其144维特征模块(涵盖骨密度、骨转换标志物、跌倒风险及临床结局),结合时间事件分析框架,深入探索双膦酸盐与地舒单抗等九类药物的序贯治疗策略及个体化骨折风险分层,尤其关注绝经后女性与继发性骨质疏松症患者群体。该数据集的发布恰逢全球老龄化加剧背景下骨折防控需求激增的热点时期,其严格校准的试验级药物反应常数和可复现性设计,有望弥补真实世界电子健康档案因隐私限制而难以获取高质量纵向数据的短板,为机器学习驱动的精准骨健康管理开辟新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务