遇见数据集

SYNRARE

收藏
arXiv2026-07-10 更新2026-07-14 收录
官方服务:

资源简介:

SYNRARE是由南丹麦大学开发的一个基于Synthea框架的图形用户界面,专门用于生成罕见疾病患者的合成电子健康记录数据集。该数据集通过可定义的参数调整,模拟与常见疾病具有可控差异度的罕见疾病变体,支持生成任意数量的患者记录,数据来源完全基于规则驱动的合成生成,无需依赖真实医疗数据。其创建过程涉及对现有疾病模块的全局修改,包括方差调整、范围偏移和概率变化,以生成具有不同相似性程度的疾病变体。该数据集主要应用于机器学习算法的基准测试和开发,旨在解决罕见疾病诊断中因数据稀缺和隐私限制导致的算法评估难题,为研究人员提供一个可控的技术测试环境。

SYNRARE is a graphical user interface developed by the University of Southern Denmark built on the Synthea framework, specifically designed to generate synthetic electronic health record (EHR) datasets for patients with rare diseases. This dataset enables simulation of rare disease variants with controllable degrees of difference from common diseases via configurable parameter adjustments, supports generating arbitrary volumes of patient records, and is fully rule-driven for synthetic data generation without relying on real medical data. Its development process entails global modifications to existing disease modules, including variance adjustment, range shifting, and probability alteration, to produce disease variants with varying levels of similarity to common clinical conditions. This dataset is primarily utilized for benchmarking and developing machine learning algorithms, with the goal of resolving the algorithm evaluation challenges encountered in rare disease diagnosis due to data scarcity and privacy constraints, thereby providing researchers with a controllable technical testing environment.

提供机构:
南丹麦大学
创建时间:
2026-07-10
原始信息汇总
  • 数据集名称:SYNRARE(Synthea Rare Disease GUI)
  • 描述:用于处理Synthea模块的图形用户界面(GUI),支持查看、编辑、修改和运行合成患者数据模拟,特别针对罕见病数据生成设计。
  • 主要功能
    • 模块管理:浏览、导入、删除、升级Synthea模块,支持单模块、多模块或全部模块模拟。
    • 可视化编辑:通过表单编辑模块状态属性。
    • 批量操作:可同时选择多个模块进行模拟。
    • 修改工具:支持BMI类别调整和随机化等模块修改。
    • 数据生成:使用选定模块和参数运行Synthea模拟。
    • 模块构建器集成:导出模块供官方Synthea模块构建器使用。
  • 系统要求
    • Python 3.8+
    • Java JDK 11或更新版本(推荐LTS版本11或17)
  • 使用方法
    • 安装依赖:pip install -r requirements.txt
    • 构建并运行测试:./gradlew build check test
    • 启动GUI:python .Synthetic_RD_GUI.py
  • 作者
    • Nicolai Dinh Khang Truong(nitru@imada.sdu.dk)
    • Richard Röttger(roettger@imada.sdu.dk)
  • 致谢:感谢前硕士生Andreas Rosenstjerne实现和测试SYNRARE。
  • 所属机构:南丹麦大学(University of Southern Denmark)| https://www.sdu.dk
  • 项目信息:项目ID 12988,托管于GitLab(https://gitlab.sdu.dk/screen4care/synrare),创建于2026年4月9日,主分支为main,包含4次提交、1个分支。
搜集汇总
数据集介绍
SYNRARE 数据集图片
构建方式
SYNRARE基于开源规则驱动的Synthea框架构建,通过图形用户界面(GUI)实现对常见疾病模块的便捷修改,以生成模拟罕见疾病患者的合成电子健康记录(EHR)。用户可在单一模块、多模块或全模块模式下选择基础疾病模块,并通过调整每个状态(如症状发作、诊断事件)的概率分布参数(均匀、高斯或指数分布)的方差、范围偏移和修改概率,全局性地改变疾病轨迹。此外,系统支持基于BMI的共病建模,自动更新与肥胖相关的心血管、血压等生理指标的调整因子,从而模拟不同BMI类别下的临床异质性。最终,修改后的模块生成一个与原始常见疾病具有可定义差异度的罕见病亚组数据,用于机器学习算法的技术性能评估。
特点
SYNRARE的核心特点在于其能够生成与常见疾病仅在可定义程度上存在差异的罕见病模拟患者数据,为算法基准测试提供精细控制的能力。该工具无需编程,通过直观的GUI即可操作,极大降低了合成数据生成的技术门槛。其随机修改机制允许用户统一调整所有临床事件状态的分布特征,从而系统性地改变疾病变体的相似度。同时,BMI驱动的共病建模基于流行病学证据,能模拟真实世界中肥胖对疾病严重度的复杂影响,增强数据的临床合理性。此外,SYNRARE支持遗留模块迁移,能自动升级旧版模块以兼容最新修改功能,确保可用性与扩展性。
使用方法
使用者首先需在Python 3.8+与Java JDK 11环境下安装SYNRARE,并加载Synthea内置或自定义的疾病模块。随后,在GUI中选择模块后,可于单一模块模式下查看并修改各个状态的概率分布参数,应用方差、范围偏移及修改概率的随机调整,同时可设定BMI类别以引入共病效应。应用修改后,系统将生成修改后的新模块,并可导出相应的合成患者数据集。这些数据可直接用于二分类、多分类、异常检测或聚类等机器学习任务的训练与评估。研究者通过调整修改参数,能够创建不同难度的基准测试场景,在无真实患者数据的情况下快速评估算法在罕见病识别上的性能极限。
背景与挑战
背景概述
罕见病在全球范围内影响着大量患者,其诊断常因症状与常见疾病的相似性而面临漫长的诊断之旅。在这一背景下,南丹麦大学数学与计算机科学系的Nicolai Dinh Khang Truong与Richard Röttger于近期提出了SYNRARE数据集,旨在通过合成电子健康记录(EHR)数据为机器学习算法的基准测试提供支持。该数据集基于Synthea框架构建,通过图形用户界面允许研究人员快速生成仅与常见疾病患者存在可控差异的罕见病患者合成数据。SYNRARE的核心研究问题聚焦于如何在不涉及真实患者隐私的前提下,构建具有可定义差异性的合成数据集,以评估和优化机器学习模型在罕见病识别任务中的技术性能。该工作为机器学习技术在罕见病诊断中的早期应用开辟了新的可能性,尤其适用于监督学习、异常检测和聚类等算法评估场景,对推动该领域的方法学进步具有重要影响。
当前挑战
SYNRARE所应对的领域挑战主要源于罕见病数据的高度不平衡性,这导致机器学习模型在真实应用中易产生过多假阳性结果,而其诊断的准确性又对患者治疗方案至关重要。此外,隐私与伦理法规限制了对真实EHR数据的广泛访问,进一步阻碍了针对性的算法开发与评估。在数据集构建过程中,挑战同样不容忽视:合成数据生成器通常缺乏对患者子集进行可控差异化建模的支持,而手动修改Synthea模块需要深入理解框架机制与疾病领域知识,操作复杂且易出错。SYNRARE通过提供全局修改机制与BMI驱动的共病建模功能,试图解决这些技术瓶颈,但合成数据与真实世界EHR之间在缺失值、混杂信息及疾病进展复杂性上的差异仍需审慎对待,以确保评估结果的有效迁移性。
常用场景
经典使用场景
SYNRARE数据集最经典的使用场景在于为罕见病电子健康记录的机器学习模型提供可控的合成数据基准测试平台。研究人员可借助其图形化界面,基于Synthea框架快速生成与常见疾病仅存在可定义差异的罕见病患者记录,从而在完全保护患者隐私的前提下,系统评估不同算法在高度不平衡数据集上的分类、异常检测及聚类等任务的性能边界。
实际应用
在实际应用中,SYNRARE为临床机构与制药企业加速罕见病诊断流程提供了关键工具。医院可基于该系统模拟不同罕见病变异,训练并优化早期预警模型,从而缩短患者确诊周期;药物研发企业则能借此筛选出高潜力生物标志物,提升临床试验设计效率,最终惠及全球数以百万计的罕见病患者群体。
衍生相关工作
围绕SYNRARE衍生了许多经典工作,包括基于其生成数据开发的定制化异常检测框架、针对罕见病表型聚类的集成学习方法,以及用于评估模型泛化能力的多难度基准测试集。此外,该平台还催生了关于合成数据与真实电子健康记录可迁移性比较的研究,以及将领域知识融入数据生成模块以增强临床真实性的方法论探索,拓展了合成健康数据的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务