遇见数据集

Awesome-CGM

收藏
github2026-05-25 更新2026-06-04 收录
官方服务:

资源简介:

这是一个公开可用的连续血糖监测(CGM)数据链接集合,专门收集和整理与CGM相关的多个数据集资源,覆盖了类型1糖尿病等研究领域,提供了数据集的概述、下载链接、预处理脚本和协变量信息。

This is a publicly available curated compilation of resources dedicated to continuous glucose monitoring (CGM). It systematically collects and organizes multiple datasets related to CGM, covers research domains including type 1 diabetes, and provides dataset overviews, download links, preprocessing scripts, and covariate information.

创建时间:
2020-05-29
原始信息汇总

数据集详情:Awesome-CGM

概述

Awesome-CGM 是一个公开可用的连续血糖监测(CGM)数据集的链接集合。CGM 是可穿戴小型设备,能够全天连续测量血糖水平,部分设备每5分钟即可进行一次测量。

该集合最初由 Mary Martin、Elizabeth Chun、David Buchanan、Eric Wang 和 Sangaman Senthil 在 Dr. Irina Gaynanova 指导下作为 Aggie 研究项目的一部分整理而成。2024年10月更新了新版名单,由 Xinran (Charlotte) Xu、Neo Kok 和 Junyan (Samuel) Tan 在 Dr. Irina Gaynanova 指导下汇编。

相关工具:R 包 iglu 可用于 CGM 数据分析。

数据集分类及详情

1型糖尿病数据集

数据集 主要信息
Aleppo (2017) 225名25-40岁1型糖尿病成人参与者,使用Dexcom G4 CGM监测6个月,研究无指尖血糖校准的CGM使用效果
Anderson (2016) 测试闭环人工胰腺系统的研究,包含多阶段试验(CGM实践、传感器增强泵治疗、夜间闭环控制、全天候闭环控制),14名患者额外使用闭环系统5个月
Brown (2019) 168名14岁以上参与者,使用Dexcom G6 CGM和t:Slim X2 Control-IQ技术,研究周期6个月
Buckingham (2007) 针对糖尿病儿童使用CGM的试点研究,先建立一周盲测基线,随后在家使用3个月
Chase (2005) 200名受试者随机分配至CGM组或自我监测血糖对照组,使用GlucoWatch G2 Biographer,最终比较A1c测量值
Dubosson (2018) 9名1型糖尿病门诊患者,收集CGM数据外还包括ECG等多种生理数据
Lynch (2022) 90名6-71岁参与者,使用Dexcom G6 CGM,评估从混合闭环系统向生物胰腺的转变,研究周期13周
Marling (2019) 12名1型糖尿病患者
Tamborlane (2008) 受试者按A1c结果分为7-10%和<7%两组,每组随机分配至CGM或对照组
Tsalikian (2005) 50名10-18岁1型糖尿病儿童,使用OneTouch Ultra Meter,研究运动后夜间低血糖发生频率
Wadwa (2023) 102名2-6岁幼儿,使用t:slim X2胰岛素泵和Dexcom G6 CGM,研究周期13周
Weinstock (2016) 200名60岁以上1型糖尿病老年人,100例病例+100例对照,使用Dexcom SEVEN PLUS监测2周

2型糖尿病数据集

数据集 主要信息
Broll (2021) 5名2型糖尿病患者使用Dexcom G4 CGM,提供示例数据用于开发iglu包

其他数据集

数据集 主要信息
Colas (2019) 208名受试者,研究开始时均健康,17人研究结束时发展为2型糖尿病
Hall (2018) 57名无糖尿病诊断者,其中5名筛查时确诊2型糖尿病、14名糖尿病前期,分析健康个体血糖波动
Åm (2018) 动物模型(猪)研究,通过静脉输注葡萄糖模拟进食,研究传感器放置对CGM数据的影响
Shah (2019) 153名6岁以上参与者,使用Dexcom G6 CGM,评估健康非糖尿病个体的参考传感器血糖范围

模拟器

模拟器 主要信息
Xie (2018) UVa/Padova Simulator的Python实现,支持强化学习,兼容OpenAI gym和rllab API
Lehmann (2011) AIDA模拟器,用于模拟典型1型糖尿病患者胰岛素和饮食变化对血糖曲线的影响

验证数据集与附加处理

对以下8个数据集进行了标准化处理,整合了患者级别统计信息(性别、胰岛素给药方式、糖尿病类型、使用设备):

处理后数据集及样本构成:

  • Colas2019:健康191人,2型糖尿病17人
  • Broll2021:2型糖尿病5人
  • Brown2019:1型糖尿病168人
  • Hall2018:健康38人,糖尿病前期14人,2型糖尿病5人
  • Shah2019:健康168人
  • Buckingham2007:1型糖尿病47人
  • Lynch2022:1型糖尿病440人
  • Wadwa2023:1型糖尿病102人

整合后总体人群统计:

  • 1型糖尿病:820人
  • 2型糖尿病:27人
  • 糖尿病前期:14人
  • 健康:398人
  • 平均研究周期:18周
  • 平均年龄:32岁
  • 约74%的队列在研究期间使用胰岛素泵而非注射

数据质量检查

提供最小排除标准,包含缺失数据处理脚本 R脚本 和可视化质量检查脚本 R脚本。代码复现演示可参考 Processing Demo

数据处理Shiny应用

提供 ShinyGUI 应用,帮助用户导航、下载和处理原始CGM数据集。可在线访问 Awesome-CGM Validation Dataset GUI,也支持本地部署处理大文件(如Brown、Lynch数据集)。

应用使用步骤:

  1. 在浏览器打开 Shiny 应用链接
  2. 从下拉菜单选择一个或多个数据集,上传原始数据文件
  3. 点击 Process Dataset 开始处理,可选择应用缺失数据过滤
  4. 处理完成后点击 Download Processed Data 下载所有处理后的数据集(压缩为.zip文件)
搜集汇总
数据集介绍
Awesome-CGM 数据集图片
构建方式
在糖尿病精准管理领域,持续葡萄糖监测(CGM)技术已成为洞察血糖动态的核心工具。Awesome-CGM数据集由Irina Gaynanova博士团队主导,历经两阶段系统构建而成。第一阶段由Mary Martin等研究者从公开文献中搜集原始CGM研究数据,涵盖1型糖尿病、2型糖尿病、健康人群及动物模型等多元场景。第二阶段由Xinran Xu等研究者于2024年完成更新,不仅新增了Lynch、Wadwa等最新研究数据,更对每个原始数据集编写了标准化R处理脚本,将患者统计信息(如性别、胰岛素输注方式、糖尿病类型)与CGM时间序列整合,形成统一格式的验证数据集。所有数据均通过伪有序ID进行唯一标识,确保跨研究的可追溯性。
特点
该数据集的核心特色在于其多维度的整合性与可复用性。它汇集了来自15项独立研究的CGM记录,覆盖1型糖尿病(n=820)、2型糖尿病(n=27)、糖尿病前期(n=14)及健康对照(n=398)人群,总样本量超过1200例,平均监测周期达18周,年龄跨度从2岁至71岁。数据集不仅包含原始血糖读数,还附带了详细的协变量信息(如设备型号、研究阶段)以及数据质量检查脚本(如缺失率过滤标准),用户可依据90%(1天记录)或70%(更长周期)的完整度阈值进行灵活筛选。此外,部分数据集(如Colas2019、Hall2018)提供了纵向随访数据,支持对血糖控制动态变化的长期分析。
使用方法
用户可通过两种途径高效利用该数据集。其一为直接访问GitHub仓库的Wiki页面,按研究名称下载已处理的CSV文件及对应的处理脚本;其二为使用团队开发的R Shiny交互式应用(Awesome-CGM Validation Dataset GUI),该界面支持用户从原始数据源上传文件,自动调用标准化脚本进行清洗与整合,并可选配缺失数据过滤模块。对于超过500MB的大规模数据集(如Brown2019),建议在本地克隆仓库后,通过RStudio运行ShinyGUI.Rproj中的GUI文件夹,以确保处理性能。所有处理后的数据均可一键导出为压缩包,便于后续使用iglu R包进行血糖指标计算与可视化分析。
背景与挑战
背景概述
连续血糖监测(CGM)技术作为糖尿病管理领域的革命性工具,通过可穿戴设备以分钟级频率实时追踪血糖波动,为精准医疗和临床研究提供了前所未有的数据维度。Awesome-CGM数据集于2024年10月由Xinran Xu、Neo Kok、Junyan Tan等人在Irina Gaynanova博士指导下更新发布,隶属于德克萨斯农工大学研究团队。该资源系统整合了来自全球多项公开CGM研究的原始数据,涵盖1型糖尿病、2型糖尿病、健康人群及动物模型等多种类型,共计包含近1300名受试者的连续血糖记录。其核心研究问题聚焦于标准化CGM数据的可复现分析与跨研究比较,所配套的R包iglu和ShinyGUI交互工具显著降低了数据分析门槛,已成为推动血糖动态规律探索、人工胰腺算法验证及糖尿病管理策略优化的关键公共基准数据集。
当前挑战
Awesome-CGM数据集面临的核心挑战在于多源异构数据的整合与质量控制。各原始研究在设备型号(如Dexcom G4/G6)、采样频率、研究时长及受试者基线特征上存在显著差异,导致跨数据集比较时需处理时间序列对齐、缺失值插补及批次效应等复杂问题。构建过程中,团队需从分散的临床文献与数据库中提取原始文件,手动编写处理脚本以统一格式,并面临部分大型数据集(如Brown2019与Lynch2022)超过500MB的存储与计算瓶颈——Shiny应用因服务器限制无法直接处理此类数据,需依赖本地部署。此外,不同研究对知情同意与数据共享协议的规定不一,增加了合规性审查的难度,而动物模型数据向人体研究转化的普适性亦需谨慎论证。
常用场景
经典使用场景
在糖尿病精准管理领域,持续葡萄糖监测(CGM)技术已从辅助工具演变为核心数据采集手段。Awesome-CGM数据集整合了来自多项临床研究的CGM时间序列数据,覆盖1型与2型糖尿病、糖尿病前期及健康人群,总样本量逾千人。其经典应用场景包括构建血糖波动预测模型、评估闭环人工胰腺系统性能,以及开发基于机器学习的低血糖预警算法。例如,Aleppo(2017)与Brown(2019)等子数据集常被用于训练深度学习模型,以捕捉日内血糖变化的动态模式,从而提升胰岛素剂量调整的精准度。
衍生相关工作
该数据集催生了一系列具有影响力的衍生工作。在方法论层面,iglu R包作为其官方分析工具,提供了超过40种葡萄糖度量指标的计算函数,被引用逾百次。在算法创新方面,基于该数据的研究团队开发了针对CGM缺失数据的插补方法,以及用于检测血糖异常事件的非参数统计框架。此外,Lynch(2022)与Wadwa(2023)子集被用于验证Control-IQ混合闭环系统的长期有效性,其成果直接影响了美国FDA对新一代人工胰腺的审批决策。这些工作共同构成了从数据采集到临床转化的完整研究链条。
数据集最近研究
最新研究方向
连续血糖监测数据集的研究正聚焦于利用大规模、多维度、标准化的CGM数据推动血糖动态分析与人工智能算法在糖尿病管理中的深度应用。随着Awesome-CGM数据集在2024年更新至2.0版本,整合了来自1型与2型糖尿病、糖尿病前期及健康人群的超过1200名受试者的高频率血糖记录,该资源为构建鲁棒的血糖预测模型与闭环人工胰腺系统提供了坚实的数据基石。前沿方向包括基于强化学习的胰岛素剂量优化、跨人群血糖变异性特征的挖掘,以及可穿戴设备与生理信号(如心电图)的融合分析,旨在实现个体化、精准化的糖尿病干预策略。这一综合数据集的出现,不仅促进了开源软件工具(如R包iglu)的验证与标准化,更在全球范围内加速了数字健康在代谢性疾病管理中的循证转化,对改善患者生活质量与公共卫生决策具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务