harvardairobotics/FairGenMed
收藏资源简介:
--- license: cc-by-nc-nd-4.0 task_categories: - image-classification - text-to-image modality: - image language: - en tags: - medical - ophthalmology - fairness - generative - diffusion - fundus - glaucoma - OCT pretty_name: FairGenMed size_categories: - 10K<n<100K --- # Dataset Card: FairGenMed ## Dataset Summary FairGenMed is the first dataset for studying **fairness in medical generative models**. It provides detailed quantitative clinical measurements alongside demographic annotations to investigate the semantic correlation between text prompts and anatomical regions across demographic subgroups. The dataset supports both generative model evaluation and downstream classification tasks for glaucoma detection. This dataset accompanies the **FairDiffusion** framework — an equity-aware latent diffusion model that enhances fairness in medical image generation via Fair Bayesian Perturbation — published in *Science Advances* (2025). ## Dataset Details ### Dataset Description | Field | Value | |------------------|-------| | **Institution** | Department of Ophthalmology, Harvard Medical School | | **Task** | Glaucoma detection; fairness evaluation of generative models | | **Modality** | Scanning Laser Ophthalmoscopy (SLO) fundus images, OCT B-scans | | **Scale** | 10,000 subjects | | **Image size** | 512 × 664 (SLO fundus) | | **License** | [CC BY-NC-ND 4.0](https://creativecommons.org/licenses/by-nc-nd/4.0/) | - **Curated by:** Yan Luo, Muhammad Osama Khan, Congcong Wen, Muhammad Muneeb Afzal, Titus Fidelis Wuermeling, Min Shi, Yu Tian, Yi Fang, Mengyu Wang - **License:** [CC BY-NC-ND 4.0](https://creativecommons.org/licenses/by-nc-nd/4.0/) — non-commercial research only - **Paper:** [Science Advances, Vol. 11, No. 14 (2025)](https://doi.org/10.1126/sciadv.ads4593) - **Contact:** harvardophai@gmail.com, harvardairobotics@gmail.com ### Data Fields Each subject includes one SLO fundus image and one `.npz` file. The NPZ files contain: | Field | Description | |-----------------|-------------| | `glaucoma` | Disease label: `0` = non-glaucoma, `1` = glaucoma | | `oct_bscans` | OCT B-scan images | | `race` | `0` = Asian, `1` = Black, `2` = White | | `male` | `0` = Female, `1` = Male | | `hispanic` | `0` = Non-Hispanic, `1` = Hispanic | | `maritalstatus` | `0` = Married/Partnered, `1` = Single, `2` = Divorced, `3` = Widowed, `4` = Legally Separated, `-1` = Unknown | | `language` | `0` = English, `1` = Spanish, `2` = Other | ### Clinical Metadata All clinical measurements for the 10,000 samples are provided in `data_summary.csv`: | Column | Description | |---------------|-------------| | `cdr_status` | Cup-disc ratio status | | `md_severity` | Severity of vision loss | | `se_status` | Spherical equivalent status | ### Demographics 6 demographic attributes are annotated per subject: age, gender, race, ethnicity, preferred language, and marital status. ## Uses ### Direct Use - Fairness evaluation of medical generative models (text-to-image diffusion) - Glaucoma detection with demographic fairness analysis - Studying semantic correlations between text prompts and anatomy across subgroups ### Out-of-Scope Use Clinical decisions, patient care, or any commercial application. This dataset shall not be used for clinical decisions at any time. ## Associated Method: FairDiffusion FairDiffusion is an equity-aware latent diffusion model built on Stable Diffusion 2.1, trained with **Fair Bayesian Perturbation** to reduce demographic bias in generated medical images. It is evaluated on FairGenMed (ophthalmology), HAM10000 (dermatology), and CheXpert (chest radiology). ## Citation **BibTeX:** ```bibtex @article{FairDiffusion_Science_Advances_2025, author = {Yan Luo and Muhammad Osama Khan and Congcong Wen and Muhammad Muneeb Afzal and Titus Fidelis Wuermeling and Min Shi and Yu Tian and Yi Fang and Mengyu Wang}, title = {FairDiffusion: Enhancing equity in latent diffusion models via fair Bayesian perturbation}, journal = {Science Advances}, volume = {11}, number = {14}, pages = {eads4593}, year = {2025}, doi = {10.1126/sciadv.ads4593} } ``` **APA:** Luo, Y., Khan, M. O., Wen, C., Afzal, M. M., Wuermeling, T. F., Shi, M., Tian, Y., Fang, Y., & Wang, M. (2025). FairDiffusion: Enhancing equity in latent diffusion models via fair Bayesian perturbation. *Science Advances, 11*(14), eads4593. https://doi.org/10.1126/sciadv.ads4593
--- 许可证: CC BY-NC-ND 4.0(知识共享署名-非商业性使用-禁止演绎4.0国际许可协议) 任务类别: - 图像分类(image-classification) - 文本到图像生成(text-to-image) 模态: - 图像(image) 语言: - 英语(en) 标签: - 医疗(medical) - 眼科(ophthalmology) - 公平性(fairness) - 生成式(generative) - 扩散模型(diffusion) - 眼底(fundus) - 青光眼(glaucoma) - 光学相干断层扫描(OCT, Optical Coherence Tomography) 数据集名称: FairGenMed 样本规模类别: - 10000 < 样本数 < 100000 --- # 数据集卡片:FairGenMed ## 数据集概述 FairGenMed是首个用于研究**医疗生成式模型公平性**的数据集,其包含详细的定量临床测量数据与人口统计学标注,旨在探究不同人口亚组中,文本提示与解剖区域之间的语义关联。本数据集可同时支持生成式模型评估与青光眼检测的下游分类任务。 本数据集配套**FairDiffusion**框架——一种基于公平贝叶斯扰动(Fair Bayesian Perturbation)提升医学图像生成公平性的感知公平性潜在扩散模型,该框架发表于《Science Advances》(2025)。 ## 数据集详情 ### 数据集基本信息 | 字段 | 数值 | |--------------------|----------------------------------------------------------------------| | **依托机构** | 哈佛医学院眼科系(Department of Ophthalmology, Harvard Medical School) | | **任务方向** | 青光眼检测;生成式模型公平性评估 | | **数据模态** | 扫描激光眼底镜(SLO, Scanning Laser Ophthalmoscopy)眼底图像、光学相干断层扫描(OCT)B扫描图像 | | **样本规模** | 10000名受试者 | | **图像分辨率** | SLO眼底图像:512 × 664像素 | | **许可证** | [CC BY-NC-ND 4.0](https://creativecommons.org/licenses/by-nc-nd/4.0/) | - **整理团队**: Yan Luo、Muhammad Osama Khan、Congcong Wen、Muhammad Muneeb Afzal、Titus Fidelis Wuermeling、Min Shi、Yu Tian、Yi Fang、Mengyu Wang - **使用许可**: [CC BY-NC-ND 4.0](https://creativecommons.org/licenses/by-nc-nd/4.0/) — 仅可用于非商业性研究 - **关联论文**: [《Science Advances》, 第11卷第14期(2025)](https://doi.org/10.1126/sciadv.ads4593) - **联系方式**: harvardophai@gmail.com, harvardairobotics@gmail.com ### 数据字段说明 每名受试者对应1张SLO眼底图像与1个`.npz`格式数据文件。NPZ文件包含以下字段: | 字段名 | 说明 | |----------------|----------------------------------------------------------------------| | `glaucoma` | 疾病标签:`0` = 非青光眼,`1` = 青光眼 | | `oct_bscans` | OCT B扫描图像 | | `race` | 种族:`0` = 亚裔,`1` = 非裔,`2` = 白人 | | `male` | 性别:`0` = 女性,`1` = 男性 | | `hispanic` | 族裔:`0` = 非西班牙裔,`1` = 西班牙裔 | | `maritalstatus`| 婚姻状况:`0` = 已婚/有伴侣,`1` = 未婚,`2` = 离异,`3` = 丧偶,`4` = 合法分居,`-1` = 未知 | | `language` | 偏好语言:`0` = 英语,`1` = 西班牙语,`2` = 其他 | ### 临床元数据 10000个样本的全部临床测量数据均存储于`data_summary.csv`文件中: | 列名 | 说明 | |----------------|----------------------------------------------------------------------| | `cdr_status` | 杯盘比(cup-disc ratio)状态 | | `md_severity` | 视力丧失严重程度 | | `se_status` | 球镜度数(spherical equivalent)状态 | ### 人口统计学标注 每名受试者标注了6项人口统计学属性:年龄、性别、种族、族裔、偏好语言与婚姻状况。 ## 适用场景 ### 可直接使用场景 - 医疗生成式模型(文本到图像扩散模型)的公平性评估 - 结合人口统计学公平性分析的青光眼检测任务 - 探究不同人口亚组中,文本提示与解剖结构的语义关联 ### 禁止使用场景 - 临床决策、患者护理或任何商业应用。本数据集不得在任何场景下用于临床决策。 ## 关联方法:FairDiffusion FairDiffusion是基于Stable Diffusion 2.1构建的感知公平性潜在扩散模型,通过**公平贝叶斯扰动(Fair Bayesian Perturbation)**进行训练,以降低生成医学图像中的人口统计学偏差。该模型在FairGenMed(眼科数据集)、HAM10000(皮肤病学数据集)与CheXpert(胸部X线摄影数据集)上完成了性能评估。 ## 引用格式 ### BibTeX格式 bibtex @article{FairDiffusion_Science_Advances_2025, author = {Yan Luo and Muhammad Osama Khan and Congcong Wen and Muhammad Muneeb Afzal and Titus Fidelis Wuermeling and Min Shi and Yu Tian and Yi Fang and Mengyu Wang}, title = {FairDiffusion: Enhancing equity in latent diffusion models via fair Bayesian perturbation}, journal = {Science Advances}, volume = {11}, number = {14}, pages = {eads4593}, year = {2025}, doi = {10.1126/sciadv.ads4593} } ### APA格式 Luo, Y., Khan, M. O., Wen, C., Afzal, M. M., Wuermeling, T. F., Shi, M., Tian, Y., Fang, Y., & Wang, M. (2025). FairDiffusion: Enhancing equity in latent diffusion models via fair Bayesian perturbation. *Science Advances*, 11(14), eads4593. https://doi.org/10.1126/sciadv.ads4593



