遇见数据集

awesome-food-allergy-datasets

收藏
github2026-05-05 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心策划的食物过敏相关数据集、数据库和计算资源集合,旨在支持食物过敏研究、过敏原识别、药物开发和临床应用。该合集涵盖六个主要类别:药物与免疫疗法开发、患者管理与临床决策支持、食品产品开发与安全、计算方法开发、过敏原识别与预测以及交叉反应性分析。共收录72个数据集,其中87%为开源资源,其余为受限访问数据集。

This is a curated collection of food allergy-related datasets, databases and computational resources, designed to support food allergy research, allergen identification, drug development and clinical applications. It encompasses six core categories: drug and immunotherapy development, patient management and clinical decision support, food product development and safety, computational method development, allergen identification and prediction, and cross-reactivity analysis. A total of 72 datasets are included in this collection, with 87% of them being open-source resources and the remaining being restricted-access datasets.

创建时间:
2025-09-25
原始信息汇总

Awesome Food Allergy Datasets 数据集详情

数据集概述

该仓库是一个精心整理的数据集、数据库和计算资源集合,专注于食物过敏研究、过敏原识别、药物开发和临床应用。食物过敏影响全球超过 2.2亿人,该仓库旨在为研究人员、机器学习从业者和科学界提供首个全面的、AI-ready 数据集开源集合,推动过敏研究中的AI应用。

数据统计

指标 数量
总数据集数 72
开源数据集 63 (87%)
受限数据集 9
类别数 6

类别分布

  • 💊 药物与免疫疗法开发:34 个数据集
  • 🏥 患者管理与临床决策支持:9 个数据集
  • 🍽️ 食品产品开发与安全:9 个数据集
  • 🔬 计算方法开发:7 个数据集
  • 🔍 过敏原识别与预测:7 个数据集
  • 🔄 交叉反应分析:6 个数据集

数据集详情(部分示例)

💊 药物与免疫疗法开发

数据集名称 任务 数据类型 可用性 来源
SDAP 2.0 药物设计、结构分析、表位映射、交叉反应建模 分子 🟢 开源 https://fermi.utmb.edu/
QSAR Database 性质预测、药物设计 分子 🟢 开源 https://qsardb.org/
e-Drug3D Database 药物设计、靶标相互作用 分子 🟢 开源 https://zenodo.org/records/17063565
Stanford Drug Data (Effects & Interactions) 药物设计 临床 🟢 开源 https://purl.stanford.edu/zq918jm7358/version/1
DrugCentral 药物设计、靶标相互作用 化学 🟢 开源 https://drugcentral.org/download
MedKG 药物设计、靶标相互作用、治疗规划 化学 🟢 开源 https://github.com/chemplusx/MedKG
PDBBind+ 靶标相互作用、药物设计 分子 🟢 开源 https://www.pdbbind-plus.org.cn/download
Human Metabolome Database (HMDB) 药物设计、靶标相互作用 混合 🟢 开源 https://www.hmdb.ca/downloads
Therapeutic Target Database (TTD) 药物设计、治疗规划、靶标相互作用 分子 🟢 开源 https://db.idrblab.net/ttd/full-data-download
QCML Dataset 药物设计、靶标相互作用 混合 🟢 开源 https://zenodo.org/records/14859804
M3-20M: Multi-Modal Molecular Dataset 靶标相互作用、性质预测、药物设计 化学 🟢 开源 https://huggingface.co/datasets/Alex99Gsy/M-3_Multi-Modal-Molecule
SAIR Dataset 靶标相互作用、结构分析、性质预测、药物设计 分子 🟡 受限 https://huggingface.co/datasets/SandboxAQ/SAIR
TDC 药物设计、靶标相互作用 混合 🟢 开源 https://tdcommons.ai/
RxRx3 药物设计、靶标相互作用 混合 🟢 开源 https://www.recursion.com/news/accelerating-ai-drug-discovery-with-open-source-datasets
Dorothea 药物设计、靶标相互作用 组学 🟢 开源 https://archive.ics.uci.edu/ml/datasets/dorothea
Simulated Allergen Immunotherapy Trials Dataset 药物设计、靶标相互作用 混合 🟢 开源 https://figshare.com/articles/dataset/Simulated_datasets_for_enhanced_three-stage_design_for_allergen_immunotherapy_trials/23638965
IUPHAR Pharmacology Datasets 药物设计、靶标相互作用 化学 🟢 开源 https://www.guidetopharmacology.org/download.jsp
Enamine REAL Database 药物设计、靶标相互作用 混合 🟢 开源 https://gist.github.com/matteoferla/b1eee8656079d006835f2d8dc159fbb5
QCDGE Dataset 药物设计、靶标相互作用 化学 🟢 开源 https://springernature.figshare.com/collections/QCDGE_database_Quantum_Chemistry_Database_with_Ground-_and_Excited-State_Properties/7259125/1
Probes & Drugs Datasets 靶标相互作用 化学 🟢 开源 https://www.probes-drugs.org/download
AllerBase 交叉反应建模、过敏原性评估、药物设计 混合 🟢 开源 http://algpred.tu-bs.de/allerbase/
Simulated AIT Trials Dataset 治疗规划、药物设计 混合 🟢 开源 https://figshare.com/articles/dataset/Simulated_datasets_for_enhanced_three-stage_design_for_allergen_immunotherapy_trials/23638965
Food Anaphylaxis ML Dataset (TIP) 药物设计、治疗规划 临床 🟡 受限 联系作者
Food Allergy Risk Stratification Dataset 治疗规划 食物 🟡 受限 联系作者
Enamine REAL Database 药物设计、靶标相互作用 化学 🟢 开源 https://gist.github.com/matteoferla/b1eee8656079d006835f2d8dc159fbb5
AllerCatPro 2.0 过敏原性评估、药物设计 分子 🟢 开源 https://allercatpro.bii.a-star.edu.sg/
AllerTOP v1.1 结构分析、药物设计、过敏原性评估、过敏原识别 分子 🟢 开源 https://ddg-pharmfac.net/allertop/cite/
FARE Food Allergy Research 风险分层、严重程度评估、症状分析、治疗规划 临床 🟡 受限 https://research.foodallergy.org/
Allergy dataset 风险分层、成分分析、治疗规划、产品开发、遗传分析 食物 🟢 开源 https://zenodo.org/records/44529
Allergome 过敏原性评估、药物设计、过敏原识别 混合 🟢 开源 https://www.allergome.org/
GWAS Database 成分分析、产品开发 食物 🟢 开源 https://www.ebi.ac.uk/gwas/
COMPARE 过敏原识别、交叉反应建模、过敏原性评估、表位映射、风险分层、成分分析、靶标相互作用、严重程度评估 分子 🟢 开源 https://comparefasta.comparedatabase.org/
Open Food Facts 成分分析、标签合规、性质预测、治疗规划、产品开发、替代成分 化学 🟢 开源 https://world.openfoodfacts.org/data
IEDB (Immune Epitope Database) 表位映射、靶标相互作用、药物设计、产品开发 混合 🟢 开源 https://www.iedb.org/

🏥 患者管理与临床决策支持

数据集名称 任务 数据类型 可用性 来源
Food Allergy & Intolerance Dataset 严重程度评估、风险分层 食物 🟢 开源 https://datahub.io/@RuthvikUppala30/US-food-allergy-dataset
DIABIMMUNE 微生物组分析、遗传分析 临床 🟢 开源 https://diabimmune.broadinstitute.org/diabimmune/three-country-cohort
CFSAN Advers - - - -
搜集汇总
数据集介绍
awesome-food-allergy-datasets 数据集图片
构建方式
在食物过敏影响全球超过2.2亿人口的严峻背景下,该数据集应运而生,旨在成为首个面向人工智能研究的食物过敏数据集综合开源集合。其构建方式严谨而系统,通过从临床试验、免疫疗法、基因组学、蛋白质组学、微生物组学及分子生物学等多个维度进行广泛检索与筛选,最终精心收录了72个高质量数据集。这些数据来源涵盖公开数据库、已发表文献及经授权的临床资源,其中87%为开源数据,确保了资源的可获取性与可复现性。所有数据集依据其应用场景被划分为六大核心类别,包括药物与免疫疗法开发、患者管理与临床决策支持等,形成了一个层次分明、覆盖全面的知识体系。
特点
该数据集最显著的特点在于其高度的专业性与综合性。它并非简单的数据罗列,而是围绕食物过敏研究的全链条进行组织,从基础科学中的过敏原识别与预测,到转化研究中的药物设计与免疫疗法开发,再到临床实践中的患者风险分层与管理,均有对应资源。每个数据集均被明确标注了具体任务类型(如结构分析、表位作图)、数据类型(如分子、临床、组学)以及获取方式,极大提升了使用的便利性。此外,其中包含的模拟临床试验数据、多模态分子数据集等前沿资源,为开发预测模型和探索新疗法提供了独特的机器学习就绪数据支持。
使用方法
使用该数据集时,研究者可直接通过其GitHub仓库的目录索引,根据自身研究主题(如过敏原性预测或药物发现)快速定位至对应类别。每个数据条目均提供了直接的数据源链接、相关学术论文引用以及联系方式,便于获取原始数据与深入理解。对于机器学习从业者,可直接下载如M3-20M多模态分子数据集或模拟免疫治疗试验数据等资源,用于模型训练与验证。同时,该集合中的开源工具(如AllerCatPro 2.0)与数据库(如IEDB)可直接用于在线分析,降低了研究门槛,加速了从数据到洞见的转化过程。
背景与挑战
背景概述
食物过敏已成为全球性公共卫生问题,影响超过2.2亿人口,其发病机制涉及免疫系统对特定食物蛋白的异常应答。在此背景下,awesome-food-allergy-datasets数据集应运而生,由国际研究团队于近年创建并维护,旨在整合食物过敏研究领域的人工智能就绪型数据资源。该数据集系统收录了72个高质量数据集,涵盖药物与免疫治疗开发、患者管理与临床决策支持、食品产品开发与安全、计算方法开发、过敏原识别与预测以及交叉反应分析六大类别,其中87%为开源数据。其核心研究问题在于通过汇聚临床、基因组、蛋白质组、微生物组等多维度数据,推动早期检测、风险分层、药物设计及低过敏原食品开发等方向的AI应用,已对食物过敏领域的计算研究产生重要影响。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性:食物过敏的异质性极高,涉及遗传、环境、免疫等多因素交互作用,现有数据难以全面捕捉疾病表型的多样性;同时,过敏原识别与交叉反应预测需要整合分子结构、免疫表位及临床反应等多源异构信息,对模型泛化能力要求严苛。在构建过程中,数据标准化与质量管控构成重大挑战,不同来源的临床数据在采集方式、标注规范及隐私保护上存在显著差异,导致数据整合困难;此外,部分敏感临床数据集(如患者EMR记录)因伦理与合规限制而处于受限访问状态,限制了数据集的完整性与可复用性,进一步制约了AI模型在食物过敏领域的可靠应用。
常用场景
经典使用场景
该数据集的核心应用场景在于为食物过敏研究提供系统化的数据基础设施,涵盖从基础分子机制到临床转化研究的全链条。研究者可借助其收录的72个数据集,开展过敏原蛋白的结构与功能分析、免疫治疗药物的靶点发现与优化,以及基于电子健康记录的患者风险分层建模。例如,通过整合SDAP 2.0中的致敏蛋白数据库与IEDB中的免疫表位信息,可构建跨物种的交叉反应预测模型;利用Simulated Allergen Immunotherapy Trials Dataset模拟临床试验设计,评估新型免疫疗法的疗效与安全性。这种多维度数据融合策略,为理解食物过敏的免疫学基础提供了前所未有的数据支撑。
实际应用
在临床与产业实践中,该数据集系列正推动着从诊断预警到产品开发的范式变革。Open Food Facts与COMPARE数据库的整合,使食品企业能够自动校验产品标签中的过敏原声明,规避监管合规风险;Food Allergy Risk Stratification Dataset基于电子病历构建的风险模型,已实现儿童食物过敏风险预测的AUC达0.80,为早期干预提供了决策依据。此外,Enamine REAL数据库与M3-20M多模态分子数据集的联用,加速了低致敏性食品配方的虚拟筛选进程——研究者可在数小时内完成对百万级可合成化合物的致敏性评估,将传统湿实验周期从数年压缩至数月。这种数据驱动的研发模式,正在重塑过敏原管理、个性化营养方案设计与精准用药的行业标准。
衍生相关工作
该数据集的系统性整理已催生出一系列具有影响力的衍生工作。在计算工具层面,AllerCatPro 2.0基于其收录的4979个过敏原序列与结构数据,开发了融合深度学习的致敏性预测模型,被广泛应用于转基因作物的安全评估;在知识图谱领域,MedKG整合了35个权威数据源构建的医学知识图谱,已被用于发现食物过敏与自身免疫疾病之间的潜在药物重定位靶点。更值得关注的是,SAIR数据集提供的百万级蛋白质-配体共折叠结构及其结合亲和力数据,直接支撑了诸如BindGPT等新型生成式AI模型的发展,这些模型能够从头设计具有低免疫原性的治疗性抗体。此外,Therapeutic Target Database的持续更新,使得针对花生过敏原Ara h 2的特异性免疫疗法靶点发现成为可能,相关成果已进入临床前验证阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务