EpicNet
收藏资源简介:
EpicNet数据集是一个从免疫表位数据库(IEDB)和相关免疫信息学资源中提取的肽和蛋白质表位记录的整合。它标准化了线性肽表位的表示,交叉链接源分子、生物体和分类学参考,并在一致的本体映射下统一了元数据。该数据集支持生物信息学、表位预测的机器学习以及免疫疗法研究,提供了表位、其父蛋白质和相关的免疫上下文的对齐、结构化表示。
The EpicNet dataset is an integration of peptide and protein epitope records extracted from the Immune Epitope Database (IEDB) and related immunoinformatics resources. It standardizes the representation of linear peptide epitopes, cross-links source molecules, organisms and taxonomic references, and unifies metadata under a consistent ontology mapping. This dataset supports bioinformatics, machine learning for epitope prediction, and immunotherapy research, providing aligned, structured representations of epitopes, their parent proteins and associated immune contexts.
EpicNet数据集概述
数据集摘要
- EpicNet数据集是从免疫表位数据库(IEDB)和相关免疫信息学资源中提取的肽和蛋白质表位记录的精选集成
- 标准化线性肽表位表示,交叉链接源分子、生物体和分类学参考,并在一致的 ontology 映射下统一元数据
- 通过提供对齐的结构化表位表示、其亲本蛋白质和相关免疫背景,支持生物信息学、表位预测的机器学习和免疫治疗研究
支持任务与用例
- 表位-蛋白质映射:链接和分析抗原肽与其源蛋白质和生物体的关系
- 基于序列的表位预测:训练模型预测免疫原性肽段
- 抗原相似性和交叉反应性研究:比较不同物种的表位以用于疫苗开发
- 知识图谱集成:生成RDF/OWL图谱用于 ontology 驱动的免疫信息学
- 使用变换器或肽编码器(如ESM、ProtBERT)进行嵌入生成和表示学习
数据集结构
- 记录数量:2,308,224行,代表肽-蛋白质关联
- 平均肽长度:8-35个氨基酸
- 近似数据集大小:85.8 MB(原始TSV)/ 156 MB(Parquet)
数据来源与出处
- IEDB(免疫表位数据库):规范表位和抗原关系
- UniProt/NCBI蛋白质:序列级参考
- NCBI分类学:标准化生物体标识符
- 每个条目将标识符映射到IEDB IRI,提供国际可追溯的交叉链接
语言与数据格式
- 序列表示:氨基酸单字母代码(A-Y)
- 元数据字段:英语标签和 ontology 类术语
- 格式:TSV/Parquet(具有结构化元数据的CSV兼容)
预期用途
- 计算免疫学流程(例如T细胞/B细胞表位分类器微调)
- 免疫网络的基于图的表示
- 病原体和宿主之间的比较肽分析
- 大规模蛋白质-表位预训练的基础数据集
限制与伦理考虑
- 数据集反映实验或计算精选的肽序列;并非所有记录都经过实验验证
- 由于同源物或预测类似物,某些肽段出现在不同物种中
- 用户必须在临床或诊断应用中验证NCBI分类学和UniProt ID
- 数据集不包含个人可识别数据或临床元数据
引用
- 如果您使用此数据集,请引用:
- Gokul Alex (2025). EpicNet – International Epitope Database Peptide Network. Hugging Face Datasets.
- 可用地址:https://huggingface.co/datasets/gokulalex/EpicNet
许可证
- 知识共享署名4.0国际许可证(CC BY-4.0)
数据集创建与维护
- 作者:Gokul Alex
- 发布日期:2025年10月
- 版本:v1.0
- 联系方式:https://huggingface.co/gokulalex
示例条目
json { "IEDB IRI": "http://www.iedb.org/epitope/1", "Object Type": "Linear peptide", "Name": "AA + MCM(A1,A2)", "Modified Residue(s)": "A1,A2", "Modifications": "Main chain modification", "Starting Position": 200, "Ending Position": 201, "Source Molecule": "Streptokinase", "Source Molecule IRI": "https://uniprot.org/uniprot/P10520", "Source Organism": "Streptococcus pyogenes", "Species": "Streptococcus pyogenes serotype M3 D58" }
致谢
- 数据来源于IEDB联盟、NCBI和UniProt KB
- 在EpicNet数据倡议下的编译、集成和 ontology 对齐




