CHIMERA-Bench
收藏资源简介:
CHIMERA-Bench是一个用于表位特异性抗体设计的基准数据集,包含2,922个抗体 抗原复合物,具有表位/对位注释、多方案编号和预计算的结构特征。数据集提供了3种泛化分割、12种评估指标、11种重新训练的基线方法,以及5种数据类别的格式转换器。
CHIMERA-Bench is a benchmark dataset for epitope-specific antibody design, comprising 2,922 antibody-antigen complexes with epitope/paratope annotations, multiple scheme numberings, and pre-computed structural features. The dataset provides 3 types of generalization splits, 12 evaluation metrics, 11 retrained baseline methods, as well as 5 format converters for distinct data categories.
CHIMERA-Bench 数据集概述
数据集基本信息
- 名称:CHIMERA-Bench
- 用途:表位特异性抗体设计的基准数据集
- 论文:CHIMERA-Bench: A Benchmark Dataset for Epitope-Specific Antibody Design (ICLR 2026 GEM Workshop)
核心内容与规模
- 抗体-抗原复合物数量:2,922个
- PDB结构文件数量:2,721个
- 预计算特征文件:2,922个
.pt文件 - 分辨率截断值:4.0 Å
- 接触距离截断值:4.5 Å
数据集构成
数据来源与下载
- HuggingFace Hub:
chimera-bench/chimera-bench-v1.0 - Zenodo:DOI: TBD
- 预计算残基图(可选,5.8 GB):作为单独下载提供
目录结构
chimera-bench-v1.0/ metadata/ final_summary.csv # 2,922个复合物,32列 excluded_complexes.csv # 59个被排除的复合物及原因 antibody_sequences.fasta # 所有复合物的VH+VL序列 splits/ epitope_group.json # 主要划分(2338/292/292) antigen_fold.json # 基于折叠的泛化划分(2338/292/292) temporal.json # 前瞻性评估划分(2337/292/293) complex_features/ # 每个复合物的PyTorch张量(2,922个文件) {complex_id}.pt structures/ # PDB结构文件(2,721个文件) {pdb}.pdb
复合物特征格式
每个.pt文件包含以下键值对:
| 键 | 形状 | 描述 |
|---|---|---|
complex_id |
str | 唯一ID:{pdb}_{Hchain}_{Lchain}_{Agchain} |
heavy_sequence |
str | 重链氨基酸序列 |
light_sequence |
str | 轻链氨基酸序列 |
antigen_sequence |
str | 抗原氨基酸序列 |
heavy_atom14_coords |
(N, 14, 3) | 重链14原子坐标 |
heavy_ca_coords |
(N, 3) | 重链CA坐标 |
epitope_residues |
list | (链,残基ID,残基名称)元组列表 |
paratope_residues |
list | (链,残基ID,残基名称)元组列表 |
contact_pairs |
list | 抗体-抗原接触对及距离 |
numbering |
dict | H链和L链的IMGT及Chothia编号 |
cdr_masks |
dict | 每个残基的CDR注释(-1=FR,0-2=H1-H3,3-5=L1-L3) |
ag_surface_points |
(128, 3) | 采样的抗原表面点 |
ag_surface_chemical_feats |
(128, 6) | 亲水性、电荷、氢键、芳香性、极性 |
数据集划分
提供三种泛化划分:
| 划分 | 训练集 | 验证集 | 测试集 | 泛化轴 |
|---|---|---|---|---|
| epitope_group | 2,338 | 292 | 292 | 未见过的表位模式 |
| antigen_fold | 2,338 | 292 | 292 | 未见过的抗原折叠 |
| temporal | 2,337 | 292 | 293 | 前瞻性(按沉积日期) |
基准方法
数据集包含11种在CHIMERA-Bench上重新训练的基准方法,涵盖6种设计范式:
| 方法 | 范式 | 表位条件? | 多CDR? | 目录 |
|---|---|---|---|---|
| DiffAb | 扩散 | 是 | 是 | baselines/diffab/ |
| AbFlowNet | 流匹配 | 是 | 是 | baselines/abflownet/ |
| AbMEGD | 扩散 | 是 | 是 | baselines/abmedg/ |
| RADAb | 检索 + 扩散 | 是 | 是 | baselines/radab/ |
| dyAb | 流匹配 | 是 | 是 | baselines/dyab/ |
| MEAN | 等变GNN | 是 | 否(仅H3) | baselines/mean/ |
| dyMEAN | 等变GNN | 是 | 是 | baselines/dymean/ |
| RAAD | 等变GNN | 是 | 是 | baselines/raad/ |
| RefineGNN | 自回归GNN | 否 | 是 | baselines/refinegnn/ |
| AbODE | 联合ODE | 否 | 是 | baselines/abode/ |
| AbDockGen | 分层ENN | 是(仅H3) | 否 | baselines/abdockgen/ |
每个基准方法包含5个CHIMERA集成文件:config.yaml、preprocess.py、chimera_trainer.py、chimera_evaluate.py、chimera_train.sh。
评估指标
共12项评估指标,涵盖四个维度:
| 组别 | 指标 | 描述 |
|---|---|---|
| 序列质量 | AAR, CAAR, PPL | 氨基酸恢复率、接触AAR、困惑度 |
| 结构准确性 | RMSD, TM-score | Kabsch对齐的CA RMSD、TM-score |
| 结合界面 | Fnat, iRMSD, DockQ | 天然接触分数、界面RMSD、DockQ |
| 表位特异性 | EpiF1 | 表位接触的精确率、召回率、F1分数 |
| 可设计性 | n_liabilities | NG、DG、DS、DD、NS、NT、M基序计数 |
附加信息
- 编号方案:IMGT, Chothia
- 格式转换器:提供5种数据类别的格式转换器,供不同基准方法使用
- 许可证:
- 代码:MIT许可证
- 数据:CC-BY 4.0许可证




