k-fold-structure/repsp-benchmark
收藏资源简介:
K-Fold结构基准测试(AFDB-Multimer)是一个用于蛋白质折叠、共折叠和探测任务的数据集。该数据集旨在从非结合单体(apo)预测结合同源二聚体(holo)的性质,其中两个链是相同的(同源二聚体),因此每个残基位置携带单个标签。数据集内容包括:splits文件夹提供训练、验证和测试集的蛋白质ID文件(经过LMDB清理);probing文件夹包含每个残基的标签,如结合位点、delta_sasa_mean、levy_tier和bond_type_plip;boltz_apo_tokens和boltz_holo_tokens目录包含tokenized的单体和二聚体数据,作为折叠和共折叠的输入;boltz_apo_targets和boltz_holo_targets目录则提供相应的结构目标。数据集使用MIT许可证,适用于基准测试和模型训练。
许可证:MIT 标签: - 蛋白质 - 结构 - 折叠 - 共折叠 - 基准测试 # K折结构基准数据集(AFDB-Multimer) 本数据集包含运行折叠/共折叠/探测基准测试所需的全部资源,**仅排除每编码器特征**(该特征可通过[k-fold-structure/repsp-triprorep-tokens](https://huggingface.co/datasets/k-fold-structure/repsp-triprorep-tokens)结合你的编码器自行提取,详见GitHub发布的README文档)。 本基准任务遵循**脱辅基态(apo)→全辅基态(holo)**范式:从未结合单体(脱辅基态)出发,预测结合态同源二聚体(全辅基态)的相关性质。由于两条链完全一致(同源二聚体),每个残基位置仅对应单一标签。 ## 数据集内容 splits/ folding/{train,valid,test}.txt # 390,627 / 400 / 1,000 个蛋白质标识符(PID,聚类代表,经LMDB清洗) probing/splits_{train,valid,test}.txt # 39,076 / 400 / 1,000 个蛋白质标识符(PID,为折叠训练集的10%) probing/ labels.pkl # 逐残基标签:结合位点/平均溶剂可及性面积变化/levy层级/PLIP键类型 boltz_apo_tokens/ shard*.tar # 经Boltz标记化的脱辅基态单体(折叠任务输入) boltz_apo_targets/ shard*.tar # 脱辅基态结构目标文件 boltz_holo_tokens/ shard*.tar # 经Boltz标记化的全辅基态二聚体(共折叠任务输入) boltz_holo_targets/ shard*.tar # 全辅基态结构目标文件 每个`boltz_*`目录均被拆分为约5GB的tar分卷(原生目录各包含约39.5万个小文件,无法直接单独上传)。**需将某一目录下的所有分卷提取至同一文件夹:** bash hf download k-fold-structure/repsp-benchmark --repo-type dataset --include "boltz_holo_tokens/*" --local-dir ./benchmark cd ./benchmark/boltz_holo_tokens for t in shard*.tar; do tar xf "$t"; done && rm shard*.tar # -> 生成 manifest.json、records/ 目录与 tokens/ 目录 > **关于“Boltz”的说明:** `boltz_*` 目录采用折叠主干网络(SimpleFold)所需的标记化布局,包含`manifest.json`、`records/`与`tokens/`目录(目标文件对应`structures/`目录)。提取完成后,只需将折叠数据模块的`tokenized_dir`与`target_dir`参数指向上述文件夹即可。 ## 补充说明 - 数据集划分已完成LMDB清洗:约0.06%的训练集蛋白质标识符(PID)因标记化失败已被移除,因此不会触发键错误(KeyError)。 - 本纯蛋白质基准数据集无需使用折叠任务的`symmetries`配置字段(无配体,链A与链B的对称性可实时计算)。 ## 许可证 MIT




