遇见数据集

k-fold-structure/repsp-benchmark

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

K-Fold结构基准测试(AFDB-Multimer)是一个用于蛋白质折叠、共折叠和探测任务的数据集。该数据集旨在从非结合单体(apo)预测结合同源二聚体(holo)的性质,其中两个链是相同的(同源二聚体),因此每个残基位置携带单个标签。数据集内容包括:splits文件夹提供训练、验证和测试集的蛋白质ID文件(经过LMDB清理);probing文件夹包含每个残基的标签,如结合位点、delta_sasa_mean、levy_tier和bond_type_plip;boltz_apo_tokens和boltz_holo_tokens目录包含tokenized的单体和二聚体数据,作为折叠和共折叠的输入;boltz_apo_targets和boltz_holo_targets目录则提供相应的结构目标。数据集使用MIT许可证,适用于基准测试和模型训练。

许可证:MIT 标签: - 蛋白质 - 结构 - 折叠 - 共折叠 - 基准测试 # K折结构基准数据集(AFDB-Multimer) 本数据集包含运行折叠/共折叠/探测基准测试所需的全部资源,**仅排除每编码器特征**(该特征可通过[k-fold-structure/repsp-triprorep-tokens](https://huggingface.co/datasets/k-fold-structure/repsp-triprorep-tokens)结合你的编码器自行提取,详见GitHub发布的README文档)。 本基准任务遵循**脱辅基态(apo)→全辅基态(holo)**范式:从未结合单体(脱辅基态)出发,预测结合态同源二聚体(全辅基态)的相关性质。由于两条链完全一致(同源二聚体),每个残基位置仅对应单一标签。 ## 数据集内容 splits/ folding/{train,valid,test}.txt # 390,627 / 400 / 1,000 个蛋白质标识符(PID,聚类代表,经LMDB清洗) probing/splits_{train,valid,test}.txt # 39,076 / 400 / 1,000 个蛋白质标识符(PID,为折叠训练集的10%) probing/ labels.pkl # 逐残基标签:结合位点/平均溶剂可及性面积变化/levy层级/PLIP键类型 boltz_apo_tokens/ shard*.tar # 经Boltz标记化的脱辅基态单体(折叠任务输入) boltz_apo_targets/ shard*.tar # 脱辅基态结构目标文件 boltz_holo_tokens/ shard*.tar # 经Boltz标记化的全辅基态二聚体(共折叠任务输入) boltz_holo_targets/ shard*.tar # 全辅基态结构目标文件 每个`boltz_*`目录均被拆分为约5GB的tar分卷(原生目录各包含约39.5万个小文件,无法直接单独上传)。**需将某一目录下的所有分卷提取至同一文件夹:** bash hf download k-fold-structure/repsp-benchmark --repo-type dataset --include "boltz_holo_tokens/*" --local-dir ./benchmark cd ./benchmark/boltz_holo_tokens for t in shard*.tar; do tar xf "$t"; done && rm shard*.tar # -> 生成 manifest.json、records/ 目录与 tokens/ 目录 > **关于“Boltz”的说明:** `boltz_*` 目录采用折叠主干网络(SimpleFold)所需的标记化布局,包含`manifest.json`、`records/`与`tokens/`目录(目标文件对应`structures/`目录)。提取完成后,只需将折叠数据模块的`tokenized_dir`与`target_dir`参数指向上述文件夹即可。 ## 补充说明 - 数据集划分已完成LMDB清洗:约0.06%的训练集蛋白质标识符(PID)因标记化失败已被移除,因此不会触发键错误(KeyError)。 - 本纯蛋白质基准数据集无需使用折叠任务的`symmetries`配置字段(无配体,链A与链B的对称性可实时计算)。 ## 许可证 MIT

提供机构:
k-fold-structure
搜集汇总
数据集介绍
k-fold-structure/repsp-benchmark 数据集图片
构建方式
本数据集名为repsp-benchmark,其构建聚焦于蛋白质结构预测中的从无配体单体(apo)到结合态同源二聚体(holo)的转变。数据来源于AFDB-Multimer,并经过LMDB清洗,移除了约0.06%因令牌化失败的序列,最终生成包含390,627个训练样本、400个验证样本及1,000个测试样本的折叠基准集。探针子集则从折叠训练集中抽取10%,形成39,076个样本的独立分划。所有序列均以Boltz令牌化格式存储,包括单体与二聚体的令牌及结构目标文件,并以约5GB的tar分片形式组织,便于分布存储与提取。
使用方法
使用该数据集时,首先需通过HuggingFace CLI下载所有分片文件,并将其解压至统一目录。解压后,每个数据目录包含manifest.json、records/及tokens/子目录,用户可将折叠数据模块的tokenized_dir和target_dir指向对应文件夹。由于该基准专为蛋白质设计且不含配体,对称性计算在运行时自动处理,无需额外配置。研究者可直接利用提供的分划文件进行模型训练、验证与测试,亦可基于探针标签执行残基级别的属性预测任务。
背景与挑战
背景概述
蛋白质结构预测与复合物组装是计算生物学领域的核心挑战之一,尤其是从非结合态单体(apo)预测结合态同源二聚体(holo)的结构与功能特性,对于理解蛋白质相互作用机制及药物设计具有关键意义。repsp-benchmark数据集由K-Fold Structure研究团队于近年来构建,旨在系统评估蛋白质折叠、共折叠及探测任务的模型性能。该数据集基于AFDB-Multimer数据库,精选了近40万条经过严格清洗的同源二聚体序列,聚焦于apo-to-holo的预测范式。通过提供标准化的数据划分、残基级标签(如结合位点、溶剂可及面积变化)及Boltz词元化结构文件,该数据集为蛋白质结构预测领域提供了统一的评测基准,推动了模型泛化能力与鲁棒性的研究。
当前挑战
该数据集所解决的领域问题在于,现有蛋白质结构预测方法多针对单体或已知复合物结构,缺乏从非结合态到结合态构象变化的系统性基准。repsp-benchmark通过定义严格的apo→holo任务,要求模型在仅依赖单体结构信息时预测同源二聚体的结合构象与残基功能属性,这直接挑战了当前深度学习方法对蛋白质动态结合机制的建模能力。此外,数据构建过程中面临多重困难:需从庞大的AFDB-Multimer数据库中筛选出高质量同源二聚体,剔除序列冗余(LMDB清洗),并统一将非结合态与结合态结构对齐至相同残基索引;同时,大规模结构词元化(~39.5万个结构)需高效存储与分片处理,最终通过约5GB的tar分片发布,确保了数据完整性与可用性。
常用场景
经典使用场景
REPSP基准测试集专注于蛋白质结构预测与共折叠领域,其最经典的使用场景在于评估从单体状态向结合态同源二聚体结构转变的预测能力。研究者利用该数据集,通过比照未结合单体(apo)的结构特征,检验模型对结合态同源二聚体(holo)的几何构型与残基互作模式的推断精度。数据集细致划分了折叠与探针两种任务分支,并提供了基于Boltz方法的标准化token化数据与结构目标,因而成为衡量蛋白质结构预测、特别是同源二聚体界面建模方法性能的黄金标准评测平台。
解决学术问题
该数据集有效解决了蛋白质结构预测中从单体到复合物转换这一核心学术难题,尤其聚焦于同源二聚体界面残基的精确识别与结构变化预测。传统上,对蛋白质结合效应的研究往往受限于大规模标注数据的缺失与生化实验成本的高昂。REPSP基准测试集提供了超过39万个训练样本以及精心设计的探针标签(如结合位点、溶剂可及表面积变化、层级接触类型等),极大推动了机器学习模型在功能位点推断与构象变化定量分析方面的发展,为理解蛋白质间相互作用的基础机制和信号传导路径的分子基础提供了坚实的数据支撑。
实际应用
在实际应用场景中,REPSP基准测试集为药物发现与蛋白质工程领域提供了强大的技术支撑。生物制药企业在抗体设计、蛋白-蛋白相互作用抑制剂筛选等环节,需准确预测目标蛋白二聚化或功能复合体的三维结构。利用该数据集训练的模型,可大幅提升对异源二聚体甚至多聚体组装过程的结构预测精度,从而加速候选药物分子的虚拟筛选与理性优化。此外,在酶工程与合成生物学中,该基准有助于设计具有特定界面特性的人工蛋白,推动工业化生物催化系统与新型生物材料的开发。
数据集最近研究
最新研究方向
该数据集聚焦于蛋白质从非结合单体到结合同源二聚体的构象跃迁预测,为前沿的蛋白质共折叠研究提供了关键基准。当前,AlphaFold等结构预测模型已能高精度解析单一蛋白质结构,但多亚基复合物尤其同源二聚体的动态组装机制仍是结构生物学与药物设计的核心挑战。repsp-benchmark通过系统划分训练/验证/测试集,整合了结合位点、溶剂可及性变化等精细残基标签,推动模型从静态结构预测迈向动态构象变化推理。其apo→holo的预测范式直接服务于靶点发现与蛋白质工程,对理解疾病相关二聚化过程的分子机制及指导变构药物筛选具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务