遇见数据集

claude-protein-binder-design

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集(Claude蛋白结合子设计,数据发布v1.0)包含1,440个从头设计的微小蛋白结合子(长度为50-120个残基),靶向16个不同的蛋白质靶点。这些结合子由两个Claude模型(Mythos Preview生成900个设计,Opus 4.8生成540个设计)作为自主蛋白质设计代理完成。设计在两家合同研究组织(CRO)进行表征:Adaptyv Bio(无细胞表达,采用固定化设计的SPR/BLI动力学)和Twist Bioscience(Fc融合表达,采用六点抗原滴定的捕获SPR)。每个设计附有:两个供应商的结合性判定和动力学数据,包含原始传感图和报告图像;两个供应商的对比及最终评估结果;设计模型;来自十个结构预测器、每个种子最优的共折叠预测及评分;以及逐步设计来源信息。数据集以Parquet表形式组织,共20个配置子集(如design_summary、wetlab_summary、adaptyv_results、twist_fits、insilico_cofold_predictions等),每个设计还包含结构文件、传感器图PNG和曲线CSV文件。靶点包括:15-PGDH、BBF-14、BHRF1、SpCas9、EGFR、IL-7Rα、前肌生长抑制素(pro-myostatin)、成熟GDF-8、MBP、尼帕病毒G蛋白、PD-L1、RBX1、TNF-α、TREM2、TrkA、VEGF-A。其中对成熟GDF-8的120个设计湿实验测量结果因抗原聚集而无法使用,仅提供设计模型和预测数据;其余15个靶点的1,320个设计中,根据两个供应商的评估,354个被判定为结合子。该数据集适用于蛋白质设计、结合子预测、结构预测基准测试、以及蛋白质-蛋白质相互作用研究等任务。

This dataset (Claude Protein Binder Design, Data Release v1.0) contains 1,440 de novo designed small protein binders (50-120 residues long) targeting 16 different protein targets. These binders were designed by two Claude models (Mythos Preview generated 900 designs, Opus 4.8 generated 540 designs) as autonomous protein design agents. The designs were characterized at two contract research organizations (CROs): Adaptyv Bio (cell-free expression, SPR/BLI kinetics with immobilized designs) and Twist Bioscience (Fc-fusion expression, capture SPR with six-point antigen titration). Each design is accompanied by: binding status and kinetic data from both vendors, including raw sensorgrams and report images; comparison and final evaluation results from both vendors; design model; cofold predictions and scores from ten structure predictors for each best seed; and step-by-step design provenance. The dataset is organized as a Parquet table with 20 configuration subsets (e.g., design_summary, wetlab_summary, adaptyv_results, twist_fits, insilico_cofold_predictions, etc.), and each design also includes structure files, sensorgram PNGs, and curve CSV files. Targets include: 15-PGDH, BBF-14, BHRF1, SpCas9, EGFR, IL-7Rα, pro-myostatin, mature GDF-8, MBP, Nipah virus G protein, PD-L1, RBX1, TNF-α, TREM2, TrkA, VEGF-A. Among these, wet-lab measurements for 120 designs targeting mature GDF-8 were unusable due to antigen aggregation, so only design models and prediction data are provided. Of the remaining 1,320 designs for 15 targets, 354 were deemed binders based on both vendors evaluations. This dataset is suitable for tasks such as protein design, binder prediction, structure prediction benchmarking, and protein-protein interaction studies.

提供机构:
Anthropic
创建时间:
2026-08-18
原始信息汇总

数据集概述

Claude protein binder design 是 Anthropic 发布的一个蛋白质设计数据集(v1.0),包含 1,440 个由 AI 设计的从头(de novo)微型蛋白结合剂,靶向 16 个目标蛋白,由两个 Claude 模型作为自主蛋白质设计智能体生成:

  • Mythos Preview:900 个设计
  • Opus 4.8:540 个设计

蛋白结合剂长度为 50 至 120 个氨基酸残基,实验表征由两家合同研究机构完成:

  • Adaptyv Bio:无细胞表达,SPR/BLI 动力学检测(固定设计蛋白)
  • Twist Bioscience:Fc 融合表达,六点抗原滴定的捕获 SPR

目标蛋白列表

15-PGDH、BBF-14、BHRF1、SpCas9、EGFR、IL-7Rα、潜在 GDF-8(pro-myostatin)、成熟 GDF-8、MBP、尼帕病毒 G、PD-L1、TREM2、TrkA、VEGF-A。

关键结果

  • 成熟 GDF-8 的 120 个设计因抗原聚集和非特异性结合导致湿实验数据无效,未纳入(仅提供设计模型、共折叠和溯源信息)
  • 其余 15 个靶点的 1,320 个设计中,354 个被两个供应商一致评定为结合剂

数据内容

数据集整合了每个设计的以下信息:

  • 结合判定和两家供应商的动力学数据(含原始传感图和报告图像)
  • 两个供应商的逐设计比较与最终评定
  • 设计所用模型
  • 十个结构预测器的种子最优共折叠预测(含逐种子评分)
  • 逐步设计溯源信息

数据组织

  • 20 个 Parquet 表:设计汇总、湿实验汇总与测量、两供应商结果/重复/读取/拟合曲线、表达与滴度、共折叠预测、表位接触、来源信息、靶点构建体、列字典等
  • 逐设计文件夹:包含设计模型、共折叠结构、传感图 PNG、每曲线 CSV 等文件
  • 配套文件:文档、清单(manifest)、提示词(prompts)、结构文件(structure_and_pae,含 mmCIF 格式和 PAE 矩阵)
  • 所有表通过 uuid 字段关联,full_name 命名逐设计文件夹

许可证与引用

  • 数据和文档:CC BY 4.0
  • 脚本:MIT 许可
  • 第三方材料保留各自的许可条款
  • 引用方式见 CITATION.cff
搜集汇总
数据集介绍
claude-protein-binder-design 数据集图片
构建方式
在蛋白质从头设计领域,自主智能体驱动的实验闭环正成为评估计算设计能力的重要范式。该数据集由两个Claude模型作为自主蛋白质设计智能体,针对十六种靶标生成一千四百四十条长度为五十至一百二十个残基的微型结合蛋白,其中Mythos Preview贡献九百条设计、Opus 4.8贡献五百四十条。所有设计随后被送往两家合同研究组织进行湿实验表征:Adaptyv Bio采用无细胞表达体系并以设计蛋白固定化方式进行SPR/BLI动力学测量,Twist Bioscience则采用Fc融合表达与六点抗原滴定的捕获SPR方案。数据发布以设计为单位整合结合判定、动力学参数、原始传感图、两家供应商的逐条比较与最终评估、设计模型、十个结构预测器的种子最优共折叠预测及其逐种子评分,以及步骤级设计溯源信息。
特点
该数据集的核心价值在于其贯通计算设计与湿实验验证的全链条覆盖,每一条设计均可追溯至具体的生成模型、设计轮次与结构预测来源。数据集包含二十张Parquet表格,涵盖设计摘要、湿实验汇总与测量、两家供应商的结果与拟合曲线、抗原与对照、共折叠预测、表位残基接触及溯源步骤等维度,所有表格通过uuid字段相互关联,full_name字段则与逐设计文件夹一一对应。配套的结构层级进一步提供十万余条预测模型及其完整PAE矩阵,提示词目录则保留了多靶标与单靶标campaign的完整提示、启动消息与外部资源语料,为智能体设计流程的可复现性提供了罕见的方法学透明度。
使用方法
使用者可通过HuggingFace Hub的hf_hub_download接口按需获取数据,设计摘要表包含一千四百四十行逐设计记录,湿实验汇总表提供两家供应商的比较与最终判定,默认子集即为design_summary,其余每张Parquet表亦作为独立子集暴露以便灵活加载。逐设计文件夹位于data/designs/<target>/<design>/路径下,内含设计模型、各预测器的种子最优共折叠结构、原始读数、拟合曲线与传感图图像,可按需下载单条设计或整个靶标目录。column_dictionary.parquet定义了所有表格的列含义,DATA_NOTES.md则列出了解释测量结果时需注意的关键注意事项,用户应结合两者以确保分析的科学严谨性。
背景与挑战
背景概述
蛋白质从头设计是计算生物学与合成生物学交汇的前沿领域,旨在不依赖天然骨架的前提下创制具有特定结合功能的全新蛋白。2025年前后,伴随大语言模型在科学推理与工具调用上的能力跃升,以自主智能体驱动生物分子设计成为新兴范式。该数据集由Anthropic于2025年发布,汇集两个Claude模型(Mythos Preview与Opus 4.8)作为自主设计智能体生成的1440条从头微型结合蛋白,靶向16种靶标,并经Adaptyv Bio与Twist Bioscience两家合同研究机构完成无细胞表达、SPR/BLI动力学表征与Fc融合捕获测定。数据集将设计来源、双厂商实验测量、原始传感曲线、十种结构预测器的共折叠结果与逐步设计溯源相链接,为评估智能体驱动的蛋白质设计能力提供了迄今规模最大、层次最完整的公开基准之一。
当前挑战
该数据集所应对的核心领域难题,在于从头结合蛋白的体外成功率长期低下,计算预测与实验验证之间存在显著鸿沟,且不同表征平台因固定化方式与滴定策略差异易产生结果分歧。构建过程中的挑战同样突出:两个厂商的测定条件与数据格式迥异,需要逐设计比对并给出最终判定;120条成熟GDF-8设计因抗原聚集与非特异性表面结合导致测量无效,只能保留计算层数据;海量原始传感图、拟合曲线与十种预测器、五种种子的共折叠结构(含完整PAE矩阵)需在保持可追溯性的同时实现高效组织与校验;此外,自主要智能体生成的设计还面临溯源记录完整性与第三方材料许可边界的管理难题。
常用场景
经典使用场景
在蛋白质从头设计领域,该数据集最典型的使用场景是作为评估新型生成式模型设计蛋白结合剂能力的基准资源。研究者可借助其包含的1440个针对16种靶标的小型蛋白结合剂设计,以及来自Adaptyv Bio与Twist Bioscience两家合同研究组织的SPR/BLI动力学表征数据,系统检验设计模型在真实实验条件下的成功率与亲和力表现。同时,数据集中十种结构预测器对每个设计的共折叠预测及逐种子评分,为比较不同计算方法的预测准确性提供了标准化平台。
解决学术问题
该数据集直击蛋白质设计研究中长期存在的关键难题:计算设计与湿实验验证之间存在显著脱节,且缺乏统一、可复现的评估标准。通过将设计模型、共折叠预测、表位残基接触、逐步骤设计溯源与两套独立的湿实验动力学数据进行逐设计关联,它使研究者能够量化设计成功率、剖析失败原因,并检验预测器与实际结合能力之间的相关性,从而推动设计方法的可解释性与迭代优化。
衍生相关工作
该数据集衍生了一系列围绕自主蛋白设计智能体与实验闭环的经典工作。其揭示的Claude模型作为自主设计智能体的工作流,启发了后续将大语言模型与结构预测、序列生成工具耦合的智能体框架研究。数据集提供的多预测器共折叠评分与实验结果的系统性对照,催生了针对蛋白结合剂设计成功率预测的元评估方法。此外,双供应商动力学数据的引入,推动了跨平台SPR/BLI数据标准化与可比性研究,为领域内基准的持续演进奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务