遇见数据集

protein-ligand-design

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

Protein-Ligand Design Gym(团队JAMMY)是一个专为工具使用强化学习环境设计的数据集,旨在训练大型语言模型像计算化学家或蛋白质工程师一样进行推理,通过实际测量而非直觉猜测来回答蛋白质-配体相关问题。该数据集聚焦于药物发现和蛋白质工程领域,其中蛋白质是由氨基酸字母串构成的分子机器,配体则是小分子(多数为药物),通过与蛋白质结合来调控其功能。数据集中的问题由Claude Opus 4.8生成,并经过严格的工具验证(使用RDKit和Biopython),确保每个问题都有唯一且可计算验证的答案,无法伪造。数据以parquet格式组织,包含训练集和测试集分割。每个数据样本包含以下字段:问题提示(question)、候选分子或蛋白质实体(以SMILES字符串或序列表示,字段为candidates/entities)、参数(params)、经过工具认证的标准答案(answer)、模板(template)、所需工具(tools_required)以及推理过程(reasoning)。代理模型可调用一系列化学和生物学工具来解决问题,包括计算配体分子描述符(如分子量、LogP、氢键供受体等)、药物相似性定量估计(QED)、Lipinski规则违反次数、Veber口服生物利用度规则、Tanimoto相似性、Murcko骨架、子结构匹配(用于检测共价弹头、盐桥、金属螯合剂等)、蛋白质性质(如等电点、亲水性、二级结构比例)、特定pH下的净电荷、糖基化位点计数、BLOSUM62突变评分、序列同一性以及蛋白质基序搜索。该数据集适用于问答任务,特别是需要模型与专业计算工具交互的强化学习场景,以提升在计算化学和生物信息学领域的可靠推理能力。

Protein-Ligand Design Gym (team JAMMY) is a dataset specifically designed for tool-use reinforcement learning environments, aiming to train large language models to reason like computational chemists or protein engineers by answering protein-ligand related questions through actual measurements rather than intuitive guesses. The dataset focuses on the fields of drug discovery and protein engineering, where proteins are molecular machines composed of amino acid strings, and ligands are small molecules (mostly drugs) that regulate protein function through binding. The questions in the dataset are generated by Claude Opus 4.8 and undergo rigorous tool validation (using RDKit and Biopython), ensuring each question has a unique and computationally verifiable answer that cannot be fabricated. The data is organized in parquet format, including training and test set splits. Each data sample contains the following fields: question prompt, candidate molecules or protein entities (represented as SMILES strings or sequences, with fields candidates/entities), parameters, tool-certified standard answers, templates, required tools, and reasoning processes. The agent model can invoke a series of chemical and biological tools to solve problems, including calculating ligand molecular descriptors (such as molecular weight, LogP, hydrogen bond donors/acceptors, etc.), quantitative estimation of drug-likeness (QED), Lipinski rule violations, Veber oral bioavailability rules, Tanimoto similarity, Murcko scaffolds, substructure matching (for detecting covalent warheads, salt bridges, metal chelators, etc.), protein properties (such as isoelectric point, hydrophilicity, secondary structure proportions), net charge at specific pH, glycosylation site counts, BLOSUM62 mutation scores, sequence identity, and protein motif searches. The dataset is suitable for question-answering tasks, particularly in reinforcement learning scenarios that require interaction with professional computational tools to enhance reliable reasoning capabilities in computational chemistry and bioinformatics.

创建时间:
2026-05-30
原始信息汇总

数据集概述:Protein-Ligand Design Gym (Team JAMMY)

该数据集是一个面向药物发现领域的工具使用强化学习环境,旨在训练大语言模型像计算化学家/蛋白质工程师一样进行推理。

核心目标

  • 向模型提供分子或蛋白质以及一个关于它的问题,模型必须调用化学/生物学工具(RDKit + Biopython)来测量答案,然后提交最终答案。
  • 奖励机制仅基于答案的正确性,每个真实答案均由相同工具计算得出,评分精确且无法伪造。
  • 问题由Claude Opus 4.8生成,并通过工具验证,确保每个问题都有一个可通过工具验证的单一答案。

模型可用的工具

工具 领域 计算内容
mol_descriptors 配体 (RDKit) 分子量、LogP、TPSA、氢键供体/受体、可旋转键、芳香环、sp³碳比例、形式电荷
qed 配体 (RDKit) 定量类药性估计 (0–1)
lipinski_violations 配体 (RDKit) 类药五规则违反次数
veber_pass 配体 (RDKit) 口服生物利用度规则(可旋转键≤10,TPSA≤140)
tanimoto_similarity 配体 (RDKit) 两个分子之间的ECFP4 (Morgan r=2, 2048-bit) 相似度
murcko_scaffold 配体 (RDKit) Bemis–Murcko骨架SMILES
substructure_match 相互作用 (RDKit) 统计SMARTS模式——共价弹头、盐桥基团、金属螯合剂、卤键供体、药效团
protein_properties 蛋白质 (Biopython) 分子量、等电点、GRAVY亲水性、不稳定指数、芳香性、螺旋/转角/折叠比例
net_charge_at_ph 蛋白质 (Biopython) 在给定pH下的净电荷
count_sequon 蛋白质 (Biopython) N-连接糖基化序列 (N-X-[S/T], X≠P)
blosum62_mutation_score 蛋白质 (Biopython) 一组点突变的BLOSUM62得分总和
sequence_identity 蛋白质 (Biopython) 两条序列之间的全局比对百分比一致性
motif_search 相互作用 (蛋白质) 统计正则表达式模式——催化/结合基序(如锌结合HE..H、糖基化序列)
submit_answer 控制 提交最终答案

数据内容

  • data/ 目录:包含问题数据,分为 traintest 两个Parquet格式的分片。
  • environment/ 目录:完整的verifiers gym环境,包括 protein_ligand_design.py、捆绑的问题文件及 pyproject.toml

数据字段

  • question:提示问题
  • candidates / entities:以SMILES或序列形式表示的分子/蛋白质
  • params:参数
  • answer:经工具验证的真实答案
  • template:模板
  • tools_required:所需工具
  • reasoning:推理过程

许可与标签

  • 许可协议:Apache-2.0
  • 语言:英语
  • 标签:chemistry, biology, protein, drug-discovery, tool-use, reinforcement-learning, verifiers, prime-intellect
  • 任务类别:question-answering

使用方式

通过Hugging Face datasets库加载:

python from datasets import load_dataset ds = load_dataset("poolside-laguna-hackathon/protein-ligand-design")

搜集汇总
数据集介绍
protein-ligand-design 数据集图片
构建方式
该数据集由Team JAMMY于poolside Laguna黑客马拉松期间构建,旨在通过工具增强的强化学习环境训练大型语言模型像计算化学家一样推理。数据集的构建核心在于将分子和蛋白质的SMILES编码或序列与具体化学或生物学问题配对,每道问题由Claude Opus 4.8自动生成,随后利用RDKit和Biopython等专业工具进行验证,仅保留那些能够通过工具计算得出唯一正确答案的样本,从而确保每个答案的精确性和不可伪造性。数据集被划分为训练集和测试集,均以parquet格式存储,便于高效加载与使用。
特点
该数据集的独特之处在于其强调工具调用而非模型直觉,模型必须主动调用RDKit和Biopython提供的十多种化学与生物学工具(如分子描述符计算、药效团匹配、蛋白质属性分析等)来完成测量任务,仅根据最终答案的正确性获得奖励。尤为突出的是,工具中包含substructure_match和motif_search两类交互性工具,可探测配体与蛋白质之间的真实化学作用(如共价弹头匹配、盐桥识别),使得问题能够触及药物发现中的关键机制。所有工具均可在仅使用CPU的环境下运行,极大降低了部署门槛。
使用方法
使用者可通过Prime Intellect平台直接运行预配置的强化学习环境,执行`prime env install`和`prime eval run`命令即可让模型在环境中进行推理与训练。也可通过HuggingFace的`datasets`库加载数据,使用`load_dataset`函数获取训练和测试分片。该环境支持GRPO等强化学习算法,奖励函数直接基于答案正确性,便于研究者对语言模型进行微调,以提升其在蛋白质-配体设计领域的推理与工具使用能力。数据集高度模块化,用户可根据需要扩展工具集或生成新的问题模板。
背景与挑战
背景概述
在药物发现与蛋白质工程领域,理解蛋白质与配体之间的相互作用是核心研究问题之一。蛋白质作为生命活动的分子机器,其功能常通过与小分子配体(如药物)的结合来调控,而配体的理化性质(如脂溶性、氢键供体/受体数量)和蛋白质的序列特征(如等电点、亲水性)共同决定了结合的特异性与效能。传统的计算方法(如分子对接、分子动力学模拟)虽能提供定量分析,但其计算成本高昂且难以被大语言模型直接调用。针对这一瓶颈,Team JAMMY于2024年Laguna黑客马拉松期间创建了Protein-Ligand Design Gym数据集,旨在通过工具增强的强化学习环境,训练大语言模型像计算化学家一样进行推理——调用RDKit和Biopython等化学/生物学工具进行精确测量,而非仅凭文本语义猜测。该数据集由Claude Opus 4.8自动生成问题,并经工具验证确保答案的唯一性和可计算性,在药物设计自动化领域具有开创性意义,为将领域知识嵌入语言模型提供了可重复、可审计的基准。
当前挑战
该数据集所解决的领域挑战在于,蛋白质-配体相互作用的性质无法从描述性文本(如SMILES字符串或蛋白质序列)中直接读取,例如评估分子的口服吸收潜力(如Lipinski五规则)、预测点突变对蛋白质稳定性的影响(如BLOSUM62评分),或者识别配体是否含有特定药效团(如丙烯酰胺共价弹头)——这些均需通过专业计算工具进行量化分析。在数据集构建过程中,主要挑战包括:1)问题生成的自动化与质量控制,需借助Claude Opus 4.8生成多样化问题,并通过工具验证筛选出具备唯一可验证答案的条目,确保评分系统无法被欺骗;2)工具接口的标准化与兼容性,需将RDKit(配体化学)、Biopython(蛋白质性质)以及交互式工具(如子结构匹配、基序搜索)整合为统一的强化学习环境,并确保所有计算在仅依赖CPU的条件下高效运行;3)数据集的平衡性维持,需覆盖从基础的理化性质查询(如分子量、LogP)到复杂的蛋白-配体化学模式识别(如盐桥、金属螯合物),以全面评估模型的工具调用与推理能力。
常用场景
经典使用场景
在药物发现与蛋白质工程领域,该数据集最经典的使用场景是作为强化学习环境,用于训练大语言模型在回答化学或生物学问题时主动调用外部计算工具。每个样本包含一个关于分子或蛋白质的问题,模型必须借助RDKit与Biopython等专业工具进行实时测量,而非依赖内部参数进行猜测。只有当模型能正确调用工具并给出可验证答案时,才获得奖励。这种设置不仅模拟了计算化学家与蛋白质工程师的工作流程,更将科学推理过程从‘记忆’转化为‘实测’,开创了将工具增强学习与分子科学深度结合的新范式。
实际应用
在实际药物研发场景中,该数据集可被广泛应用于自动化分子性质筛选、先导化合物优化与蛋白质工程改造。例如,模型可自主调用工具计算候选分子的Lipinski五规则违规数、Tanimoto相似度或Murcko骨架,快速筛除不符合成药性要求的化合物。在蛋白质设计方面,模型能评估突变体的BLOSUM62评分、等电点变化或糖基化位点存在性,辅助理性设计。此外,该环境还适合嵌入高通量虚拟筛选管线,作为AI辅助的‘计算化学家’自动生成并验证设计假说,极大降低早期研发阶段的人力与时间成本。
衍生相关工作
该数据集衍生了多项具有影响力的经典工作。首先,Prime Intellect团队基于此环境对poolside/Laguna-XS.2模型进行了GRPO策略的微调,展示了强化学习在分子工具调用任务中的有效性。其次,该数据集催生了verifiers工具库的进一步完善,使得更多研究者能便捷地搭建类似的可验证分子推理环境。此外,数据集中涉及的子结构匹配与基序搜索工具,启发了后续将化学反应规则与图神经网络相结合的工作,推动了‘可解释性分子推理’方向的发展。这些衍生工作共同丰富了AI驱动药物发现的技术生态,为未来实现全自动分子设计闭环奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务