遇见数据集

poolside-laguna-hackathon/protein-ligand-design

收藏
Hugging Face2026-06-15 更新2026-05-31 收录
官方服务:

资源简介:

Protein-Ligand Design Gym(蛋白质-配体设计健身房)是一个用于工具使用强化学习的数据集,由Team JAMMY为poolside Laguna Hackathon开发。该数据集旨在教导大型语言模型(LLM)像计算化学家或蛋白质工程师一样推理,通过测量而非猜测来回答关于蛋白质和配体(小分子,如药物)的问题。数据集包含由Claude Opus 4.8生成的问题,这些问题涉及分子或蛋白质的属性(例如,分子量、药物相似性、蛋白质等电点等),并通过RDKit和Biopython等化学/生物学工具进行验证和计算,确保每个答案都有确切的、工具可验证的基础。数据集分为训练和测试分割,存储在parquet文件中,字段包括问题提示、候选分子/蛋白质(以SMILES或序列表示)、参数、工具认证的真实答案、模板、所需工具和推理过程。该环境支持蛋白质-配体相互作用分析,例如匹配子结构或搜索蛋白质基序,适用于药物发现和蛋白质工程任务。

Protein-Ligand Design Gym is a tool-use reinforcement learning dataset created by Team JAMMY for the poolside Laguna Hackathon. It teaches a large language model (LLM) to reason like a computational chemist or protein engineer by measuring, not guessing, in response to questions about proteins and ligands (small molecules, often drugs). The dataset includes questions generated by Claude Opus 4.8, focusing on properties of molecules or proteins (e.g., molecular weight, drug-likeness, protein isoelectric point) that are verified and computed using chemistry/biology tools like RDKit and Biopython, ensuring each answer has an exact, tool-verifiable ground truth. It is split into train and test sets stored in parquet files, with fields such as question prompts, candidate molecules/proteins (as SMILES or sequences), parameters, tool-certified answers, templates, required tools, and reasoning. The environment supports protein-ligand interaction analysis, e.g., substructure matching or protein motif searching, for drug discovery and protein engineering tasks.

搜集汇总
数据集介绍
poolside-laguna-hackathon/protein-ligand-design 数据集图片
构建方式
该数据集旨在构建一个强化学习环境,训练大语言模型模拟计算化学家与蛋白质工程师的推理过程。其构建方式始于利用Claude Opus 4.8自动生成关于分子或蛋白质的化学与生物学问题,随后通过RDKit和Biopython等工具对每个问题的答案进行严格验证,仅保留那些能够被工具唯一确定正确答案的样本。问题涉及配体的分子描述符、药物相似性、蛋白质理化性质及突变影响等多维度属性。最终以parquet格式划分为训练集和测试集,确保评估过程的客观性。
特点
该数据集的显著特点在于其工具驱动的验证机制。模型在回答问题时必须调用外部化学与生物学工具(如RDKit、Biopython)进行实际计算,而非凭借文本记忆推测答案。奖励机制仅基于答案的正确性,且所有真实答案均由相同工具计算得出,杜绝了作弊可能。数据集涵盖配体、蛋白质及两者交互的多种属性,包括分子量、亲脂性、氢键供体、等电点、BLOSUM62突变分数等,并提供了两个交互工具来探测配体-蛋白质之间的真实化学反应。
使用方法
用户可通过Python的datasets库便捷加载数据集,例如执行`ds = load_dataset("poolside-laguna-hackathon/protein-ligand-design")`,即可获得包含训练集和测试集的数据对象。每个样本包含问题、候选分子或蛋白质的SMILES/序列、参数、工具验证的答案及所需工具列表等字段。此外,数据集可作为强化学习环境直接使用,通过Prime Intellect平台运行评估,命令如`prime env install jdthewlis/protein-ligand-design`和`prime eval run jdthewlis/protein-ligand-design -m poolside/Laguna-XS.2 -n 20 -r 3`。
背景与挑战
背景概述
蛋白质与配体的相互作用是药物发现领域的核心研究主题,其中配体(多为小分子药物)与靶标蛋白的结合特性直接决定候选化合物的药效与安全性。传统的计算化学方法依赖专家经验进行分子性质评估,而大语言模型在处理此类结构化化学与生物学问题时,常因缺乏可验证的推理能力而陷入‘猜测式’回答。为此,Team JAMMY于2024年poolside Laguna黑客马拉松期间创建了Protein-Ligand Design Gym数据集,旨在通过工具增强的强化学习环境,训练语言模型像计算化学家一样调用RDKit与Biopython等专业工具对分子性质进行定量测量。该数据集由Claude Opus 4.8自动生成问题并经由工具认证,确保了答案的绝对可验证性,为药物设计领域的AI推理能力评估提供了首个高精度的基准。数据集发布后迅速引起关注,其‘测量而非猜测’的理念为AI驱动的药物发现开辟了新范式。
当前挑战
该数据集面临的核心挑战在于解决药物发现领域中分子性质预测的‘黑箱’困境——传统模型无法精确回答诸如化合物的脂溶性、药物相似性评分或蛋白质突变稳定性等需经计算才能获取的问题。数据集构建过程中,挑战尤为突出:一是自动化生成问题时需确保每一问题均能被至少一个化学/生物学工具给出确定性答案,需严格校验而过滤歧义项;二是工具调用环境需在纯CPU条件下实时计算数十种分子描述符(如LogP、TPSA、BLOSUM62突变分数等),对计算效率与精度提出严苛要求;三是训练时采用GRPO强化学习仅以最终答案正确性作为奖励信号,模型需学习复杂的工具调用策略而非简单记忆模式,这使得过拟合与泛化平衡成为难点。
常用场景
经典使用场景
在药物发现与蛋白质工程的前沿领域,蛋白质-配体设计数据集被广泛用于训练和评估大语言模型在化学与生物学工具调用方面的能力。该数据集以强化学习环境的形式呈现,要求模型面对某一分子或蛋白质及其相关问题时,能够调用RDKit和Biopython等专业计算工具,通过实际测量而非凭空猜测来获取答案。这种设定使得模型必须像计算化学家或蛋白质工程师一样进行推理,从而在分子描述符计算、药代动力学性质评估、蛋白质理化特性分析以及蛋白质-配体相互作用模式识别等经典任务中展现其工具使用与逻辑推理的综合能力。
解决学术问题
长期以来,大语言模型在科学领域的应用面临一个核心困境:模型能够理解分子与蛋白质的文本描述,却无法直接感知其内在的物理化学性质。蛋白质-配体设计数据集精准地解决了这一学术难题,它通过强制模型调用化学与生物学工具进行定量计算,将文本理解与数值验证紧密耦合。该数据集衍生出一系列关键研究问题,包括如何衡量分子类药性、评估蛋白质稳定性、计算序列相似性以及识别特定的结合基序,这些问题的解决推动了人工智能在科学推理与结构化知识应用领域的发展,为构建可验证、可解释的科学智能系统奠定了坚实的数据基础。
衍生相关工作
该数据集的发布催生了一系列具有影响力的相关工作。基于其强化学习环境,研究人员开发了面向科学工具调用的GRPO训练范式,通过正确答案奖励机制引导模型掌握工具使用的策略。Laguna模型作为该环境的经典实践者,经过微调后在分子性质预测与蛋白质分析任务中展现出显著的性能提升。此外,该工作还推动了verifiers框架在科学领域的发展,为构建可验证的智能体系统提供了标准化的评估蓝图,并启发了后续在分子逆合成分析、化学反应预测以及蛋白质设计等交叉领域中的工具增强型语言模型研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务