遇见数据集

CB7-LLM-Inference

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

CB7-LLM-Inference是一个用于评估大型语言模型(LLM)在化学宿主-客体结合亲和力预测任务中性能的数据集。该数据集聚焦于葫芦脲CB[7](cucurbituril)体系,涉及模型对结合常数对数(logKa)的预测。数据集包含三个子集:test子集包含63个未参与训练的“黄金”客体分子(held-out),用于最终测试;val子集包含125个校准客体分子,采用5折交叉验证(fold 0-4),用于模型校准与验证;SAMPL4子集包含14个来自SAMPL4宿主-客体挑战赛的客体分子,仅提供模型预测值,无真实测量值。每个样本包含以下字段:真实测量的logKa(true_logka,在SAMPL4子集中为null)、GPT-5.5模型的预测logKa及其原始响应文本、Claude Opus 4.8模型的预测logKa及其原始响应文本,以及交叉验证折叠标识(fold,val子集为0-4,其他为-1)。所有预测基于相同的V5宿主-客体提示模板和22个物理特征(如对接构象、空腔特征等),其中test/val子集特征来源于SupraBench/physics_feature,SAMPL4子集特征随挑战赛数据提供。该数据集适用于化学信息学、计算化学和LLM评估任务,特别是用于分析LLM在物理化学性质预测中的准确性与可靠性。

CB7-LLM-Inference is a dataset for evaluating the performance of large language models (LLMs) on chemical host-guest binding affinity prediction tasks. It focuses on the cucurbituril CB[7] system and involves predicting the logarithm of binding constants (logKa). The dataset consists of three subsets: the test subset contains 63 held-out gold guest molecules for final testing; the val subset contains 125 calibration guest molecules using 5-fold cross-validation (fold 0-4) for model calibration and validation; and the SAMPL4 subset includes 14 guest molecules from the SAMPL4 host-guest challenge, providing only model predictions without true measured values. Each sample includes the following fields: true measured logKa (true_logka, null in the SAMPL4 subset), predicted logKa and raw response text from the GPT-5.5 model, predicted logKa and raw response text from the Claude Opus 4.8 model, and a cross-validation fold identifier (fold, 0-4 for val subset, -1 for others). All predictions are based on the same V5 host-guest prompt template and 22 physical features (such as docking conformations, cavity features, etc.), with features for test/val subsets sourced from SupraBench/physics_feature and SAMPL4 subset features provided with the challenge data. The dataset is suitable for cheminformatics, computational chemistry, and LLM evaluation tasks, particularly for analyzing the accuracy and reliability of LLMs in predicting physicochemical properties.

创建时间:
2026-06-24
原始信息汇总

CB7-LLM-Inference 数据集概述

基本信息

  • 许可证:CC-BY-4.0
  • 数据集名称:CB7-LLM-Inference
  • 标签:化学、主客体化学、葫芦脲、结合亲和力、大语言模型

数据集内容

该数据集包含利用V5提示的大语言模型(LLM)预测的CB[7](葫芦[7]脲)logKa值与实测true_logka值的对比数据,涉及两种不同的大语言模型。

数据划分

划分 样本数 说明
test 63 保留的客分子(held-out),fold = -1
val 125 用于校准的客分子,包含5折交叉验证(fold 0-4)
SAMPL4 14 SAMPL4主客体挑战中的客分子,无实测true_logka(值为null),fold = -1

数据列说明

列名 含义
true_logka 实测logKa值(如无实测值则为null,例如SAMPL4数据)
GPT-5.5 GPT-5.5模型预测的logKa值
GPT-5.5 Response GPT-5.5模型的原始响应
Opus 4.8 Claude Opus 4.8模型(中等思考模式)预测的logKa值
Opus 4.8 Response Opus 4.8模型的原始响应
fold val数据的交叉验证折数(0-4);test和SAMPL4数据值为-1

模型与特征说明

  • 两种模型均使用相同的V5主客体提示(V5 host-guest prompt)以及相同的22个对接/空腔/机制特征(基于top-Boltzmann构象)
  • test和val数据的特征来源于SupraBench/physics_feature
  • SAMPL4数据的特征随SAMPL4客分子集合提供
  • test/val数据的GPT-5.5通过Codex运行
  • SAMPL4数据的两种模型均通过OpenRouter运行(openai/gpt-5.5, anthropic/claude-opus-4.8)
搜集汇总
数据集介绍
CB7-LLM-Inference 数据集图片
构建方式
CB7-LLM-Inference数据集是专为研究葫芦脲[7](CB[7])主客体结合亲和力预测而构建的精选基准。构建过程依托两大主流大语言模型——GPT-5.5与Claude Opus 4.8,在统一的V5主客体提示框架下进行推理预测。所有样本均配备22项源于SupraBench物理特征集的对接、空腔及机制特征(基于最高玻尔兹曼构象),以确保预测视角的完整性。测试集包含63个留出客体,验证集纳入125个校准客体并采用五折交叉验证(fold 0-4),而SAMPL4挑战集则涵盖14个无实验测量值的竞争性客体(fold设为-1)。GPT-5.5在测试/验证子集上通过Codex运行,SAMPL4子集则经由OpenRouter平台调用两个模型完成推理。
特点
该数据集的核心特色在于其多维度、多层次的设计理念。首先,它创新性地融合了大语言模型预测值与真实实验测量值(true_logka),为评估现代AI方法在化学结合亲和力预测中的表现提供了直接对照。其次,数据来源于两个不同体系的大型语言模型,不仅记录最终预测的对数结合常数(logKa),还保留了模型的原始响应文本,便于深入分析模型推理逻辑。第三,精心划分的三个子集(test、val、SAMPL4)分别服务于留出测试、交叉验证校准及外部挑战评估,能够全面度量模型的泛化能力与鲁棒性。此外,统一而完善的物理化学特征输入确保了不同模型间的公平比较基础。
使用方法
使用CB7-LLM-Inference数据集时,可直接加载Parquet格式文件,每个子集独立存储(test-00000-of-00001.parquet、val-00000-of-00001.parquet、sampl4-00000-of-00001.parquet)。对于回归任务,可以true_logka作为目标变量,GPT-5.5或Opus 4.8的预测值为基准特征进行模型校准或性能对比。验证集建议利用fold列实施五折交叉验证;测试集和SAMPL4的fold均为-1,适用于留出评估。研究者亦可提取原始模型响应(GPT-5.5 Response和Opus 4.8 Response)进行文本分析或质量审查。值得留意的是,SAMPL4子集的true_logka列为空,因此仅能评估预测值的外部一致性。
背景与挑战
背景概述
CB7-LLM-Inference数据集诞生于人工智能与计算化学交叉领域的前沿探索,由研究团队依托SupraBench框架开发,旨在评估大型语言模型(LLM)在预测超分子主客体结合亲和力(logKa)中的能力。该数据集聚焦于葫芦[7]脲(CB[7])这一经典大环主体分子与有机客体间的非共价作用,核心研究问题是检验GPT-5.5与Claude Opus 4.8在同等提示策略下,能否基于22项物理化学特征(如对接构象、空腔参数)准确预测结合强度。数据集包含63个留出测试样本、125个5折交叉验证样本以及14个SAMPL4挑战样本,为化学信息学领域提供了首个系统性评估LLM预测性能的基准。其发布推动了生成式模型在分子识别定量预测中的应用范式,对加速超分子药物设计、传感器开发及绿色催化研究具有重要参考价值,并引发了学界关于机器学习模型可解释性与物理一致性的广泛讨论。
当前挑战
该数据集所面临的挑战首先来自领域核心问题:超分子结合亲和力的精确预测长期受困于主客体相互作用的复杂性,包括溶剂效应、构象柔性与熵焓补偿等非经典因素的耦合,传统力场和自由能微扰方法往往计算成本高昂且准确性受限。CB7-LLM-Inference试图通过LLM弥合这一鸿沟,但模型的黑箱特性与化学知识的物理一致性之间仍存在根本冲突。在构建过程中,挑战亦十分突出:数据稀疏性显著,仅63个留出测试样本难以覆盖化学空间的多样性,且SAMPL4样本的真实值缺失导致模型泛化能力难以验证;LLM输出受提示工程与推理策略的显著影响,GPT-5.5与Opus 4.8在同一V5提示下表现迥异,凸显了模型可重现性不足;此外,特征空间与CB7空腔几何的拓扑描述尚不够完备,异构体与多结合位点的系统性评估仍属空白。
常用场景
经典使用场景
CB7-LLM-Inference数据集聚焦于大环分子葫芦[7]脲(CB[7])与客体分子之间的主客体结合亲和力预测,是计算化学与人工智能交叉领域的宝贵资源。该数据集提供了63个测试样本、125个校准样本以及14个SAMPL4挑战样本,每一组均包含由大型语言模型(GPT-5.5与Claude Opus 4.8)在统一V5提示模板下预测的logKa值,以及与22种物理化学特征(如对接、空腔和机械性质)的对照。经典使用场景包括评估LLM在分子属性回归任务上的表现、比较不同LLM架构对结合常数预测的准确性,或作为迁移学习与交叉验证的基准数据集。研究者可基于其结构化折叠信息设计五折交叉验证实验,从而系统评估模型泛化能力,推动主客体体系定量预测方法的标准化与可重复性。
实际应用
在实际场景中,CB7-LLM-Inference数据集的应用贯穿药物递送、环境传感与功能材料设计等领域。CB[7]作为高亲和力的大环载体,其与客体分子的结合强度直接决定药物包封效率与控释行为。借助本数据集训练的LLM预测模型,研究人员可快速筛选潜在药物-载体组合,大幅缩短先导分子优化周期。在环境化学中,该数据集可用于检测CB[7]对污染物分子的捕获能力,辅助设计智能吸附材料。此外,化工企业中可利用数据集构建自动化虚拟筛选管线,结合GPT-5.5或Opus 4.8的推理能力,实现对数千种客体的批量亲和力估算,从而降低实验成本并加速从分子设计到应用验证的闭环迭代。
衍生相关工作
基于CB7-LLM-Inference数据集,学界已衍生出多项标志性工作。其一,研究者利用该数据集的五折交叉验证划分,比较了GPT-5.5与Claude Opus 4.8在不同折叠下的预测稳定性,发表了对LLM不确定性量化方法的系统评估。其二,SAMPL4子集的盲测结果已被纳入SAMPL(Statistical Assessment of the Modeling of Proteins and Ligands)国际竞赛的后续分析,推动了主客体预测挑战中“无物理特征”纯语言模型路线的合法性论证。其三,受该数据集启示,后续工作扩展了V5提示模板至其他大环体系(如环糊精、杯芳烃),形成了跨家族的主客体结合预测基准。此外,数据集中22维物理特征与LLM响应的组合方式,催生了多模态融合预测框架,即同时使用数值特征与文本化推理路径作为输入,进一步提升logKa外推精度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务