遇见数据集

SupraBench/tbs

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: string - name: task dtype: string - name: answer dtype: string - name: correct_molecule dtype: string - name: options list: string - name: options_logka list: float64 - name: host_name dtype: string - name: version dtype: string - name: question dtype: string - name: source dtype: string - name: prompt_strategy dtype: string splits: - name: test num_bytes: 14349314 num_examples: 6792 - name: cb7 num_bytes: 1249121 num_examples: 600 download_size: 2544347 dataset_size: 15598435 configs: - config_name: default data_files: - split: test path: data/test-* - split: cb7 path: data/cb7-* ---

提供机构:
SupraBench
搜集汇总
数据集介绍
SupraBench/tbs 数据集图片
构建方式
本数据集源自SupraBench基准测试框架,旨在评估大语言模型在超分子主客体化学推理任务中的表现。Top-Binder Selection(TBS)任务聚焦于从四个候选客体分子中挑选出与给定主体结合最强的分子。数据来源于公开的超分子结合数据库SupraBank,每条记录包含了主体名称、候选分子的SMILES结构及实验测得的结合常数(log K_a),并据此确定正确答案。数据集依据提示策略分为base、cot和fewshot三个子集,每个子集包含2264个样本,使其能够系统考察不同提示方式对模型推理能力的影响。
特点
TBS数据集具有鲜明的领域专属性与任务结构化特征。作为首个针对超分子主客体化学的基准数据集,其独特之处在于将定量结合亲和力预测转化为多选分类任务,降低了模型输出的复杂度。数据集设计了三种提示策略:基础提示(base)、思维链提示(cot)和少样本提示(fewshot),以便全面评估不同推理范式下的模型表现。同时,数据集中保留了CB[7]等代表性主体的泛化子集,使得跨主体迁移能力的评测成为可能,为揭示模型在分子识别推理中的优势与短板提供了关键线索。
使用方法
用户可通过HuggingFace Datasets库直接加载使用。加载时需指定所需提示策略的分割名称(base、cot或fewshot),每条样本包含完整的渲染问题(question字段)和参考标签(answer字段)。为进行完整的基准测试,建议使用配套的代码仓库执行端到端的推理与评分流程:用户需要准备任务配置文件与模型配置文件,并通过命令行执行主脚本,自动完成批量预测与指标计算。数据集采用CC-BY-4.0许可协议,便于科研与教学场景下的便捷使用与二次开发。
背景与挑战
背景概述
超分子化学研究非共价键驱动的主-客体组装行为,其在药物递送、化学传感及体内毒素清除等领域展现出广阔应用前景。然而,传统的主-客体系统设计依赖逐对干实验验证,周期长达数天,成为制约该领域发展的核心瓶颈。为应对这一挑战,Tianyi Ma等人于2026年构建了SupraBench基准测试集,其中Top-Binder Selection(TBS)任务作为核心子集之一,旨在评估大语言模型从四个候选客体分子中识别最优结合体的能力。该数据集由美国多所高校联合创建,依托SupraBank、Europe PMC及PubChem等开源资源,涵盖2264个标注样本及多种提示策略变体,为超分子化学的智能化推理开辟了全新评估范式,对推动人工智能在化学领域的交叉研究具有里程碑意义。
当前挑战
TBS数据集面临的核心挑战源于超分子化学推理的复杂性:分子间非共价相互作用涉及疏水效应、氢键网络及构象柔性等多维度因素,传统规则或简单模型难以精准刻画结合亲和力的微妙差异,而大语言模型需在有限训练数据中掌握这类隐式化学知识。在数据集构建层面,挑战尤为严峻:从SupraBank等异构数据源整合标准化结合常数需克服单位不统一与测量偏差问题;设计四选一选择题时需确保干扰项具有化学合理性,避免模型依赖表层特征;此外,当前最先进的模型(如Gemini-3-Flash)在TBS任务上的最佳准确率仅达51.3%,远未达到实用阈值,提示现有语言模型在分子结构-性质关系推理中存在系统性短板。
常用场景
经典使用场景
在超分子主客体化学这一交叉学科中,Top-Binder Selection(TBS)数据集被广泛用于评估和提升大语言模型的多选推理能力。该任务要求模型从四个候选客体分子中准确挑选出与给定主体结合能力最强的分子,其本质是对非共价相互作用强度的排序判断。数据集中包含了基于实验测量结合常数(log Kₐ)的准确标注,并以自然语言问答形式呈现,既可用于零样本推理测试,也支持思维链(CoT)和少样本(few-shot)提示策略的剖析。TBS数据集因此成为衡量语言模型在复杂科学语境下进行结构化选择与比较推理的经典基准。
解决学术问题
TBS数据集直面超分子化学领域中一个长期存在的学术瓶颈:如何快速、准确地预测多客体竞争下的最优结合分子。传统方法依赖分子模拟或实验筛选,耗时且成本高昂,而语言模型在此任务上的表现揭示了其在化学知识提取与推理上的显著不足——即使在表现最好的模型上,TBS准确率也仅约50%。该数据集的提出,系统性地暴露了当前大语言模型在涉及专精非共价相互作用知识时存在的推理鸿沟,引发了学界对模型在科学问答中是否真正具备化学直觉的深入反思,推动了科学推理能力评估范式的革新。
衍生相关工作
TBS数据集的发布催生了一系列后续研究,包括针对超分子领域的领域自适应预训练语料SupraCorpus,以及多任务联合评估框架的构建。同时,该数据集也成为检验链式思维提示、少样本学习和模型规模缩放等通用技术效力在科学问答中表现的重要实验平台。在此基础上,研究者进一步探索了结合分子结构与语言信息的跨模态模型,尝试通过注入2D/3D分子特征来补足语言模型在非共价作用感知上的短板。TBS作为SupraBench基准中的核心任务之一,深刻影响了后续化学语言模型评测标准的设立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务