SupraBench/sid
收藏官方服务:
资源简介:
--- dataset_info: features: - name: interaction_id dtype: int64 - name: true_label dtype: string - name: true_letter dtype: string - name: source dtype: string - name: question dtype: string - name: answer dtype: string - name: prompt_strategy dtype: string - name: version dtype: string splits: - name: test num_bytes: 21925902 num_examples: 6510 - name: cb7 num_bytes: 3359100 num_examples: 651 download_size: 1823686 dataset_size: 25285002 configs: - config_name: default data_files: - split: test path: data/test-* - split: cb7 path: data/cb7-* ---
提供机构:
SupraBench搜集汇总
数据集介绍

构建方式
SID(Solvent Identification)数据集是SupraBench超分子化学基准体系中的一项子任务,专为多类别溶剂结构分类而设计。其数据源自SupraBank数据库中的主客体结合记录,每个样本包含一个分子识别相关的交互ID、真实标签、对应的字母标识、来源信息以及精心构造的问题与答案。数据集按照提示策略划分为base、cot和fewshot三个子集,分别对应直接推理、思维链推理和少样本推理场景,每个子集均保留了对CB[7]主客体泛化记录的标识。
特点
SID数据集的核心特色在于其为评估大语言模型在超分子化学溶剂识别能力上提供了首个标准化基准。该数据集共包含2172个样本,涵盖六类溶剂的分类任务。其独特的双标签体系(文本标签与字母标签)兼容了自然语言理解与符号推理的双重需求。不同提示策略的分割设计使得研究者能够系统性地剖析模型在不同推理范式下的表现差异,而主客体泛化记录的独立标识则为探讨模型的外推能力提供了珍贵素材。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载SID数据集,通过指定split参数为'base'、'cot'或'fewshot'来选择不同的提示策略场景。每条数据包含完整的渲染提示(question字段)和标准答案(answer字段),可直接用于模型推理与评估。对于端到端的基准测试,可配合SupraBench官方代码仓库执行完整的实验流程,其中包括任务配置、模型选择与结果评分模块。该数据集以CC-BY-4.0协议开放,为超分子化学领域的人工智能研究提供了可复现的评估基础。
背景与挑战
背景概述
超分子化学作为化学科学的前沿领域,聚焦于非共价相互作用驱动的主客体组装体系,其在药物递送、化学传感及体内毒素清除等关键领域展现出巨大应用潜力。然而,传统主客体系统的设计过程极为耗时,每对组合需数天进行干实验验证,严重制约了研究效率。为应对这一挑战,由Tianyi Ma、Yijun Ma等研究团队于2026年构建的SupraBench基准应运而生,其中包含的溶剂识别(SID)数据集是该基准的核心组成部分之一。SID数据集专注于从分子结构中进行六分类溶剂识别任务,旨在评估大型语言模型在超分子化学推理方面的能力。该数据集包含2172个样本,涵盖CB[8]、CB[7]、beta-CD等多种主体分子,并提供了base、cot、fewshot三种提示策略的分割版本,为研究不同提示方法对模型性能的影响提供了标准化测试平台。SID数据集的发布标志着LLM在科学推理领域评估范式的重大拓展,其开源许可(CC-BY-4.0)和基于SupraBank等权威来源的数据构建,确保了研究的可复现性与广泛适用性,对推动AI辅助超分子化学研究具有里程碑意义。
当前挑战
SID数据集所应对的核心领域挑战在于,超分子化学中溶剂环境对主客体相互作用的复杂调控机制长期缺乏高效的自动化解析工具,传统基于规则或计算化学的方法难以胜任大规模溶剂类型的快速准确判别。在构建过程中,研究团队面临多重技术难点:首先,数据来源的异构性要求从SupraBank等数据库中提取的原始记录需经严格清洗与规范化,以确保六类溶剂标签的一致性与准确性;其次,分子结构的表示多样性(如SMILES、2D/3D结构)为特征工程带来显著挑战,如何设计既能保留化学语义又适用于LLM处理的输入格式成为关键;此外,CB[7]等热门主体的泛化性验证子集设计需要平衡样本代表性,避免模型对特定主体的过拟合。当前模型在SID任务上的表现揭示了更深层的挑战:即便采用最先进的GPT-5.4、Gemini-3-Flash等模型,F1分数普遍低于0.4,平衡准确率最高仅达0.47,表明LLM在化学结构空间推理与溶剂分类的细粒度识别上仍存在显著能力鸿沟,亟需突破分子层次的理解瓶颈。
常用场景
经典使用场景
在超分子化学研究领域,溶剂环境的识别是理解主客体相互作用机理的关键环节。SupraBench/sid数据集专为溶剂识别任务设计,要求模型从给定的分子结构特征中准确判别六种常见的溶剂类别。该数据集共包含2172个标注样本,按照基础提示、思维链提示和少样本提示三种策略进行划分,为评估大语言模型在化学推理任务上的表现提供了标准化的测试平台。研究者可通过加载不同策略划分的数据集,系统性地分析模型在不同推理范式下的分类性能差异。
实际应用
在药物递送系统设计、化学传感开发和体内毒素隔离等实际应用中,准确识别溶剂环境对于预测分子组装行为至关重要。sid数据集驱动的模型可以快速自动判别实验条件下的溶剂类别,辅助化学家在虚拟筛选阶段排除不兼容的溶剂组合,从而缩短新型主客体复合物的设计周期。此外,该数据集还可集成到自动化实验工作流中,为机器人化学家提供实时的溶剂环境判断能力,实现从配方设计到条件优化的智能闭环控制。
衍生相关工作
基于sid数据集,学术界已衍生出多项标志性研究工作。该数据集是SupraBench基准测试框架的核心组件之一,与结合亲和力预测、最优结合体选择和主客体描述等任务共同构成了超分子化学推理的完整评估体系。论文中对八种前沿大语言模型在三种提示策略下的系统评测,揭示了当前模型在化学结构推理上的瓶颈,尤其是思维链提示策略在结合亲和力预测任务上未能弥补本质推理差距的重要发现。这些工作为后续开发领域自适应预训练语料库和专用化学推理模型指明了方向。
以上内容由遇见数据集搜集并总结生成



