遇见数据集

SupraDB-LigandScore

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

SupraDB-LigandScore是SupraBench特征数据集的一部分,由SupraEngineering计算流水线生成。该数据集专注于超分子化学领域,特别是CB[7](葫芦脲)主客体相互作用研究,旨在为配体评分提供机制性特征。数据内容包含13个预计算的配体相关评分特征,如电荷评分(S_charge)、疏水性评分(S_hydrophobic)、刚性评分(S_rigidity)、去溶剂化评分(S_desolvation)、堆积评分(S_packing)、形状评分(S_shape)、构象多样性评分(S_conformer_diversity)、玻尔兹曼浓度评分(S_boltzmann_concentration)以及惩罚性评分(S_bad)等。所有特征均为无单位的浮点数评分。数据表以inchikey作为主连接键,可与SupraDB-GEOM身份表及其他特征数据集(如SupraDB-PoseFeat和SupraDB-CavityScore)进行连接,以支持完整的超分子分析流水线。数据集规模为429140行,适用于配体筛选、结合亲和力预测、主客体相互作用机制研究等计算化学任务。数据来源于预计算的pickle文件(data/pool_full/features/scores.pkl),使用GLIDE 2025u2等软件工具在CRC计算环境中生成,并通过publish.py脚本发布。

SupraDB-LigandScore is part of the SupraBench feature dataset, generated by the SupraEngineering computational pipeline. This dataset focuses on the field of supramolecular chemistry, particularly the study of CB[7] (cucurbituril) host-guest interactions, aiming to provide mechanistic features for ligand scoring. The data includes 13 precomputed ligand-related scoring features, such as charge score (S_charge), hydrophobic score (S_hydrophobic), rigidity score (S_rigidity), desolvation score (S_desolvation), packing score (S_packing), shape score (S_shape), conformer diversity score (S_conformer_diversity), Boltzmann concentration score (S_boltzmann_concentration), and penalty score (S_bad). All features are unitless floating-point scores. The data table uses inchikey as the primary key for linking with the SupraDB-GEOM identity table and other feature datasets (e.g., SupraDB-PoseFeat and SupraDB-CavityScore) to support a complete supramolecular analysis pipeline. The dataset contains 429,140 rows and is suitable for computational chemistry tasks such as ligand screening, binding affinity prediction, and mechanistic studies of host-guest interactions. The data is sourced from precomputed pickle files (data/pool_full/features/scores.pkl), generated using software tools like GLIDE 2025u2 in a CRC computational environment, and released via the publish.py script.

创建时间:
2026-06-12
原始信息汇总

数据集名称

SupraDB-LigandScore

概述

SupraBench/SupraDB-LigandScore 是一个由 SupraEngineering 计算管道生成的超分子化学特征数据集,专注于 CB[7](葫芦脲[7])宿主-客体系统的配体筛选评分。数据集位于管道中的 Phase 1(全池配体仅评分)和 Phase 2(发布分割)阶段。

数据模式

数据集包含 14 列,其中 inchikey 是唯一连接键,用于与 SupraDB-GEOM(身份表)、SupraDB-CavityScoreSupraDB-PoseFeat 等其他特征数据集进行连接。

列名 数据类型 单位 含义
inchikey string 主要 InChIKey,跨 SupraDB-GEOM、LigandScore、CavityScore 和 PoseFeat 共享的连接键
name string 来自 SupraDB-GEOM 身份表的客体名称
smiles string 来自 SupraDB-GEOM 身份表的规范最大片段 SMILES
source string 优先去重后来自 SupraDB-GEOM 身份表的优胜来源
S_charge float32 无量纲分数 配体电荷分数,结合正式/部分正电荷定位
S_hydrophobic float32 无量纲分数 疏水性分数,源自 logP、疏水体积、疏水 SASA 分数和疏水原子分数
S_rigidity float32 无量纲分数 配体刚性分数,源自可旋转键计数
S_desolvation float32 无量纲分数 配体去溶剂化有利性分数,源自拓扑极性表面积
S_packing float32 无量纲分数 配体堆积分数,源自分子体积相对于 CB[7] 空腔体积
S_shape float32 无量纲分数 配体形状分数,源自回转半径、非球形性和紧凑性
S_conformer_diversity float32 无量纲分数 构象集中分数,有利于低构象多样性
S_boltzmann_concentration float32 无量纲分数 玻尔兹曼浓度分数,源自顶部构象系综权重质量
S_bad float32 无量纲分数 针对阴离子基团、高极性、柔性和非球形性的惩罚性分数

关键信息

  • 行数:429,140
  • 连接键inchikey 是唯一连接键,用于关联 SupraDB-GEOM、LigandScore、PoseFeat 和 CavityScore 数据集
  • 管道位置:Phase 1 全池配体仅评分(通过 score_nodock);Phase 2 发布分割
  • 计算环境:CRC(高性能计算集群)
  • 对接/软件环境:GLIDE 2025u2 / aISS 回退机制(如集成规范文档所述)
  • 构象坍塌:采用最高玻尔兹曼权重的构象;PoseFeat 保留 np.argmax(boltz) 处的真实姿态及其 boltzmann_weightdelta_e
  • 源 Pickle 文件data/pool_full/features/scores.pkl

数据来源和生成

  • 管道上游:Phase 0 的 SupraDB-GEOM 身份表
  • 生成命令/users/tma2/workspace/SupraDashboard/.venv/bin/python engineering/src/publish.py --pool-scores data/pool_full/features/scores.pkl --identity data/pool_full/guests.csv --out data/pub_full
  • 重新生成:通过重新运行 SupraEngineering/src/publish.py,使用相同的管道 pickle 输入和 --out 目标即可重新生成数据集

许可

license: other(其他许可,具体条款需查阅官方说明)

搜集汇总
数据集介绍
SupraDB-LigandScore 数据集图片
构建方式
SupraDB-LigandScore 数据集源于 SupraEngineering 计算管线的系统化产出,定位于管线中 Phase 1 阶段的全库配体无对接打分(score_nodock)以及随后的 Phase 2 发布拆分。该表以 InChIKey 作为唯一连接键,旨在与 SupraDB-GEOM 身份表及其他特征数据集实现无缝关联。构建过程中,基于 CB[7] 主客体化学体系,对大规模配体库进行多维物理化学性质计算,最终通过 publish.py 脚本整合并发布,生成包含 429,140 条记录的特征矩阵。
使用方法
使用 SupraDB-LigandScore 时,应通过 inchikey 列与 SupraDB-GEOM、SupraDB-CavityScore 及 SupraDB-PoseFeat 数据集进行连接,以构建完整的特征空间。下游用户可直接加载 features.csv 文件,并将各特征值视作管线中 constants.SCORE_NAMES 所定义的顺序化输出。如需复现该数据集,可在设置好 HF_TOKEN 认证环境后,运行 SupraEngineering 仓库中的 publish.py 脚本,指定相同的输入 pickle 文件与输出路径即可。
背景与挑战
背景概述
SupraDB-LigandScore数据集由SupraEngineering计算管线于近期创建,聚焦于超分子化学中葫芦[7]脲(CB[7])与配体的主客体结合机制。该数据集隶属于SupraBench系列,由相关研究机构在受CRC计算环境支持下开发,旨在通过13种机制评分(如电荷、疏水、刚性、去溶剂化等)量化配体与CB[7]空腔的结合倾向。数据集包含429,140条记录,每条以InChIKey为唯一标识,整合了GLIDE 2025u2与aISS对接软件的评分结果。作为超分子化学领域首个大规模、多维度的配体评分基准,SupraDB-LigandScore为机器学习模型预测主客体结合亲和力提供了标准化特征集,推动了计算超分子化学的发展。
当前挑战
该数据集的核心挑战在于解决超分子主客体识别领域长期存在的量化难题:传统的实验测定受限于通量,而计算方法需同时兼顾配体的电荷分布、疏水表面积、构象多样性等多维物理化学属性。构建过程中面临双重挑战:其一,需将结构多样性迥异的配体统一映射至CB[7]的空腔特征,确保评分函数的物理化学一致性;其二,处理原始计算数据时需应对分子构象的偏好性,通过Boltzmann加权选择最有利构象,并引入惩罚项(S_bad)以剔除不利结合模式。此外,数据规模庞大(近43万配体)对计算资源与质量控制提出高要求,管线中Phase 1的无对接全库评分与Phase 2的发布分割策略需平衡特征完备性与下游可复现性。
常用场景
经典使用场景
在超分子化学与计算化学交叉领域,SupraDB-LigandScore数据集专为评估CB[7]葫芦脲宿主与客体分子间的结合亲和力而构建。其最经典的使用场景在于利用13种机制评分特征(如电荷、疏水性、刚性与去溶剂化等)对客体分子的配体性质进行多维度量化表征,从而无需对接即可预测配体与CB[7]空腔的匹配程度。研究者通常将该数据集与SupraDB-GEOM身份表及其他特征数据集通过InChIKey进行联合分析,构建从分子结构到结合性能的映射关系,为后续的机器学习模型提供高质量的训练与验证基础。
解决学术问题
该数据集系统性地解决了超分子体系中对配体-宿主结合机制进行高通量预筛的学术难题。传统方法依赖耗时的分子对接或实验测定,而SupraDB-LigandScore通过引入电荷局域化、疏水体积分数、旋转键刚性等物理化学评分,实现了对429140种客体的快速特征化,显著提升了主客体结合亲和力预测的规模化效率。其意义在于弥合了理论计算与实验筛选间的鸿沟,为理解CB[7]空腔的选择性识别规律提供了标准化定量工具,进而推动了超分子化学中结构-活性关系研究的范式转变。
实际应用
在实际应用中,SupraDB-LigandScore广泛服务于药物递送系统与分子传感器的理性设计。例如,制药企业可借助该数据集的评分函数快速筛选能够封装治疗药物的CB[7]亲和配体,优化药物载体的稳定性和控释行为。此外,在环境监测领域,研究人员利用其疏水性与形状匹配特征,高效识别对特定污染物具有强结合能力的客体分子,从而开发新型超分子传感探针。该数据集还应用于高通量虚拟筛选平台,作为配体预筛选的第一阶段,大幅降低了后续实验验证的成本与周期。
数据集最近研究
最新研究方向
当前,超分子化学领域的研究热点聚焦于主客体体系的精准设计与高通量筛选。SupraDB-LigandScore数据集应运而生,它基于CB[7]葫芦脲主体与各类客体分子的结合机制,整合了电荷、疏水、刚性、去溶剂化、堆积、形状、构象多样性及玻尔兹曼浓度等13项物理化学评分特征,为无约束条件下的配体全库筛选提供了多维度的特征表示。这一数据集依托于GLIDE 2025u2高精度对接流程与CRP计算集群的规模化产出,能够与SupraDB-GEOM等系列表格通过InChIKey实现无缝关联,构建起完整的配体特征与结合构象知识图谱。通过量化药物化学和材料科学中常见的弱相互作用力,该数据集在机器学习驱动的超分子主体-客体结合亲和力预测方向上展现出突出潜力,有助于推动从实验室经验探索向数据驱动理性设计转型的范式变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务