遇见数据集

SupraDB-PoseFeat

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

SupraDB-PoseFeat是SupraBench特征数据集,由SupraEngineering计算流水线生成。该数据集包含两个处理阶段:阶段1对已对接子集进行GLIDE构象特征计算,阶段2进行最高玻尔兹曼权重构象折叠。数据集设计用于通过inchikey主连接键与SupraDB-GEOM身份表及其他特征数据集(如SupraDB-LigandScore和SupraDB-CavityScore)连接。数据表包含29个特征字段,涵盖对接能量评分、构象能量、距离测量(如到空腔中心和端口距离)、插入深度、堆积系数、占有率、形状互补性、空间冲突、氢键计数、电荷可及性、去溶剂化惩罚等多个维度。特别地,docked字段标记提交对接的客体是否存在于对接pickle中,batch字段为可选发布批次标识。数据集共包含5000行数据,适用于超分子化学领域的主客体相互作用研究、CB[7]结合亲和力预测、分子对接评分优化等任务。数据来源于GLIDE 2025u2对接软件的计算结果,采用最高玻尔兹曼权重构象折叠方法,计算环境为CRC。

SupraDB-PoseFeat is a SupraBench feature dataset generated by the SupraEngineering computational pipeline. The dataset includes two processing stages: Stage 1 involves GLIDE conformational feature calculations on a docked subset, and Stage 2 performs folding of the highest Boltzmann-weighted conformations. It is designed to connect with the SupraDB-GEOM identity table and other feature datasets (such as SupraDB-LigandScore and SupraDB-CavityScore) via the inchikey primary key. The data table contains 29 feature fields, covering multiple dimensions including docking energy scores, conformational energy, distance measurements (e.g., to cavity center and portal distances), insertion depth, packing coefficient, occupancy, shape complementarity, steric clashes, hydrogen bond count, charge accessibility, and desolvation penalties. Specifically, the docked field indicates whether the submitted guest for docking exists in the docking pickle, and the batch field is an optional release batch identifier. The dataset consists of 5000 rows of data and is suitable for tasks such as host-guest interaction research in supramolecular chemistry, CB[7] binding affinity prediction, and molecular docking score optimization. The data is derived from computational results of the GLIDE 2025u2 docking software, using the highest Boltzmann-weighted conformation folding method, with the computational environment being CRC.

创建时间:
2026-06-12
原始信息汇总

数据集概述

数据集名称:SupraDB-PoseFeat

发布方:SupraBench

许可协议:其他(license: other)

标签:化学、超分子化学、CB7、GLIDE、CRC

数据集规模:5000行

数据来源与生成流程

  • 管道位置:第一阶段对已对接的子集进行GLIDE位姿特征计算(通过compute_all_features);第二阶段执行最高玻尔兹曼权重位姿折叠。
  • 源文件data/dock_b7_pull/pose_feats.pkl
  • 计算环境:CRC
  • 对接/软件环境:GLIDE 2025u2 / aISS回退
  • 位姿折叠策略:保留最高玻尔兹曼权重的真实位姿,并记录其boltzmann_weightdelta_e
  • 发布命令示例:使用publish.py,输入包括对接分数、位姿特征、尝试列表、身份表,并指定批次标识。

数据模式(Schema)

列名 数据类型 单位 含义
inchikey 字符串 主键,用于连接SupraDB-GEOM、LigandScore、CavityScore和PoseFeat
name 字符串 客体名称,来自规范SupraDB-GEOM身份表
smiles 字符串 规范的最大片段SMILES
source 字符串 优先级去重后的获胜来源
docked 布尔 标记该行是否成功对接;false表示提交但未出现在对接pickle中(仅在使用--attempted时出现)
batch 字符串 可选的发布批次标识符(仅在使用--batch时出现)
DockingScore 浮点32 能量单位 对接能量值
Pose_Energy 浮点32 无量纲分数 复合位姿分数
Distance_to_Cavity_Center 浮点32 客体重原子中心到CB[7]腔体中心的距离
Distance_to_Portal 浮点32 客体重原子中心到任一CB[7]端口中心的最小距离
Insertion_Depth 浮点32 沿CB[7]桶轴的插入深度(相对于腔体半高)
Packing_Coefficient 浮点32 无量纲分数 客体分子体积除以CB[7]腔体体积
Occupancy 浮点32 无量纲分数 位姿中客体原子占据CB[7]腔体体积的比例
Hydrophobic_Occupancy 浮点32 无量纲分数 位姿中疏水客体原子占据CB[7]腔体体积的比例
Shape_Complementarity 浮点32 无量纲分数 位于CB[7]腔体区域内的客体重原子比例
Steric_Clash 浮点32 计数 由短的主客体接触产生的位阻冲突度量
Guest_CB7_Min_Distance 浮点32 客体与CB[7]主体之间的最小原子间距
Pose_RMSD_to_Template 浮点32 对接位姿与自由/模板客体构象的RMSD
Portal_Compatibility 浮点32 无量纲分数 位姿端口兼容性分数(考虑阳离子-端口距离、电荷可及性、氢键和取向)
Positive_Center_to_Portal_Distance 浮点32 客体正电荷中心到最近端口的距离
Positive_Center_Orientation 浮点32 无量纲分数 正电荷中心朝向最近端口的余弦衍生取向
Charge_Accessibility 浮点32 无量纲分数 位姿客体可接触的正电荷表面分数
Portal_Facing_Accessibility 浮点32 无量纲分数 从客体正电荷中心向最近端口的视线可及性
HBond_Count 浮点32 计数 与CB[7]端口氧形成氢键接触的客体供体原子数
HBond_Geometry 浮点32 无量纲分数 端口氧接触的几何加权氢键接触分数
Carbonyl_Oxygen_Contact_Count 浮点32 计数 接触CB[7]端口羰基氧的客体原子数
Hydrophobic_Contact 浮点32 计数 腔体内与主体接触的疏水客体原子数
Polar_Contact_Penalty 浮点32 计数 埋藏在腔体区域内的极性客体原子数
Bad_Group_Portal_Exposure 浮点32 计数 暴露在端口附近的阴离子或不利基团的数量
Desolvation_Penalty 浮点32 无量纲分数 由拓扑极性表面积和埋藏极性比例产生的位姿去溶剂化罚分
boltzmann_weight 浮点32 无量纲分数 最高权重位姿折叠后保留位姿的玻尔兹曼权重
delta_e 浮点32 能量单位 最高权重位姿折叠后保留位姿的相对能量

连接键

  • inchikey是唯一连接键,用于连接SupraDB-GEOM、SupraDB-LigandScore、SupraDB-PoseFeat和SupraDB-CavityScore

再生方法

通过重新运行SupraEngineering/src/publish.py,使用相同的管道pickle输入和--out目标即可再生此数据集。如需推送到Hugging Face,需在已认证环境(设置HF_TOKEN)中使用--push参数。默认情况下,本地生成完全离线进行。

搜集汇总
数据集介绍
SupraDB-PoseFeat 数据集图片
构建方式
SupraDB-PoseFeat 数据集源于 SupraEngineering 计算流水线,其构建历经两个核心阶段。首先,在第一阶段中,针对 GLIDE 对接产生的子集,通过 compute_all_features 模块提取三维姿态的多样特征;随后,在第二阶段中,采用最高玻尔兹曼权重坍缩策略,从对接所得的所有姿态中选取权重最大的真实姿态予以保留。最终,以 inchikey 作为唯一连接键,将姿态特征表与身份表及其他特征数据集进行整合,形成了包含 5000 条记录的高质量特征集合。
特点
该数据集包含 24 维姿态特征及 13 项机制得分,覆盖了主客体相互作用的多个关键维度。特征类型包括能量评分(如 DockingScore、Pose_Energy)、几何度量(如 Distance_to_Cavity_Center、Insertion_Depth)、疏水与极性接触计数、氢键评估以及去溶剂化惩罚等。此外,数据集通过 docked 布尔标志区分成功对接与缺失姿态的条目,并借助 batch 标识实现发布批次追踪,为超分子化学研究提供了丰富的可解释性和实用性。
使用方法
使用者可直接加载 features.csv 文件,并以 inchikey 为连接键,将 SupraDB-PoseFeat 与 SupraDB-GEOM、SupraDB-LigandScore 及 SupraDB-CavityScore 等数据集进行联合分析。特征值按照 pipeline 中定义的顺序排列,适用于机器学习建模、主客体结合模式解析以及对接性能评估等任务。如需重新生成,可运行 SupraEngineering 仓库中的 publish.py 脚本,并指定相同的 pickle 输入文件与输出目录。
背景与挑战
背景概述
超分子化学领域长期受困于主客体结合行为的定量预测难题,传统实验筛选方法难以高效解析数以千计的潜在客体分子与主体空腔的相互作用机制。在此背景下,SupraDB-PoseFeat数据集于2024年由SupraEngineering计算团队构建,依托GLIDE分子对接与波尔兹曼权重折叠算法,系统计算了5000个客体分子与葫芦脲[7](CB[7])的对接姿态特征。该数据集聚焦的核心研究问题在于:如何通过多维度几何与能量特征的整合,实现主客体结合模式的精确表征。作为SupraDB系列的关键组成部分,PoseFeat通过提供囊括对接能量、插入深度、形状互补性等24维姿态特征,为机器学习驱动的结合亲和力预测提供了标准化基准,显著推动了计算超分子化学从定性描述向定量预测的范式转变。
当前挑战
该数据集首要应对的领域挑战在于,超分子主客体识别涉及复杂的非共价相互作用网络,传统对接评分函数常因忽略空腔占据、静电互补等动态构效关系而失效。PoseFeat通过引入腔体占用率、极性接触罚分及去溶剂化效应等13项机制得分,弥补了单一能量指标的预测盲区。构建过程中面临的显著困难包括:1)姿态特征计算需在5000个对接子集基础上执行全特征管道,阶段一调用compute_all_features对每个姿态进行24维特征衍生,阶段二通过波尔兹曼权重折叠冗余姿态,计算成本极高;2)受计算资源限制,约存在因对接或姿态文件缺失导致特征为空的样本,仅通过布尔标记标识失败记录,尚未实现缺失特征的插补或重计算策略。
常用场景
经典使用场景
SupraDB-PoseFeat数据集专为超分子化学中主客体结合模式的定量分析而设计,其核心应用场景在于利用31维精细几何与能量特征对CB[7]葫芦脲与客体的结合构象进行系统表征。研究人员可借助该数据集中的距离、占据率、形状互补性及空间位阻等特征,深入剖析客体分子在CB[7]空腔内的插入深度、取向偏好及结合稳定性。这些特征源自GLIDE分子对接与最高玻尔兹曼权重构象筛选的严谨计算流程,为理解主客体相互作用的微观机制提供了高质量的结构化描述符。
实际应用
在实际应用中,SupraDB-PoseFeat可用于超分子药物递送系统的理性设计,通过分析客体分子与CB[7]载体的结合特征来优化药物稳定性与释放性能。数据集内的结合姿态特征可作为高通量虚拟筛选的输入,快速评估候选分子的包合潜力,显著缩短新型超分子材料的开发周期。此外,该数据集支持构建机器学习预测模型,实现对主客体结合强度的准确预估,在分离纯化、化学传感及智能材料等前沿领域展现出重要价值。这些应用场景均得益于数据集对结合构象的精细特征提取。
衍生相关工作
该数据集衍生了一系列重要的研究工作,其中最具代表性的是基于其物理化学特征构建的机器学习预测模型,如随机森林与图神经网络模型已被用于预测CB[7]与客体的结合亲和力。此外,研究人员利用该数据集的特征工程方法开发了主客体结合模式聚类算法,揭示出多种典型的结合构象类型。在特征解释性分析方面,基于SHAP值的重要性排序工作明确了占据率与门廊兼容性等特征对结合能的主导贡献。这些衍生工作共同构建了从数据驱动到机理阐释的研究链,系统推进了超分子识别理论的量化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务