CGPeptides
收藏资源简介:
CG-BGs(粗粒化玻尔兹曼生成器)是一个用于分子模拟的粗粒化数据集,旨在通过基于分子动力学(MD)轨迹训练的生成流,结合势能均值力(PMF)模型的重要性重加权,恢复分子系统的精确平衡统计。数据集包含四个分子系统:Mueller-Brown二维玩具势、丙氨酸二肽(Ala2)、三肽(Ala3)和六肽(Ala6),涵盖隐式溶剂和显式溶剂环境。数据按粗粒化映射(如heavy_atom包含所有非氢原子,core_beta包含骨架和Cβ原子)、PMF模型类型(基于无偏MD数据训练的pmf_ub和基于WT-MetaD数据训练的pmf_b)以及Boltzmann生成器类型(基于无偏MD数据训练的flow_ub和基于WT-MetaD数据训练的flow_b)进行组织。核心数据文件data.npz包含分子构象的位置、力、模拟盒向量、原子类型索引、有效节点掩码和势能等数组。此外,数据集还提供训练好的PMF模型参数(energy_params.pkl)、生成流参数(flow_params.pkl)以及带有重要性权重的生成样本(samples_and_weights.npz)。该数据集适用于分子构象生成、平衡态统计计算、粗粒化建模等任务,并与cg-bg代码库中的实验配置直接对应,支持通过Hydra解析器按需获取文件。
CG-BGs (Coarse-grained Boltzmann Generators) is a coarse-grained dataset for molecular simulations, designed to recover the exact equilibrium statistics of molecular systems through generative flows trained on molecular dynamics (MD) trajectories combined with importance reweighting via potential mean force (PMF) models. The dataset includes four molecular systems: the Mueller-Brown two-dimensional toy potential, alanine dipeptide (Ala2), tripeptide (Ala3), and hexapeptide (Ala6), covering both implicit and explicit solvent environments. The data is organized by coarse-grained mappings (e.g., `heavy_atom` encompasses all non-hydrogen atoms, `core_beta` includes backbone and Cβ atoms), PMF model types (`pmf_ub` trained on unbiased MD data and `pmf_b` trained on WT-MetaD data), and Boltzmann generator types (`flow_ub` trained on unbiased MD data and `flow_b` trained on WT-MetaD data). The core data file `data.npz` contains arrays such as positions, forces, simulation box vectors, atom type indices, valid node masks, and potential energies of molecular conformations. Additionally, the dataset provides trained PMF model parameters (`energy_params.pkl`), generative flow parameters (`flow_params.pkl`), and generated samples with importance weights (`samples_and_weights.npz`). This dataset is suitable for tasks including molecular conformation generation, equilibrium statistical calculation, and coarse-grained modeling, and directly matches the experimental configurations in the cg-bg codebase, supporting on-demand file retrieval via the Hydra parser.
数据集概述:CG-Peptides (Coarse-Grained Boltzmann Generators)
许可证: MIT
论文: arXiv:2602.10637
代码仓库: github.com/tummfm/cg-bg
该数据集包含用于训练粗粒化(Coarse-Grained, CG)玻尔兹曼生成器(Boltzmann Generators)的分子动力学(MD)轨迹数据,并结合势平均力(PMF)模型进行重要性重加权,以恢复精确的平衡统计。
分子系统
数据集涵盖以下分子系统:
| 目录 | 系统 | 溶剂 |
|---|---|---|
MB/ |
Mueller-Brown 二维玩具势能 | 无 |
Ac-Ala-NHMe/ |
丙氨酸二肽 (Ala2) | 显式 + 隐式 |
Ac-Ala3-NHMe/ |
丙氨酸三肽 (Ala3) | 显式 + 隐式 |
Ac-Ala6-NHMe/ |
丙氨酸六肽 (Ala6) | 显式 + 隐式 |
目录结构
每个分子系统的目录结构如下(以 <molecule>/ 表示分子根目录):
<molecule>/ implicit/ data.npz # 隐式溶剂基线轨迹 *.pdb # 全原子参考结构 explicit/ <cg_mapping>/ # 粗粒化映射方案 <pmf_type>/ # PMF模型类型 <flow_type>/ # 生成器类型 data.npz energy_params.pkl flow_params.pkl samples_and_weights.npz *.pdb # 该CG映射下的参考结构
注意: 对于 MB/ 系统,省略 <cg_mapping> 层级,直接从 pmf_type/flow_type/ 开始。
粗粒化映射方案 (<cg_mapping>)
| 名称 | 描述 | 节点数 (Ala2 / Ala3 / Ala6) |
|---|---|---|
heavy_atom |
所有非氢原子 | 10 / 20 / — |
core_beta |
主链 + Cβ原子 | 6 / 12 / 24 |
PMF模型类型 (<pmf_type>)
| 名称 | 描述 |
|---|---|
pmf_ub |
在无偏MD数据上训练的PMF模型 |
pmf_b |
在Well-Tempered Metadynamics (WT-MetaD, γ=9)数据上训练的PMF模型 |
注意: pmf_ub 仅存在于 Ac-Ala-NHMe/explicit/heavy_atom/ 目录下。
生成器类型 (<flow_type>)
| 名称 | 描述 |
|---|---|
flow_ub |
在无偏MD数据上训练的玻尔兹曼生成器 |
flow_b |
在WT-MetaD (γ=1.5)数据上训练的玻尔兹曼生成器 |
数据文件说明
data.npz — 训练轨迹
MB 系统:
| 数组 | 形状 | 描述 |
|---|---|---|
R |
(N, 2) |
位置坐标 |
丙氨酸显式溶剂:
| 数组 | 形状 | 描述 |
|---|---|---|
R |
(N, n_nodes, 3) |
粗粒化位置 (单位: 埃) |
F |
(N, n_nodes, 3) |
粗粒化力 |
box |
(N, 3, 3) |
模拟盒向量 |
species |
(N, n_nodes) |
原子类型索引 |
mask |
(N, n_nodes) |
有效节点掩码 |
U |
(N,) |
势能 |
丙氨酸隐式溶剂:
| 数组 | 形状 | 描述 |
|---|---|---|
R |
(N, n_nodes, 3) |
位置坐标 |
F |
(N, n_nodes, 3) |
力 |
box |
(N, 3, 3) |
盒向量 |
species |
(N, n_nodes) |
原子类型索引 |
mask |
(N, n_nodes) |
有效节点掩码 |
id |
(N,) |
帧标识符 |
r0 |
(N,) |
伞形约束中心 |
window |
(N,) |
伞形窗口索引 |
subset |
(N,) |
数据子集标签 |
energy_params.pkl — PMF模型参数
存储训练好的PMF/能量模型的JAX参数(参数树),用于第三阶段评估能量并计算重要性权重。
flow_params.pkl — 归一化流参数
存储训练好的玻尔兹曼生成器的JAX参数(参数树),由第一阶段产生,第二阶段采样时加载。
samples_and_weights.npz — 生成的样本及重要性权重
第二至第三阶段输出。包含与 data.npz 相同的空间数组,以及以下附加数组:
| 数组 | 描述 |
|---|---|
logp |
生成器输出的对数提议概率 |
U |
PMF模型输出的势能 |
logw |
对数重要性权重 (logw = -U/kT - logp) |
数据集使用说明
每个叶目录对应一个实验配置。具体映射关系如下:
| 实验配置 | 路径 |
|---|---|
mb_ub |
MB/pmf_b/flow_ub/ |
mb_b |
MB/pmf_b/flow_b/ |
ala2_ha_ub |
Ac-Ala-NHMe/explicit/heavy_atom/pmf_b/flow_ub/ |
ala2_ha_b |
Ac-Ala-NHMe/explicit/heavy_atom/pmf_b/flow_b/ |
ala2_cb_ub |
Ac-Ala-NHMe/explicit/core_beta/pmf_b/flow_ub/ |
ala2_cb_b |
Ac-Ala-NHMe/explicit/core_beta/pmf_b/flow_b/ |
ala3_ha_ub |
Ac-Ala3-NHMe/explicit/heavy_atom/pmf_b/flow_ub/ |
ala3_cb_ub |
Ac-Ala3-NHMe/explicit/core_beta/pmf_b/flow_ub/ |
ala6_cb_ub |
Ac-Ala6-NHMe/explicit/core_beta/pmf_b/flow_ub/ |
文件可通过Hydra解析器按需获取(无需手动下载),需在 .env 文件中设置 HF_REPO_ID 以指向私有仓库。




