遇见数据集

CGPeptides

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

CG-BGs(粗粒化玻尔兹曼生成器)是一个用于分子模拟的粗粒化数据集,旨在通过基于分子动力学(MD)轨迹训练的生成流,结合势能均值力(PMF)模型的重要性重加权,恢复分子系统的精确平衡统计。数据集包含四个分子系统:Mueller-Brown二维玩具势、丙氨酸二肽(Ala2)、三肽(Ala3)和六肽(Ala6),涵盖隐式溶剂和显式溶剂环境。数据按粗粒化映射(如heavy_atom包含所有非氢原子,core_beta包含骨架和Cβ原子)、PMF模型类型(基于无偏MD数据训练的pmf_ub和基于WT-MetaD数据训练的pmf_b)以及Boltzmann生成器类型(基于无偏MD数据训练的flow_ub和基于WT-MetaD数据训练的flow_b)进行组织。核心数据文件data.npz包含分子构象的位置、力、模拟盒向量、原子类型索引、有效节点掩码和势能等数组。此外,数据集还提供训练好的PMF模型参数(energy_params.pkl)、生成流参数(flow_params.pkl)以及带有重要性权重的生成样本(samples_and_weights.npz)。该数据集适用于分子构象生成、平衡态统计计算、粗粒化建模等任务,并与cg-bg代码库中的实验配置直接对应,支持通过Hydra解析器按需获取文件。

CG-BGs (Coarse-grained Boltzmann Generators) is a coarse-grained dataset for molecular simulations, designed to recover the exact equilibrium statistics of molecular systems through generative flows trained on molecular dynamics (MD) trajectories combined with importance reweighting via potential mean force (PMF) models. The dataset includes four molecular systems: the Mueller-Brown two-dimensional toy potential, alanine dipeptide (Ala2), tripeptide (Ala3), and hexapeptide (Ala6), covering both implicit and explicit solvent environments. The data is organized by coarse-grained mappings (e.g., `heavy_atom` encompasses all non-hydrogen atoms, `core_beta` includes backbone and Cβ atoms), PMF model types (`pmf_ub` trained on unbiased MD data and `pmf_b` trained on WT-MetaD data), and Boltzmann generator types (`flow_ub` trained on unbiased MD data and `flow_b` trained on WT-MetaD data). The core data file `data.npz` contains arrays such as positions, forces, simulation box vectors, atom type indices, valid node masks, and potential energies of molecular conformations. Additionally, the dataset provides trained PMF model parameters (`energy_params.pkl`), generative flow parameters (`flow_params.pkl`), and generated samples with importance weights (`samples_and_weights.npz`). This dataset is suitable for tasks including molecular conformation generation, equilibrium statistical calculation, and coarse-grained modeling, and directly matches the experimental configurations in the cg-bg codebase, supporting on-demand file retrieval via the Hydra parser.

创建时间:
2026-06-03
原始信息汇总

数据集概述:CG-Peptides (Coarse-Grained Boltzmann Generators)

许可证: MIT
论文: arXiv:2602.10637
代码仓库: github.com/tummfm/cg-bg

该数据集包含用于训练粗粒化(Coarse-Grained, CG)玻尔兹曼生成器(Boltzmann Generators)的分子动力学(MD)轨迹数据,并结合势平均力(PMF)模型进行重要性重加权,以恢复精确的平衡统计。

分子系统

数据集涵盖以下分子系统:

目录 系统 溶剂
MB/ Mueller-Brown 二维玩具势能
Ac-Ala-NHMe/ 丙氨酸二肽 (Ala2) 显式 + 隐式
Ac-Ala3-NHMe/ 丙氨酸三肽 (Ala3) 显式 + 隐式
Ac-Ala6-NHMe/ 丙氨酸六肽 (Ala6) 显式 + 隐式

目录结构

每个分子系统的目录结构如下(以 <molecule>/ 表示分子根目录):

<molecule>/ implicit/ data.npz # 隐式溶剂基线轨迹 *.pdb # 全原子参考结构 explicit/ <cg_mapping>/ # 粗粒化映射方案 <pmf_type>/ # PMF模型类型 <flow_type>/ # 生成器类型 data.npz energy_params.pkl flow_params.pkl samples_and_weights.npz *.pdb # 该CG映射下的参考结构

注意: 对于 MB/ 系统,省略 <cg_mapping> 层级,直接从 pmf_type/flow_type/ 开始。

粗粒化映射方案 (<cg_mapping>)

名称 描述 节点数 (Ala2 / Ala3 / Ala6)
heavy_atom 所有非氢原子 10 / 20 / —
core_beta 主链 + Cβ原子 6 / 12 / 24

PMF模型类型 (<pmf_type>)

名称 描述
pmf_ub 在无偏MD数据上训练的PMF模型
pmf_b 在Well-Tempered Metadynamics (WT-MetaD, γ=9)数据上训练的PMF模型

注意: pmf_ub 仅存在于 Ac-Ala-NHMe/explicit/heavy_atom/ 目录下。

生成器类型 (<flow_type>)

名称 描述
flow_ub 在无偏MD数据上训练的玻尔兹曼生成器
flow_b 在WT-MetaD (γ=1.5)数据上训练的玻尔兹曼生成器

数据文件说明

data.npz — 训练轨迹

MB 系统:

数组 形状 描述
R (N, 2) 位置坐标

丙氨酸显式溶剂:

数组 形状 描述
R (N, n_nodes, 3) 粗粒化位置 (单位: 埃)
F (N, n_nodes, 3) 粗粒化力
box (N, 3, 3) 模拟盒向量
species (N, n_nodes) 原子类型索引
mask (N, n_nodes) 有效节点掩码
U (N,) 势能

丙氨酸隐式溶剂:

数组 形状 描述
R (N, n_nodes, 3) 位置坐标
F (N, n_nodes, 3)
box (N, 3, 3) 盒向量
species (N, n_nodes) 原子类型索引
mask (N, n_nodes) 有效节点掩码
id (N,) 帧标识符
r0 (N,) 伞形约束中心
window (N,) 伞形窗口索引
subset (N,) 数据子集标签
energy_params.pkl — PMF模型参数

存储训练好的PMF/能量模型的JAX参数(参数树),用于第三阶段评估能量并计算重要性权重。

flow_params.pkl — 归一化流参数

存储训练好的玻尔兹曼生成器的JAX参数(参数树),由第一阶段产生,第二阶段采样时加载。

samples_and_weights.npz — 生成的样本及重要性权重

第二至第三阶段输出。包含与 data.npz 相同的空间数组,以及以下附加数组:

数组 描述
logp 生成器输出的对数提议概率
U PMF模型输出的势能
logw 对数重要性权重 (logw = -U/kT - logp)

数据集使用说明

每个叶目录对应一个实验配置。具体映射关系如下:

实验配置 路径
mb_ub MB/pmf_b/flow_ub/
mb_b MB/pmf_b/flow_b/
ala2_ha_ub Ac-Ala-NHMe/explicit/heavy_atom/pmf_b/flow_ub/
ala2_ha_b Ac-Ala-NHMe/explicit/heavy_atom/pmf_b/flow_b/
ala2_cb_ub Ac-Ala-NHMe/explicit/core_beta/pmf_b/flow_ub/
ala2_cb_b Ac-Ala-NHMe/explicit/core_beta/pmf_b/flow_b/
ala3_ha_ub Ac-Ala3-NHMe/explicit/heavy_atom/pmf_b/flow_ub/
ala3_cb_ub Ac-Ala3-NHMe/explicit/core_beta/pmf_b/flow_ub/
ala6_cb_ub Ac-Ala6-NHMe/explicit/core_beta/pmf_b/flow_ub/

文件可通过Hydra解析器按需获取(无需手动下载),需在 .env 文件中设置 HF_REPO_ID 以指向私有仓库。

搜集汇总
数据集介绍
CGPeptides 数据集图片
构建方式
CGPeptides数据集源于对粗粒化分子构象生成方法的研究,旨在为Boltzmann生成器提供训练与评估的基础数据。其构建基于分子动力学(MD)模拟轨迹,涵盖Mueller-Brown二维势能面、丙氨酸二肽、三肽及六肽等系统。数据按分子类型组织,区分隐式溶剂与显式溶剂环境,并针对显式溶剂进一步细分粗粒化映射(如重原子映射、主链加Cβ原子映射)、势平均力(PMF)模型类型及流模型类型。每个实验目录下存储了训练轨迹(data.npz)、PMF模型参数(energy_params.pkl)、流模型参数(flow_params.pkl)以及采样与重要性权重结果(samples_and_weights.npz),形成完整的粗粒化分子构象生成流程数据链。
使用方法
使用CGPeptides数据集时,用户需基于目录结构定位特定实验配置,例如丙氨酸二肽重原子映射下使用无偏数据训练的流模型对应路径为Ac-Ala-NHMe/explicit/heavy_atom/pmf_b/flow_ub/。数据文件通过Hydra配置系统中的${hf:repo_id,path}解析器按需获取,无需手动下载,仅需在.env文件中设置HF_REPO_ID指向私有仓库即可。各实验目录与configs/experiment/中的配置文件名一一对应,用户可参照README中的映射表直接调用。对于训练好的流模型,可通过加载flow_params.pkl进行构象采样,并利用energy_params.pkl计算重要性权重,以恢复精确的平衡态统计分布。
背景与挑战
背景概述
CGPeptides数据集的诞生源自于计算生物物理领域对高效分子构象采样的迫切需求。传统全原子分子动力学模拟虽能精确描述分子运动,却受限于巨大的计算代价,难以在生物相关时间尺度上探究蛋白质折叠等重要过程。由慕尼黑工业大学计算科学中心团队于2025年创建的CGPeptides数据集,以丙氨酸二肽、三肽和六肽为模型体系,系统收集了粗粒度分子动力学轨迹、势能函数及力场参数,为发展基于归一化流的玻尔兹曼生成器提供了标准化训练与评估基准。该数据集通过粗粒度表示与非平衡重要性采样技术,架起了机器学习与统计力学之间的桥梁,有望显著加速生物大分子的构象空间探索。
当前挑战
CGPeptides所面对的挑战首先源于分子模拟领域长期存在的采样难题:高能垒分隔的亚稳态构象间的转换往往超越常规模拟时间尺度,且全原子模型的计算复杂度随体系尺寸急剧增长。为此,数据集采用粗粒化策略降低自由度数,并引入正则化流模型生成构象,再通过势均值力模型进行重要性重加权以恢复精确平衡统计。在构建过程中,团队需要解决多套力场参数的一致性校准问题,包括显式与隐式溶剂环境的匹配、不同粗粒化映射精度(如重原子与主链加Cβ)的选择,以及无偏与偏置采样数据的融合优化,从而确保生成构象的物理可信度与多样性。
常用场景
经典使用场景
在计算生物学与分子模拟领域,CGPeptides数据集为粗粒化玻尔兹曼生成器(CG-BGs)的训练与评估提供了标准化的基准。该数据集涵盖了从丙氨酸二肽到六肽的多肽体系,包含显式和隐式溶剂环境下的分子动力学(MD)轨迹,并提供了粗粒化位置、力与势能等关键物理量。研究者可基于这些数据训练正则化流模型,以学习粗粒化构象空间的概率分布,并进一步结合势均值力(PMF)模型进行重要性重加权,从而精确恢复平衡态统计。其经典用途在于验证生成式模型在非平衡采样与自由能计算中的有效性,尤其适用于小分子肽构象空间的高效探索。
解决学术问题
该数据集直面传统分子模拟中采样子空间的高能量壁垒与稀有事件难以捕获这一关键难题。传统MD模拟往往受限于时间尺度,难以充分采样多肽构象空间中的亚稳态区域;而增强采样方法如WT-MetaD虽能加速探索,却面临权重计算与平衡态恢复的挑战。CGPeptides通过提供多种粗粒化映射(如全重原子与核心beta点位)及相应流动数据,支持训练基于流的生成模型以产生高概率构象样本,并结合PMF模型实现重要性重加权,从而在统计力学框架下高效且准确地获取平衡态系综。这一方法大大提升了自由能景观计算与多肽构象分布预测的精度与效率,为分子模拟理论的发展提供了坚实的数据基础。
实际应用
在实际应用中,得益于其收录的显式溶剂轨迹与多种粗粒化表示,CGPeptides数据集可被直接用于开发高效的多肽构象采样工具与蛋白质力场参数化流程。例如,计算化学家在研究柔性多肽的药物靶点结合过程时,可利用基于该数据集训练的生成模型快速生成高保真粗粒化构象,再通过反粗粒化映射还原为全原子结构,从而大幅缩减计算成本。此外,该数据集支持与现成模拟框架(如Hydra配置系统)无缝集成,使研究者能自动获取预训练模型参数,并用于新型生物分子体系的性质预测、理性设计或动态行为分析,进而加速功能肽段的结构发现与优化。
数据集最近研究
最新研究方向
CGPeptides数据集聚焦于粗粒化分子构象的生成与平衡统计恢复,其核心方法结合了基于分子动力学轨迹训练的流动模型(Boltzmann generators)与势均值力(PMF)模型的重要性重加权技术。当前前沿研究方向集中于利用该数据集探索复杂生物分子(如丙氨酸肽链)在多溶剂环境下的构象采样效率与精度,尤其在显式溶剂与隐式溶剂条件下,通过不同粗粒化映射策略(如重原子映射与主链+Cβ映射)及偏置采样方法(如元动力学增强的PMF训练)提升自由能面的覆盖。该数据集与深度学习驱动的分子模拟热点紧密关联,为发展更为普适的粗粒化模型提供了验证基准,其意义在于推动从特定小分子体系向更大尺度生物系统(如多肽、蛋白质)的统计力学精确建模,加速药物设计与生物物理机制研究中的计算密集任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务