Incorporating prior knowledge in the seeds of adaptive sampling molecular dynamics simulations of ligand transport in enzymes with buried active sites
收藏资源简介:
00_Caver.tar.gz - Contains CAVER (https://caver.cz/fil/download/manual/caver_userguide.pdf) input and output files used for identification of transport pathways in LinB86(PDB ID: 5LKA). final_clustering├── tunnel_custers # contains caver output files for individual tunnels clusters │ ├── ...├── analysis # contains .csv output files for botttlenecks and tunnels charecteristics of individual tunnels clusters │ ├── ... 01_CaverDock_Tunnels_Profile.tar.gz - Contains tunnel clusters consisting of the top 100 tunnels and the CaverDock analysis files obtained. # Each folder (tun_cluster_p1a, tun_cluster_p1b, tun_cluster_p2, tun_cluster_p3) contains input raw files used for CaverDock calculations for individual snapshots of the respective tunnel clusters named as stripped_system*. The details of those files are:- calculations/*/caverdock.conf : The config file input for caverdock calculation. - calculations/*/DBE.pdbqt : Input file for the substrate DBE.- calculations/*/stripped_system*.pdbqt : Input file for the Protein/Receptor- calculations/*/stripped_system*.dsd : Tunnel discretization file. Notes: - calculations/*/stripped_system*.pdb : PDB file for the tunnel. 02_Minimization_and_Equilibration.tar.gz - Contains input and output files used for AMBER minimization and equilibration of the molecular systems and seed conformations used for adaptive sampling simulations. 03_HTMD_Bulk - separate Zenodo repository, see below for the link. Contains input, output and restart files used for HTMD (High-throughput molecular dynamics) adaptive sampling simulations at 310K for Bulk schemes. 04_HTMD_Cavity - separate Zenodo repository, see below for the link. Contains input, output and restart files used for HTMD (High-throughput molecular dynamics) adaptive sampling simulations at 310K for Cavity schemes.05_HTMD_Cavity_Bulk - separate Zenodo repository, see below for the link. Contains input, output and restart files used for HTMD (High-throughput molecular dynamics) adaptive sampling simulations at 310K for Cavity&Bulk schemes. 06_HTMD_Tunnels - separate Zenodo repository, see below for the link. Contains input, output and restart files used for HTMD (High-throughput molecular dynamics) adaptive sampling simulations at 310K for Tunnels schemes. 07_MD-Analysis.tar.gz - Contains MD analysis files obtained from 45 micro-seconds adaptive sampling simulations at 310K. # Each folder contains input raw files used to calculate epochs convergence, distances, RMSD, RMSF, kinetics, percentage, sample proportions and tunnel lengths. The details of those files are:- Epoch_Convergence/epochs_dist_counts.csv : Contains the counts of DBE distances from the active-site (0-5 Å), tunnel (5-19 Å), and bulk (>19 Å) for the 30 epochs. - Distances/*/dist_s_r*.csv : Contains .csv file for the frames wise for all studied schemes. The analysis were performed using the cpptraj program (https://amber-md.github.io/cpptraj/CPPTRAJ.xhtml). The following columns are present:D107_OD1_DBE_C1 D107_OD2_DBE_C1 D107_OD1_DBE_C2 D107_OD2_DBE_C2 N37_ND2_DBE_Br1 N37_ND2_DBE_Br2 W108_NE1_DBE_Br1 W108_NE1_DBE_Br2 D107_COM_DBE_COM W108_COM_DBE_COM N37_COM_DBE_COM catal_COM_p1aCOM catal_COM_p1bCOM catal_COM_p2COM catal_COM_p3COM p1aCOM_DBE_COM p1bCOM_DBE_COM p2COM_DBE_COM p3COM_DBE_COM catal_COM_DBE_COM p1aCOM_p1bCOM p1aCOM_p2COM p1aCOM_p3COM p1bCOM_p2COM p1bCOM_p3COM p2COM_p3COM - RMSD_RMSF/*/*.csv : Contains .csv files with RMSD and RMSF from the protein residues. For RMSF 1st row are residue number (1-295) and 2nd row are RMSF. For RMSD, 1st column are frame no. (0.1ns) and 2nd column are RMSD values respectively. The calcualtion were performed using pytraj (https://amber-md.github.io/pytraj/latest/index.html) program. Example input: pytraj.rmsd(traj, mask='1-295@CA') Example input: pytraj.rmsf(traj, mask=':1-295', options='byres')- COM_RMSF/.xlsx : Contains the center of mass (COM) distances calculated using the bottleneck residues for catalytic residues (N38, D108, W109), p1a (D147, F151, and V173), p1b (D147, W177, and L248), p2 (L211 and L248), and p3 (L143, F151, and I213)- Kinetics/kinetics.txt : Contains .csv file with kinetic information from studied scheme: Cavity, Cavity&Bulk and Tunnels for all the three replicates and calculated average kon, koff, koff/kon rates.- Percentages/.csv : Contains csv files for the percentages of DBE localization and distances from the active-site (0-5 Å), tunnel (5-19 Å), and bulk (>19 Å).- Tunnels_lengths/.csv : Contains tunnel_lengths.csv, Summary of tunnel lengths.xlsx files with lengths of top 100 tunnels snapshots for tunnel clusters p1a, p1b, p2 and p3 in tunnel_lengths.csv and summary of respective tunnel clusters generated from Caver output (for more details please check https://www.caver.cz/fil/download/manual/caver_userguide.pdf with keywork "summary.txt") in the Summary of tunnel lengths.xlsx file. - Sample_proportions/.csv : Contains sample_proportions.csv file with proportions or fraction individual metastable states while performing the transition pathway analysis. For more details please check https://software.acellera.com/htmd/htmd.kinetics.html or http://www.emma-project.org/v1.2.1/api/generated/pyemma.msm.flux.pathways.html?highlight=transition%20path - *.py : Python scripts used to build and analysis Markov state models with use case and distances of ligand.- Generated_models/ : Contains models_rep[].dat files representating the matric data used to build MSM for respective schemes and replicates. The dirs are arranged as below:├── Cavity│ ├── model_rep1.dat│ ├── model_rep2.dat│ └── model_rep3.dat├── Cavity_Bulk│ ├── model_rep1.dat│ ├── model_rep2.dat│ └── model_rep3.dat└── Tunnels ├── model_rep1.dat ├── model_rep2.dat └── model_rep3.dat 08_TransportTools.tar.gz - Contains TransportTools (TT) analysis output, log and summary files for Cavity, Cavity&Bulk and Tunnels schemes. For more details on the workflow of TT, please visit https://github.com/labbit-eu/transport_toolsresults-*_rep0 # results for replicate 1 for given schemes for example cavity, cavity&bulk or tunnels.├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...results-*_rep1 # results for replicate 2 for given schemes for example cavity, cavity&bulk or tunnels.├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...results-*_rep2 # results for replicate 3 for given schemes for example cavity, cavity&bulk or tunnels.├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...- event.csv file contains the aggregated summary of events inferred from the 4-filtered_events_statistics.txt files of each results of respective schemes 09_MSM_states.tar.gz - Contains the Markov state models (MSM) output files for Cavity, Cavity&Bulk and Tunnels schemes and three replicates. The MSMs were generated using the pyEMMA program and HTMD framework, for further details please follow https://software.acellera.com/htmd/documentation.html. The directories looks as below: ├── Bulk│ ├── rep1 # MSM states for replicate 1│ ├── rep2 # MSM states for replicate 2│ ├── rep3 # MSM states for replicate 3├── Cavity│ ├── rep1 │ ├── rep2 │ ├── rep3 ├── Cavity&Bulk│ ├── rep1 │ ├── rep2│ ├── rep3├── Tunnels│ ├── rep1 │ ├── rep2│ ├── rep3 10_MSM_fingerprints.tar.gz - Contains the Markov state models (MSMs) distances generated from repository dir 09_MSM_states consisting the model*.pdb files. The distances were calculated using the cpptraj program of AMBER18 package.- MSM_Distances/*/rep*/*.csv : Contains .csv file for the generated MSM models (0,1,2..). The following columns (calculated distances) are present in the .csv files:D107_OD1_DBE_C1 D107_OD2_DBE_C1 D107_OD1_DBE_C2 D107_OD2_DBE_C2 N37_ND2_DBE_Br1 N37_ND2_DBE_Br2 W108_NE1_DBE_Br1 W108_NE1_DBE_Br2 D107_COM_DBE_COM W108_COM_DBE_COM N37_COM_DBE_COM catal_COM_p1aCOM catal_COM_p1bCOM catal_COM_p2COM catal_COM_p3COM p1aCOM_DBE_COM p1bCOM_DBE_COM p2COM_DBE_COM p3COM_DBE_COM catal_COM_DBE_COM p1aCOM_p1bCOM p1aCOM_p2COM p1aCOM_p3COM p1bCOM_p2COM p1bCOM_p3COM p2COM_p3COM 11_ULS_clustering_and_transition_assignments.tar.gz - Contains files for analysis of utilization of the substrate DBE. Each folder contains two types of .csv files:1. for the transition detection of DBE and the classification in Bulk (out_), Bottleneck (bt_), Unknown bottleneck (bt_unknown), Inside (in_) and 2. the second type as the charecterization on the tunnels utilization: Tunnel (p1a, p1b, p2, and p3), Mixed and Unknnown.# the details of the file arangements are as below for the studied schemes Bulk, Cavity, Cavity&Bulk and Tunnels:├── average_tunnel_utilization_per_scheme.png├── average_tunnel_utilization.png├── Bulk│ ├── Bulk_run_htmd_0_combined_df.csv│ ├── Bulk_run_htmd_0_transitions_counts.csv│ ├── Bulk_run_htmd_1_combined_df.csv│ ├── Bulk_run_htmd_1_transitions_counts.csv│ ├── Bulk_run_htmd_2_combined_df.csv│ └── Bulk_run_htmd_2_transitions_counts.csv├── Bulk&Cavity│ ├── Cavity&Bulk_run_htmd_0_combined_df.csv│ ├── Cavity&Bulk_run_htmd_0_transitions_counts.csv│ ├── Cavity&Bulk_run_htmd_1_combined_df.csv│ ├── Cavity&Bulk_run_htmd_1_transitions_counts.csv│ ├── Cavity&Bulk_run_htmd_2_combined_df.csv│ └── Cavity&Bulk_run_htmd_2_transitions_counts.csv├── Cavity│ ├── Cavity_run_htmd_0_combined_df.csv│ ├── Cavity_run_htmd_0_transitions_counts.csv│ ├── Cavity_run_htmd_1_combined_df.csv│ ├── Cavity_run_htmd_1_transitions_counts.csv│ ├── Cavity_run_htmd_2_combined_df.csv│ └── Cavity_run_htmd_2_transitions_counts.csv├── parse_distances_msm.py├── schemes_comparison_piechart_per_scheme.png└── Tunnels ├── Tunnels_run_htmd_0_combined_df.csv ├── Tunnels_run_htmd_0_transitions_counts.csv ├── Tunnels_run_htmd_1_combined_df.csv ├── Tunnels_run_htmd_1_transitions_counts.csv ├── Tunnels_run_htmd_2_combined_df.csv └── Tunnels_run_htmd_2_transitions_counts.csv
00_Caver.tar.gz - 包含用于识别LinB86(PDB ID: 5LKA)转运通路的CAVER输入与输出文件,附带CAVER用户手册链接:https://caver.cz/fil/download/manual/caver_userguide.pdf。final_clustering├── tunnel_clusters # 存放各隧道簇的CAVER输出文件 │ ├── ...├── analysis # 存放各隧道簇的瓶颈与隧道特征的.csv格式输出文件 │ ├── ... 01_CaverDock_Tunnels_Profile.tar.gz - 包含由前100条顶级隧道组成的隧道簇以及所得CaverDock分析文件。每个文件夹(tun_cluster_p1a、tun_cluster_p1b、tun_cluster_p2、tun_cluster_p3)均存放对应隧道簇各快照的CaverDock计算所需的原始输入文件,命名格式为stripped_system*。各文件详情如下:- calculations/*/caverdock.conf:CaverDock计算的配置输入文件。- calculations/*/DBE.pdbqt:底物DBE的输入文件。- calculations/*/stripped_system*.pdbqt:蛋白质/受体的输入文件。- calculations/*/stripped_system*.dsd:隧道离散化文件。注意:- calculations/*/stripped_system*.pdb:隧道对应的PDB文件。 02_Minimization_and_Equilibration.tar.gz - 包含用于分子系统AMBER能量最小化与平衡模拟的输入、输出文件,以及自适应采样模拟所用的初始构象文件。 03_HTMD_Bulk - 独立Zenodo仓库,详见下方链接。包含310K温度下针对Bulk方案的高通量分子动力学(High-throughput molecular dynamics, HTMD)自适应采样模拟所用的输入、输出与重启文件。04_HTMD_Cavity - 独立Zenodo仓库,详见下方链接。包含310K温度下针对Cavity方案的高通量分子动力学(High-throughput molecular dynamics, HTMD)自适应采样模拟所用的输入、输出与重启文件。05_HTMD_Cavity_Bulk - 独立Zenodo仓库,详见下方链接。包含310K温度下针对Cavity&Bulk方案的高通量分子动力学(High-throughput molecular dynamics, HTMD)自适应采样模拟所用的输入、输出与重启文件。06_HTMD_Tunnels - 独立Zenodo仓库,详见下方链接。包含310K温度下针对Tunnels方案的高通量分子动力学(High-throughput molecular dynamics, HTMD)自适应采样模拟所用的输入、输出与重启文件。 07_MD-Analysis.tar.gz - 包含310K温度下45微秒自适应采样模拟所得的MD分析文件。每个文件夹包含用于计算迭代周期收敛性、距离、均方根偏差(Root Mean Square Deviation, RMSD)、均方根波动(Root Mean Square Fluctuation, RMSF)、动力学、占比、样本比例与隧道长度的原始输入文件。各文件详情如下:- Epoch_Convergence/epochs_dist_counts.csv:包含30个迭代周期中,底物DBE与活性位点(0-5 Å)、隧道(5-19 Å)、溶剂体相(>19 Å)的距离计数数据。- Distances/*/dist_s_r*.csv:包含所有研究方案的逐帧距离.csv文件。分析通过cpptraj程序(https://amber-md.github.io/cpptraj/CPPTRAJ.xhtml)完成,包含以下列:D107_OD1_DBE_C1、D107_OD2_DBE_C1、D107_OD1_DBE_C2、D107_OD2_DBE_C2、N37_ND2_DBE_Br1、N37_ND2_DBE_Br2、W108_NE1_DBE_Br1、W108_NE1_DBE_Br2、D107_COM_DBE_COM、W108_COM_DBE_COM、N37_COM_DBE_COM、catal_COM_p1aCOM、catal_COM_p1bCOM、catal_COM_p2COM、catal_COM_p3COM、p1aCOM_DBE_COM、p1bCOM_DBE_COM、p2COM_DBE_COM、p3COM_DBE_COM、catal_COM_DBE_COM、p1aCOM_p1bCOM、p1aCOM_p2COM、p1aCOM_p3COM、p1bCOM_p2COM、p1bCOM_p3COM、p2COM_p3COM。- RMSD_RMSF/*/*.csv:包含蛋白质残基的RMSD与RMSF的.csv文件。RMSF文件的第一行为残基编号(1-295),第二行为RMSF值;RMSD文件的第一列为帧号(0.1ns为步长),第二列为RMSD值。计算通过pytraj程序(https://amber-md.github.io/pytraj/latest/index.html)完成。示例输入:pytraj.rmsd(traj, mask='1-295@CA');示例输入:pytraj.rmsf(traj, mask=':1-295', options='byres')。- COM_RMSF/.xlsx:包含基于催化残基(N38、D108、W109)、p1a(D147、F151、V173)、p1b(D147、W177、L248)、p2(L211、L248)与p3(L143、F151、I213)的瓶颈残基计算得到的质心(Center of Mass, COM)距离数据。- Kinetics/kinetics.txt:包含研究方案(Cavity、Cavity&Bulk与Tunnels)的动力学信息.csv文件,涵盖三个重复实验的平均结合速率(kon)、解离速率(koff)与koff/kon比值。- Percentages/.csv:包含底物DBE定位占比以及其与活性位点(0-5 Å)、隧道(5-19 Å)、溶剂体相(>19 Å)的距离占比的.csv文件。- Tunnels_lengths/.csv:包含tunnel_lengths.csv与Summary of tunnel lengths.xlsx文件,其中tunnel_lengths.csv汇总了隧道簇p1a、p1b、p2与p3的前100条隧道快照的长度,Summary of tunnel lengths.xlsx则包含基于CAVER输出生成的对应隧道簇汇总信息(更多详情请参阅https://www.caver.cz/fil/download/manual/caver_userguide.pdf中的“summary.txt”部分)。- Sample_proportions/.csv:包含sample_proportions.csv文件,该文件包含过渡通路分析过程中各亚稳态的比例或占比。更多详情请参阅https://software.acellera.com/htmd/htmd.kinetics.html或http://www.emma-project.org/v1.2.1/api/generated/pyemma.msm.flux.pathways.html?highlight=transition%20path。- *.py:用于构建与分析马尔可夫状态模型(Markov state model, MSM)的Python脚本,涵盖配体的用例与距离计算。- Generated_models/:包含models_rep[].dat文件,这些文件为对应方案与重复实验构建MSM所用的矩阵数据。目录排布如下:├── Cavity│ ├── model_rep1.dat│ ├── model_rep2.dat│ └── model_rep3.dat├── Cavity_Bulk│ ├── model_rep1.dat│ ├── model_rep2.dat│ └── model_rep3.dat└── Tunnels ├── model_rep1.dat ├── model_rep2.dat └── model_rep3.dat 08_TransportTools.tar.gz - 包含针对Cavity、Cavity&Bulk与Tunnels方案的TransportTools分析输出、日志与汇总文件。有关TT工作流程的更多详情,请访问https://github.com/labbit-eu/transport_toolsresults-*_rep0:对应给定方案的重复实验1结果(例如cavity、cavity&bulk或tunnels)。├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...results-*_rep1:对应给定方案的重复实验2结果。├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...results-*_rep2:对应给定方案的重复实验3结果。├── data│ ├── super_clusters├── _internal│ ├── ...├── statistics│ ├── ...- event.csv文件包含从各方案结果的4-filtered_events_statistics.txt文件中推断得到的事件汇总摘要。 09_MSM_states.tar.gz - 包含针对Cavity、Cavity&Bulk与Tunnels方案及三个重复实验的马尔可夫状态模型(Markov state model, MSM)输出文件。MSMs通过pyEMMA程序与HTMD框架生成,更多详情请参阅https://software.acellera.com/htmd/documentation.html。目录排布如下:├── Bulk│ ├── rep1 # 重复实验1的MSM状态│ ├── rep2 # 重复实验2的MSM状态│ ├── rep3 # 重复实验3的MSM状态├── Cavity│ ├── rep1 │ ├── rep2 │ ├── rep3 ├── Cavity&Bulk│ ├── rep1 │ ├── rep2│ ├── rep3├── Tunnels│ ├── rep1 │ ├── rep2│ ├── rep3 10_MSM_fingerprints.tar.gz - 包含来自09_MSM_states仓库的马尔可夫状态模型(Markov state model, MSM)距离数据,对应model*.pdb文件。距离通过AMBER18套件的cpptraj程序计算得到。- MSM_Distances/*/rep*/*.csv:包含生成的MSM模型(0、1、2…)的.csv文件,包含以下计算得到的距离列:D107_OD1_DBE_C1、D107_OD2_DBE_C1、D107_OD1_DBE_C2、D107_OD2_DBE_C2、N37_ND2_DBE_Br1、N37_ND2_DBE_Br2、W108_NE1_DBE_Br1、W108_NE1_DBE_Br2、D107_COM_DBE_COM、W108_COM_DBE_COM、N37_COM_DBE_COM、catal_COM_p1aCOM、catal_COM_p1bCOM、catal_COM_p2COM、catal_COM_p3COM、p1aCOM_DBE_COM、p1bCOM_DBE_COM、p2COM_DBE_COM、p3COM_DBE_COM、catal_COM_DBE_COM、p1aCOM_p1bCOM、p1aCOM_p2COM、p1aCOM_p3COM、p1bCOM_p2COM、p1bCOM_p3COM、p2COM_p3COM。 11_ULS_clustering_and_transition_assignments.tar.gz - 包含底物DBE利用情况分析相关文件。每个文件夹包含两类.csv文件:1. 用于DBE转运检测与分类的文件,分为溶剂体相(out_)、瓶颈(bt_)、未知瓶颈(bt_unknown)、内部(in_);2. 用于隧道利用特征表征的文件,分为隧道(p1a、p1b、p2、p3)、混合(Mixed)与未知(Unknown)。针对Bulk、Cavity、Cavity&Bulk与Tunnels研究方案的文件排布详情如下:├── average_tunnel_utilization_per_scheme.png├── average_tunnel_utilization.png├── Bulk│ ├── Bulk_run_htmd_0_combined_df.csv│ ├── Bulk_run_htmd_0_transitions_counts.csv│ ├── Bulk_run_htmd_1_combined_df.csv│ ├── Bulk_run_htmd_1_transitions_counts.csv│ ├── Bulk_run_htmd_2_combined_df.csv│ └── Bulk_run_htmd_2_transitions_counts.csv├── Bulk&Cavity│ ├── Cavity&Bulk_run_htmd_0_combined_df.csv│ ├── Cavity&Bulk_run_htmd_0_transitions_counts.csv│ ├── Cavity&Bulk_run_htmd_1_combined_df.csv│ ├── Cavity&Bulk_run_htmd_1_transitions_counts.csv│ ├── Cavity&Bulk_run_htmd_2_combined_df.csv│ └── Cavity&Bulk_run_htmd_2_transitions_counts.csv├── Cavity│ ├── Cavity_run_htmd_0_combined_df.csv│ ├── Cavity_run_htmd_0_transitions_counts.csv│ ├── Cavity_run_htmd_1_combined_df.csv│ ├── Cavity_run_htmd_1_transitions_counts.csv│ ├── Cavity_run_htmd_2_combined_df.csv│ └── Cavity_run_htmd_2_transitions_counts.csv├── parse_distances_msm.py├── schemes_comparison_piechart_per_scheme.png└── Tunnels ├── Tunnels_run_htmd_0_combined_df.csv ├── Tunnels_run_htmd_0_transitions_counts.csv ├── Tunnels_run_htmd_1_combined_df.csv ├── Tunnels_run_htmd_1_transitions_counts.csv ├── Tunnels_run_htmd_2_combined_df.csv └── Tunnels_run_htmd_2_transitions_counts.csv



