vlccek/MT_dataset
收藏资源简介:
# Protein Mutation Fitness Dataset This dataset contains protein sequences and their corresponding fitness scores, along with structural classifications (CATH). ## Files - `train.parquet`: Training set containing 1,560,811 samples. - `validation.parquet`: Validation set containing 178,050 samples. ## Column Descriptions - `wt_sequence`: Wild-type protein sequence. - `mut_sequence`: Mutated protein sequence. - `mutation`: Specific mutation details. - `fitness`: Mutation impact score (+1 = maximally stabilizing, -1 = maximally destabilizing). - `cath_*`: Structural classification based on the CATH database (Class, Architecture, Topology, Homology). - `data_source`: Origin of the data. - `reverse`: Indicator for reverse mutation data. ## Usage The files are in Apache Parquet format and can be easily loaded using pandas: ```python import pandas as pd df = pd.read_parquet('train.parquet') ```



