amirka20/peptag
收藏资源简介:
--- license: mit configs: - config_name: peptag data_files: - split: train path: peptag/train-* - split: val path: peptag/val-* - split: test path: peptag/test-* - split: trainval path: peptag/trainval-* - config_name: stereo_pairs data_files: - split: stereo_pairs path: stereo_pairs/stereo_pairs-* - config_name: substitution_pairs data_files: - split: substitution_pairs path: substitution_pairs/substitution_pairs-* - config_name: tag_pairs data_files: - split: tag_pairs path: tag_pairs/tag_pairs-* dataset_info: - config_name: peptag features: - name: Peptide dtype: string - name: B dtype: float64 - name: M dtype: float64 - name: Z dtype: int64 - name: Length dtype: int64 - name: SMILES dtype: string splits: - name: train num_bytes: 11965676 num_examples: 41455 - name: val num_bytes: 1331730 num_examples: 4607 - name: test num_bytes: 866767 num_examples: 2726 - name: trainval num_bytes: 13297406 num_examples: 46062 download_size: 4249559 dataset_size: 27461579 - config_name: stereo_pairs features: - name: Sequence_f dtype: string - name: Sequence_F dtype: string - name: SMILES_f dtype: string - name: SMILES_F dtype: string - name: B_f dtype: float64 - name: B_F dtype: float64 - name: delta_B dtype: float64 splits: - name: stereo_pairs num_bytes: 332784 num_examples: 542 download_size: 51973 dataset_size: 332784 - config_name: substitution_pairs features: - name: Sequence_1 dtype: string - name: Sequence_2 dtype: string - name: Position dtype: int64 - name: Residue_1 dtype: string - name: Residue_2 dtype: string - name: SMILES_1 dtype: string - name: SMILES_2 dtype: string - name: B_1 dtype: float64 - name: B_2 dtype: float64 - name: delta_B dtype: float64 splits: - name: substitution_pairs num_bytes: 4290171 num_examples: 6942 download_size: 318447 dataset_size: 4290171 - config_name: tag_pairs features: - name: Sequence_untagged dtype: string - name: Sequence_tagged dtype: string - name: Tag dtype: string - name: SMILES_untagged dtype: string - name: SMILES_tagged dtype: string - name: B_untagged dtype: float64 - name: B_tagged dtype: float64 - name: delta_B dtype: float64 splits: - name: tag_pairs num_bytes: 911044 num_examples: 1549 download_size: 115469 dataset_size: 911044 ---
许可证:MIT 配置项: - 配置名称:肽标记(peptag) 数据文件: - 拆分方式:训练集(train),路径:peptag/train-* - 拆分方式:验证集(val),路径:peptag/val-* - 拆分方式:测试集(test),路径:peptag/test-* - 拆分方式:训练验证混合集(trainval),路径:peptag/trainval-* - 配置名称:立体对(stereo_pairs) 数据文件: - 拆分方式:立体对拆分(stereo_pairs),路径:stereo_pairs/stereo_pairs-* - 配置名称:替换对(substitution_pairs) 数据文件: - 拆分方式:替换对拆分(substitution_pairs),路径:substitution_pairs/substitution_pairs-* - 配置名称:标记对(tag_pairs) 数据文件: - 拆分方式:标记对拆分(tag_pairs),路径:tag_pairs/tag_pairs-* 数据集信息: - 配置名称:肽标记(peptag) 特征字段: - 肽(Peptide):字符串型 - B:64位浮点型 - M:64位浮点型 - Z:64位整型 - 序列长度(Length):64位整型 - 简化分子线性输入规范(SMILES):字符串型 拆分信息: - 训练集:字节数11965676,样本数41455 - 验证集:字节数1331730,样本数4607 - 测试集:字节数866767,样本数2726 - 训练验证混合集:字节数13297406,样本数46062 下载大小:4249559 字节,数据集总大小:27461579 字节 - 配置名称:立体对(stereo_pairs) 特征字段: - 正向序列(Sequence_f):字符串型 - 正向大写序列(Sequence_F):字符串型 - 正向简化分子线性输入规范(SMILES_f):字符串型 - 正向大写简化分子线性输入规范(SMILES_F):字符串型 - 正向B值(B_f):64位浮点型 - 正向大写B值(B_F):64位浮点型 - B值差值(delta_B):64位浮点型 拆分信息: - 立体对拆分:字节数332784,样本数542 下载大小:51973 字节,数据集大小:332784 字节 - 配置名称:替换对(substitution_pairs) 特征字段: - 序列1(Sequence_1):字符串型 - 序列2(Sequence_2):字符串型 - 突变位点(Position):64位整型 - 原始残基(Residue_1):字符串型 - 替换后残基(Residue_2):字符串型 - 序列1的简化分子线性输入规范(SMILES_1):字符串型 - 序列2的简化分子线性输入规范(SMILES_2):字符串型 - 序列1的B值(B_1):64位浮点型 - 序列2的B值(B_2):64位浮点型 - B值差值(delta_B):64位浮点型 拆分信息: - 替换对拆分:字节数4290171,样本数6942 下载大小:318447 字节,数据集大小:4290171 字节 - 配置名称:标记对(tag_pairs) 特征字段: - 未标记序列(Sequence_untagged):字符串型 - 已标记序列(Sequence_tagged):字符串型 - 标记标签(Tag):字符串型 - 未标记序列的简化分子线性输入规范(SMILES_untagged):字符串型 - 已标记序列的简化分子线性输入规范(SMILES_tagged):字符串型 - 未标记序列的B值(B_untagged):64位浮点型 - 已标记序列的B值(B_tagged):64位浮点型 - B值差值(delta_B):64位浮点型 拆分信息: - 标记对拆分:字节数911044,样本数1549 下载大小:115469 字节,数据集大小:911044 字节



