OpenMol/SMol_FS_Filtered_875K_SMILES-MMChat
收藏资源简介:
--- dataset_info: features: - name: id dtype: int64 - name: molecules struct: - name: selfies sequence: string - name: smiles sequence: string - name: ground_truth dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 899476523 num_examples: 870598 - name: dev num_bytes: 2131451 num_examples: 2049 - name: test num_bytes: 3991147 num_examples: 4062 download_size: 151229360 dataset_size: 905599121 configs: - config_name: default data_files: - split: train path: data/train-* - split: dev path: data/dev-* - split: test path: data/test-* --- Forward Reaction Prediction Dataset (derived from [SMolInstruct](https://arxiv.org/abs/2402.09391)) - molecule representation format: 1D SMILES - will further encode into 2D graph features - We filtered out overlapping samples from original train-split (test-set: MolInstruct-Forward Reaction Prediction) For Detail, refer to *PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes*: https://arxiv.org/pdf/2406.13193
数据集信息: 特征字段: - 字段名:id,数据类型:int64(64位整型) - 字段名:molecules(分子),为结构体类型,包含两个子字段: - 子字段名:selfies(Self-Referencing Embedded Strings),类型为字符串序列 - 子字段名:smiles(Simplified Molecular-Input Line-Entry System),类型为字符串序列 - 字段名:ground_truth(真实标签),数据类型:字符串 - 字段名:messages,为列表类型,列表内元素为结构体,包含两个子字段: - 子字段名:content,数据类型:字符串 - 子字段名:role,数据类型:字符串 数据集划分: - 训练集(train):占用字节数899476523,样本量870598 - 开发集(dev):占用字节数2131451,样本量2049 - 测试集(test):占用字节数3991147,样本量4062 下载总大小:151229360字节,完整数据集总大小:905599121字节 配置项: - 配置名称:default(默认配置),数据文件路径: - 训练集对应路径:data/train-* - 开发集对应路径:data/dev-* - 测试集对应路径:data/test-* 正向反应预测数据集(衍生自SMolInstruct,详见https://arxiv.org/abs/2402.09391) - 分子表示格式:1D SMILES(Simplified Molecular-Input Line-Entry System),后续将进一步编码为二维图特征 - 我们已从原始训练划分中过滤掉重复样本(注:原测试集对应MolInstruct-正向反应预测任务) 详细信息请参阅论文《PRESTO:渐进式预训练提升合成化学任务效果》:https://arxiv.org/pdf/2406.13193



