mol-reps-v0.1
收藏资源简介:
该数据集是一个化学分子数据集,专注于有机分子结构表示与性质的收集。数据集包含多种分子表示形式,包括规范SMILES、随机SMILES、SELFIES、随机SELFIES、DeepSMILES、随机DeepSMILES、InChI、InChIKey、IUPAC名称以及CML(化学标记语言)。此外,还提供了分子的二维图像(mol_image)。每个样本还包含原始数据字段,如原始CID、原始SMILES、原始SELFIES、原始InChI、原始IUPAC名称、分子描述、xlogP(脂水分配系数)和极性表面积(polararea)。数据集总计260个样本,分为训练集(200个)、额外训练集(40个)和测试集(20个)。该数据集适用于分子表示学习、分子性质预测、分子生成模型以及化学信息学相关任务。
This dataset is a chemical molecular dataset focusing on the representation and property collection of organic molecules. It contains multiple molecular representations, including canonical SMILES, random SMILES, SELFIES, random SELFIES, DeepSMILES, random DeepSMILES, InChI, InChIKey, IUPAC names, and CML (Chemical Markup Language). Additionally, 2D molecular images (mol_image) are provided. Each sample also includes original data fields such as original CID, original SMILES, original SELFIES, original InChI, original IUPAC name, molecular description, xlogP (lipophilicity coefficient), and polar surface area (polararea). The dataset consists of 260 samples in total, divided into a training set (200), an extra training set (40), and a test set (20). It is suitable for tasks such as molecular representation learning, molecular property prediction, molecular generation models, and cheminformatics.
数据集概述:mol-reps-v0.1
基本信息
- 数据集名称:mol-reps-v0.1
- 来源:Hugging Face 平台
- 许可证:README 中未提供许可证信息
数据规模
该数据集包含三个数据划分,共计 260 个样本:
| 数据划分 | 样本数量 | 大小 |
|---|---|---|
| train | 200 | 3,716,420 字节 |
| extra_train | 40 | 763,732 字节 |
| test | 20 | 410,384 字节 |
总数据集大小:4,890,536 字节 下载大小:3,621,145 字节
数据特征
数据集包含 20 个特征,分为以下几类:
分子表示(核心特征)
- SMILES:
can_smiles(字符串,规范表示)、random_smiles(字符串列表,随机表示) - SELFIES:
can_selfies(字符串,规范表示)、random_selfies(字符串列表,随机表示) - DeepSMILES:
can_deepsmiles(字符串,规范表示)、random_deepsmiles(字符串列表,随机表示)
标准化学标识
inchi(字符串):国际化学品标识inchikey(字符串):InChI 哈希键iupac(字符串):IUPAC 名称cml(字符串):化学标记语言表示
图像特征
mol_image(图像类型):分子结构图像
原始数据特征
src_dataset(字符串):来源数据集名称raw_CID(int64):PubChem 化合物标识符raw_SMILES(字符串):原始 SMILES 表示raw_SELFIES(字符串):原始 SELFIES 表示raw_inchi(字符串):原始 InChI 标识raw_iupacname(字符串):原始 IUPAC 名称raw_description(字符串):化合物描述raw_xlogp(float64):XLogP 脂溶性参数raw_polararea(float64):极性表面积
应用价值
该数据集为每个分子提供了多种化学表示形式(规范与随机版本),适用于分子表征学习、生成模型训练、分子性质预测等化学信息学任务,尤其适合评估不同分子编码方式之间的转换与学习。




