nico8771/qm9_clean
收藏资源简介:
该数据集是清理过的QM9数据集,专门用于化学、分子、图生成和流匹配任务。它包含132,040个中性分子,每个分子用规范SMILES字符串表示,并附带六个DFT目标属性:mu、alpha、homo、lumo、gap和cv。数据集经过解析、标准化(去除立体化学并净化)、Kekulize化(基于原子词汇表C、N、O、F)和往返检查等处理流程。键使用四个类别:无键、单键、双键和三键。DFT属性是QM9原始提供的,无法通过RDKit重新计算。
license: 其他 pretty_name: qm9_clean tags: - 化学 - 分子 - 图生成 - 流匹配 size_categories: - 100K<n<1M # nico8771/qm9_clean — 经过清洗的QM9数据集 每一行均以中性分子形式存储,采用**标准化SMILES(canonical SMILES)** 与**EDM-six 密度泛函理论(DFT)目标值**。 > 来源:torch_molecule QM9(Hugging Face镜像仓库)。代码仓库地址:<https://github.com/Nico-Conti/flow-matching-molecules>(`dataset/`目录下)。 ## 字段结构 | 列名 | 数据类型 | 描述 | |---|---|---| | `smiles` | 字符串 | 经过标准化处理、可实现凯库勒式转换的单片段SMILES(已完成校验清理) | | `y` | 浮点型列表 | DFT目标属性,对应列依次为偶极矩`mu`、极化率`alpha`、最高占据分子轨道能级`homo`、最低未占据分子轨道能级`lumo`、能隙`gap`、定容热容`cv` | ## 数据处理流程 1. **解析**:使用RDKit化学信息学工具包进行解析,无法完成解析的样本将被直接丢弃。 2. **标准化**:移除分子的立体化学信息,执行校验清理操作(QM9数据集原始样本均为中性分子)。 3. **凯库勒式转换**:限定原子词汇表为`C`(碳)、`N`(氮)、`O`(氧)、`F`(氟),超出该词汇表的原子将被丢弃。 4. **往返校验**:执行`SMILES → (分子拓扑结构X, 化学键E) → 分子对象 → SMILES`的往返校验流程。 化学键共分为4类(无键/单键/双键/三键)。QM9数据集自带的六项DFT属性**无法通过RDKit工具包重新计算得到**。 ### 样本丢弃/保留统计(本次构建版本) | 处理结果 | 样本数量 | |---|---| | `drop_vocab`(超出词汇表被丢弃) | 1,845 | | `kept`(保留样本) | 132,040 | 本次构建共保留**132,040**个分子。




