遇见数据集

QM9数据集子集和TotalEnergies内部数据集

收藏
arXiv2023-04-21 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

本研究使用了两个小型分子数据集:QM9数据集的一个子集,包含4989个分子,以及TotalEnergies内部的一个小数据集,包含516个经过验证的抗氧化剂。QM9数据集子集由所有含有最多九个重原子(C, O, N, F)的分子组成,用于分子生成任务的基准测试。TotalEnergies数据集则反映了工业分子数据集的规模,这些抗氧化剂在多种工业应用和产品中至关重要。研究旨在测试量子生成模型在少量训练样本上的泛化能力,这些样本接近工业场景,即少量但价值高的样本。

This study employs two small-scale molecular datasets: a subset of the QM9 dataset containing 4,989 molecules, and an internal small dataset from TotalEnergies comprising 516 validated antioxidants. This QM9 subset consists of all molecules with up to nine heavy atoms (C, O, N, F) and is used as a benchmark for molecular generation tasks. The TotalEnergies dataset mirrors the scale of industrial molecular datasets, as these antioxidants are critical across a wide range of industrial applications and products. This study aims to test the generalization capability of quantum generative models on small-sized training samples that align with industrial scenarios, i.e., scarce yet high-value samples.

创建时间:
2023-04-21
搜集汇总
数据集介绍
构建方式
该数据集由两部分组成:一是来自公开QM9数据集的子集,包含4989个分子,这些分子均含有不超过九个重原子(碳、氧、氮、氟);二是TotalEnergies提供的内部数据集,包含516个经过内部专家验证的抗氧化剂分子。所有分子均采用SELFIES表示法进行编码,以确保生成分子的结构有效性。数据集构建的核心在于利用量子启发式张量网络生成模型(如正矩阵乘积态、玻恩机、局域纯化态)对分子分布进行学习,并与经典的生成对抗网络进行对比。
使用方法
使用该数据集时,研究者首先需将分子以SELFIES字符串形式输入张量网络或生成对抗网络进行训练。训练后,通过随机采样生成新分子,并利用Frechet Chemnet Distance评估模型对训练数据分布的学习能力。更进一步,可采用超体积指标对多个分子属性进行多目标优化评估,以权衡生成样本在类药性、合成难度等多个维度上的综合表现。实践中,还可将不同模型的生成样本进行组合,以平衡各模型的优势,提升整体生成质量。
背景与挑战
背景概述
随着量子计算技术的蓬勃发展,量子与量子启发式机器学习已成为一个极具前景且充满挑战的研究领域,尤其在近期的量子设备上,生成式建模被视为实现实际量子优势的潜在突破口。在此背景下,Leiden大学的Charles Moussa、Hao Wang、Thomas Bäck、Vedran Dunjko与TotalEnergies公司的Mauricio Araya-Polo于2023年联合发表了关于将量子启发式生成模型应用于小分子数据集的研究。该研究聚焦于两个小型分子数据集:一是包含4989个分子的QM9数据集子集,二是TotalEnergies内部提供的516个经过验证的抗氧化剂分子数据集。核心研究问题在于探索基于张量网络的量子启发式生成模型在少量样本下的分子发现能力,并与经典生成对抗网络(GAN)进行对比。这项工作不仅为量子模型在工业级小数据集上的泛化性提供了实证,也为未来量子与经典生成模型的融合开辟了道路,对量子机器学习与计算化学交叉领域产生了重要影响。
当前挑战
该数据集研究面临多重挑战。从领域问题来看,分子生成模型需要在小样本条件下同时兼顾学习的准确性与生成样本的多样性,尤其在工业场景中,仅有少量但高价值的分子数据可用,传统GAN模型在抗氧化剂数据集上的学习性能(如FCD指标)反而逊色于张量网络模型,凸显了小数据量下模型选择的难题。从构建过程而言,利用SELFIES分子表示虽能确保生成分子的100%有效性,但不同模型在多目标优化(如类药性、合成可及性、溶解度等)上的表现差异显著,单一指标无法全面评估生成质量;此外,抗氧化剂任务中关键性质(如键解离能、电离势)的计算成本高昂,需依赖代理深度学习模型进行预测,增加了评估的复杂性与不确定性。模型之间的性能平衡与样本融合策略亦构成挑战,实验表明组合多个生成模型的输出可提升整体表现,但如何最优地选择与组合模型仍待探索。
常用场景
经典使用场景
在分子发现与药物设计的交叉领域中,QM9数据集子集与TotalEnergies内部数据集被广泛用作基准与工业级小样本测试平台。前者包含4989个具有九重原子(碳、氧、氮、氟)的稳定小分子,常用于评估生成模型在分子结构学习上的基础能力;后者则涵盖516种经专家验证的抗氧化剂分子,模拟了工业场景中数据稀缺但价值高昂的现实挑战。两者共同为量子启发式生成模型(如张量网络)提供了从理论验证到实际应用的桥梁,尤其适合检验模型在有限训练样本下的泛化性能与多目标优化潜力。
解决学术问题
该数据集组合有效解决了量子机器学习领域中两个核心学术难题:一是小样本条件下的生成模型泛化能力评估,通过引入Fréchet Chemnet距离与超体积指标,揭示了张量网络模型在分子属性多目标优化(如类药性、合成可及性、溶解度)上优于传统生成对抗网络的潜力;二是量子模型与经典模型的公平比较框架,基于SELFIES表示的鲁棒性,消除了分子有效性对模型评价的干扰,为量子优势的实证探索奠定了方法论基础。
实际应用
在实际工业场景中,该数据集组合直接服务于抗氧化剂等关键化合物的加速筛选与设计。通过结合张量网络生成模型与SELFIES表示,研究人员能够在数据稀缺(如仅516个样本)的条件下高效生成具有低键解离能、高电离势和良好合成性的候选分子,显著降低了对昂贵量子化学计算(如密度泛函理论)的依赖。此外,多模型集成策略进一步提升了生成样本的质量与多样性,为润滑油、高效汽油及耐久聚合物等领域的材料创新提供了可落地的计算工具。
数据集最近研究
最新研究方向
在量子计算与机器学习交叉融合的前沿浪潮中,QM9子集与TotalEnergies内部抗氧化剂数据集被应用于探索量子启发式生成模型在分子发现中的潜力。当前研究聚焦于利用张量网络模型对比经典生成对抗网络,在小样本场景下评估分子生成质量。通过引入弗雷歇化学距离与多目标超体积指标,研究揭示了张量网络在平衡学习能力与采样质量方面的独特优势,尤其在工业级小数据集上表现突出。此外,多种生成模型输出的融合策略展现出协同增效效应,为统一经典与量子生成学习范式提供了实证基础,预示着在药物设计与材料开发中实现量子优势的可行路径。
相关研究论文
  • 1
    Application of quantum-inspired generative models to small molecular datasets莱顿大学计算机科学研究所 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务