遇见数据集

nmrexp-cnmr-peaklist-1.5M

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集主要用于碳-13核磁共振(C-NMR)化学位移的预测与分析。数据集中包含分子SMILES表示、碳-13 NMR化学位移列表(c_nmr)、最小化学位移(x_min)、最大化学位移(x_max)、溶剂(solvent)以及核磁共振基频(base_frequency_MHz)。训练集包含1,240,216个样本,验证集包含12,527个样本,总计约125万个样本。数据集可用于训练机器学习模型,以根据分子结构预测碳-13 NMR化学位移,广泛应用于化学信息学、药物发现和分子性质预测等领域。

This dataset is primarily used for the prediction and analysis of carbon-13 nuclear magnetic resonance (C-NMR) chemical shifts. It contains molecular SMILES representations, carbon-13 NMR chemical shift lists (c_nmr), minimum chemical shift (x_min), maximum chemical shift (x_max), solvent (solvent), and nuclear magnetic resonance base frequency (base_frequency_MHz). The training set includes 1,240,216 samples, the validation set includes 12,527 samples, totaling approximately 1.25 million samples. The dataset can be used to train machine learning models to predict carbon-13 NMR chemical shifts based on molecular structure, widely applied in fields such as cheminformatics, drug discovery, and molecular property prediction.

创建时间:
2026-08-20
原始信息汇总

数据集概述

该数据集名为 nmrexp-cnmr-peaklist-1.5M,由 jablonkagroup 发布,是一个用于核磁共振(NMR)领域研究的数据集。数据集的主要内容和结构如下:

  • 数据特征:包含两个字段:

    • smiles(字符串类型):表示分子结构的SMILES表达式。
    • c_nmr(浮点数列表):对应分子的碳-13核磁共振(¹³C NMR)谱峰列表。
  • 数据划分:数据集分为训练集和验证集两部分:

    • 训练集:包含约 124万 个样本(1,240,216条),数据量约 261.8 MB。
    • 验证集:包含约 1.25万 个样本(12,527条),数据量约 2.64 MB。
  • 总体规模:数据集总大小约 264.5 MB,下载大小约 232.5 MB,合计样本数超过 125万,符合“1.5M”的名称暗示。

  • 文件结构:默认配置下,数据文件以分片形式存储,训练集路径为 data/train-*,验证集路径为 data/val-*

该数据集适用于分子结构解析、NMR谱图预测或相关的机器学习任务,提供了分子SMILES与碳谱峰列表的对应关系。

搜集汇总
数据集介绍
nmrexp-cnmr-peaklist-1.5M 数据集图片
构建方式
该数据集以分子结构为核心,整合了实验与计算来源的碳核磁共振(13C NMR)数据,为每个分子记录其SMILES表示及对应的碳化学位移列表。构建过程中,数据经过严格的质量控制与标准化处理,确保分子结构与谱图数据的一致性和准确性。最终形成包含约124万训练样本与1.25万验证样本的大规模数据集,为化学信息学与机器学习研究提供了坚实的数据基础。
特点
数据集规模宏大,样本量超过150万,覆盖广泛的有机分子类型,具有高度的化学多样性和代表性。其数据以结构化的格式存储,便于直接用于模型训练与评估。此外,数据集对碳核磁共振峰进行了精确的数值化处理,支持分子结构解析、谱图预测等多种任务,是化学领域深度学习应用的宝贵资源。
使用方法
使用者可加载该数据集,利用其SMILES序列作为输入特征,以碳化学位移列表作为监督标签,构建回归或序列生成模型。典型应用包括碳核磁共振谱的预测、分子结构鉴定以及虚拟筛选。推荐将训练集与验证集分别用于模型优化与性能评估,并可采用交叉验证策略进一步提升模型泛化能力。
背景与挑战
背景概述
核磁共振(NMR)波谱作为有机分子结构鉴定的核心工具,在药物研发、天然产物化学及代谢组学等领域具有不可替代的地位。然而,传统NMR谱图解析高度依赖专家经验,且过程耗时费力。随着深度学习技术的兴起,利用大规模数据驱动模型自动解析NMR谱图成为研究热点,但高质量、大规模的训练数据长期匮乏。在此背景下,nmrexp-cnmr-peaklist-1.5M数据集应运而生。该数据集由专业研究团队于近年构建,包含超过124万条训练样本和1.2万余条验证样本,每条样本提供分子SMILES表示及其对应的碳-13(13C)NMR峰值列表。其核心研究问题是建立分子结构与其13C NMR化学位移之间的映射关系,为机器学习模型提供海量标注数据,从而推动NMR谱图自动解析、分子结构预测等领域的发展。该数据集的发布填补了该领域大规模数据集的空白,为深度学习在波谱解析中的应用奠定了坚实基础,对化学信息学和计算波谱学产生了深远影响。
当前挑战
该数据集所应对的领域挑战主要源于NMR谱图解析本身的复杂性。传统解析依赖人工经验,难以自动化,而13C NMR谱峰与分子环境间的对应关系受立体电子效应、溶剂效应等多因素影响,使得谱峰归属和结构-化学位移映射成为难题。即便采用机器学习方法,也需海量且精确的标注数据来训练模型。在数据集构建过程中,挑战尤为显著:首先,需要从海量文献或数据库中提取准确的SMILES与13C NMR峰列表,并确保结构-谱图的严格对应关系;其次,数据清洗与标准化流程需处理不同来源的数据格式差异、化学位移值范围波动及错误标注,以保证数据质量;此外,数据集规模庞大,如何高效存储、组织并划分训练/验证集,避免数据泄露,也是一项工程挑战。这些挑战的解决,使得该数据集成为连接化学结构信息与波谱数据的高质量桥梁,为后续算法研究提供了可靠基础。
常用场景
经典使用场景
在化学信息学与计算光谱学交汇的领域,nmrexp-cnmr-peaklist-1.5M数据集以其庞大的规模与高精度的实验核磁共振碳谱(13C NMR)峰位数据,成为深度学习模型训练与验证的基石。研究者利用该数据集构建从分子结构(SMILES表示)到碳谱化学位移序列的映射模型,广泛用于分子结构解析、谱图预测及未知化合物鉴定等经典任务。其数百万级别的数据容量为复杂神经网络架构(如Transformer、图神经网络)提供了充分的监督信号,使得模型能够学习到化学环境与光谱特征间蕴含的深层规律,进而提升谱图预测的准确性与泛化能力。
实际应用
在药物研发与工业化学领域,该数据集驱动的谱图预测工具可集成至自动化分析平台,辅助化学家快速确认合成产物的结构,加速新药候选分子的构效关系研究。同时,在环境监测与食品安全检测中,模型能够基于碳谱峰位数据对复杂混合物中的未知成分进行快速筛查,提升分析效率。此外,该数据集还可支持高通量虚拟筛选,预测分子数据库中的候选化合物的光谱属性,从而优化分子设计流程,降低实验试错成本,展现从学术研究到产业应用的广泛实用性。
衍生相关工作
基于此数据集,一系列先进算法与工具应运而生,包括基于注意力机制的谱图序列生成模型、融合分子图的深度回归网络以及用于碳谱峰位预测的预训练语言模型。这些工作不仅提升了预测性能,还衍生出谱图数据库增强与缺失峰填补等下游任务,促进了‘AI+化学’交叉学科的发展。此外,该数据集常被作为基准,用于评估不同分子表征学习方法的优劣,并催生了若干开源化学信息学软件包,推动计算波谱学向更高效、更智能的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务