遇见数据集

NMRArena

收藏
github2026-07-18 更新2026-07-19 收录
数据链接:
官方服务:

资源简介:

NMR基准数据集,包含105个分子,涵盖21类有机化合物,每个分子配对实验性的¹H和¹³C NMR光谱,用于评估通用LLMs和专用ML模型在结构解析中的性能。

This NMR benchmark dataset contains 105 molecules spanning 21 classes of organic compounds. Each molecule is paired with its experimental ¹H and ¹³C NMR spectra, and is used to evaluate the performance of general-purpose LLMs and specialized ML models in structural elucidation.

创建时间:
2026-07-13
原始信息汇总

数据集概述:NMR Arena - 核磁共振结构解析基准

核心目标

评估通用大语言模型(LLM)与专用机器学习模型从核磁共振(NMR)谱图中解析有机化合物结构的能力。

数据集规模与构成

  • 总分子数:105个
  • 化合物类别:涵盖21类有机化合物,每类5个分子
  • 数据来源:OdanChem开放光谱数据库(实验NMR谱图)
  • 谱图类型:每个分子配有实验¹H和¹³C NMR峰列表

化合物分类

类别组 具体类别
烃类 烷烃/卤代烷烃、烯烃、炔烃、多环芳烃、杂环芳烃
含氧基团 醇、酚、醚、酮、醛、酸、酯
含氮基团 胺、酰胺、腈、叠氮化物
环/杂原子 小环、螺环、杂环、有机磷、含硫化合物

数据记录格式

每个分子记录包含以下字段:

  • compound_id:唯一分子标识符
  • publication_id:来源文献标识符
  • smiles:真实结构(SMILES格式)
  • n_complex:机器学习分子复杂度评分
  • h_nmr / c_nmr:实验¹H / ¹³C NMR峰列表
  • doi:来源文献DOI

评估方法与指标

  • 评价标准:预测SMILES经RDKit规范化后与真实结构完全一致才算“解决”
  • 主要指标
    • Top-1准确率(前1个候选命中真实结构的比例)
    • Top-10准确率(前10个候选命中真实结构的比例)
    • Tanimoto相似度(Top-1候选与真实结构的摩根指纹平均相似度)

测试模型

专用NMR模型(4个)

模型 执行方式
NMRMind 本地
NMRPeak 本地
NMR-Solver 网页
BLIND(内部名odan_ai) 网页

通用大语言模型(6个)

模型 提供商 发布时间
Gemini 3.1 Pro Google DeepMind 2026-02-19
GPT-5.5 OpenAI 2026-04-23
DeepSeek-V4-Pro DeepSeek 2026-04-24
Grok 4.3 xAI 2026-04-30
Qwen3.7-Max Alibaba 2026-05-19
Claude Opus 4.8 Anthropic 2026-05-28

主要结果(Top-1准确率排名)

方法 类型 Top-1 (%) Top-10 (%) Tanimoto
BLIND 专用 48.6 68.6 0.74
NMRPeak 专用 48.6 50.5 0.70
NMR-Solver 专用 20.0 27.6 0.46
Gemini 3.1 Pro LLM 20.0 23.8 0.52
GPT-5.5 LLM 12.4 18.1 0.43
Grok 4.3 LLM 11.4 13.3 0.42
Qwen3.7-Max LLM 8.6 15.2 0.41
Claude Opus 4.8 LLM 4.8 13.3 0.39
DeepSeek-V4-Pro LLM 1.9 2.9 0.30
NMRMind 专用 0.0 1.0 0.17

结果总结

  • 专用NMR模型在结构解析任务上整体领先,BLIND和NMRPeak表现最优
  • 通用LLM均落后于顶级专用模型,但性能远超随机水平
  • 结果包含两个分析生成的集成方法:最佳LLM组合和最佳专用模型组合

存储库结构

  • dataset/:包含105个分子的基准数据集、复杂度评分、数据准备与模型调用脚本
  • results/:所有10个系统的预测结果及LLM原始输出
  • analysis/:数据分析管道、指标计算与可视化图表生成

数据集设计特点

  • 每个分子仅使用单一、经过筛选的实验¹H/¹³C谱对
  • 在21类官能团及全分子复杂度范围内平衡采样
  • 仅当预测SMILES与真实结构在RDKit规范化后完全相同时才视为正确
搜集汇总
数据集介绍
NMRArena 数据集图片
构建方式
NMRArena数据集的构建源于有机化学中结构解析这一核心挑战,旨在从核磁共振波谱中还原分子结构。研究团队依托OdanChem开源光谱数据库,从超过2000万条实验NMR光谱中精心筛选,最终保留105个分子的高质量单一谱图。为确保数据集的均衡性与代表性,每个分子依据SMARTS规则被划分至21个官能团类别,每类包含5个分子,覆盖从烃类、含氧基团到含氮及杂环化合物的广泛化学空间。此外,通过机器学习复杂度评分对分子进行五等分采样,确保数据集涵盖从简单到复杂的完整范围,从而构建出一个结构可靠、类别均衡的标准化评测基准。
特点
该数据集的核心特色在于其严苛的评估标准与多维度分析能力。NMRArena要求预测的SMILES结构必须与真实分子完全一致(经RDKit规范化处理),避免了仅字符串相似但结构不同的误判。数据集提供了来自10个系统的排名预测结果,包括4个专用NMR模型与6个通用大语言模型,并整合了两个Oracle集成模型,便于对比不同技术路线的上限。评测指标涵盖Top-1与Top-10准确率、Tanimoto化学相似度以及官能团保真度,并可按复杂度或类别进行分层分析,为研究者提供了从宏观性能到微观结构一致性的全面洞察。
使用方法
使用NMRArena开展研究十分便捷。用户首先克隆代码仓库并安装依赖(需Python 3.9及以上及RDKit等核心库),即可直接加载JSON格式的基准数据集与预测结果。通过运行主分析notebook(analysis/data_analysis.ipynb),系统将自动规范化SMILES、执行结构匹配并计算各项指标与可视化图表。对于希望复现LLM评估的团队,可参考llm_track.ipynb,该脚本集成了OpenRouter接口,支持以统一参数(如温度1.0)批量查询多种模型并解析输出。所有预测结果以标准化JSON格式存储,便于二次开发与扩展评测。
背景与挑战
背景概述
核磁共振波谱解析,即从实验获取的¹H与¹³C核磁共振谱图中逆向推导有机分子结构,是有机化学领域的核心任务之一,长期以来依赖于化学家的专家经验。随着人工智能技术的迅猛发展,利用机器学习模型,特别是通用大语言模型及专用模型自动完成结构解析,成为极具前景的研究方向。在此背景下,由OdanChem团队于2026年构建的NMRArena基准数据集应运而生,其核心研究问题在于系统性地评估前沿AI模型在真实核磁谱图结构解析任务中的表现。该数据集精心遴选了涵盖21种官能团类别、复杂度分布均衡的105个分子,配备干净的单对实验核磁谱图,并整合了六个通用大语言模型与四个专用模型的预测结果,为相关领域的模型性能对比提供了标准化平台。NMRArena的发布,使得研究社区能够客观比较不同技术路线在结构解析任务上的真实差距,对推动计算化学与人工智能的交叉发展产生了重要影响。
当前挑战
该数据集所解决的领域问题核心挑战在于:结构解析任务要求模型不仅理解谱图中的化学位移与耦合常数等物理信号,还需将其映射为精确的二维分子拓扑结构,容错率极低,任何SMILES表示法的微小偏差都会导致解析失败。构建过程中遭遇的挑战主要体现在三方面。其一,数据筛选与质量控制极为严苛,需从OdanChem数据库中超过两千万条核磁谱图中,为每个分子挑选唯一可信的¹H/¹³C谱图对,并确保所有分子的谱图干净无杂质干扰。其二,官能团类别与分子复杂度的系统化平衡,需通过SMARTS分类算法与机器学习复杂度评分实现每类五分子、涵盖21种类别的精细配额。其三,评测管道的设计需确保绝对公平与可重复,必须利用RDKit进行SMILES的标准化与结构匹配,杜绝字符串相似性带来的虚假成功,从而构建出真正衡量模型核心能力的挑战场景。
常用场景
经典使用场景
NMRArena数据集专为核磁共振波谱结构解析任务而设计,其核心使用场景涵盖通用大语言模型与专用机器学习模型在有机分子结构推导上的性能评估。该基准包含105个分子,横跨21类有机化合物功能基团,每个分子均配备实验采集的¹H与¹³C核磁共振谱图。研究者可借助该数据集系统性地比较不同模型在Top-1与Top-10准确率、Tanimoto相似度、功能基团保真度等多维指标上的表现,从而甄别出最适合解析复杂有机结构的智能算法。
衍生相关工作
围绕NMRArena数据集已衍生出多项具有启发性的研究工作,其中最经典的是对比分析专用模型(如BLIND与NMRPeak)与通用大语言模型(如Gemini 3.1 Pro与GPT-5.5)在结构解析上的能力边界。此外,研究者基于该数据集的预测结果构建了最佳LLM与最佳专用模型的集成策略,探索知识蒸馏与多模型投票机制以提升Top-10准确性。该基准的开放性还鼓励了谱图预处理策略的创新,如动态化学位移对齐与分子复杂度归一化,进一步推动了核磁共振智能化解析的学术前沿。
数据集最近研究
最新研究方向
NMRArena数据集聚焦于评估通用大语言模型与专用机器学习模型在核磁共振波谱解析有机分子结构上的能力差异。当前前沿方向涵盖两大路径:一是专用模型如BLIND和NMRPeak通过深度领域知识嵌入实现高精度结构重建;二是GPT-5.5、DeepSeek-V4-Pro等前沿LLM借助强大化学推理能力探索光谱解析。该基准的建立恰逢AI辅助科学发现热潮,其105分子跨21类官能团的精心设计,为衡量模型在复杂度、官能团保真度等维度上的表现提供了严苛标尺。研究发现专用模型在Top-1精度上显著领先,而LLM虽表现逊色但已超越随机水平,揭示了知识注入与通用智能之间的关键鸿沟,对推动计算化学与AI融合具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务