遇见数据集

IRexp

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

IRexp是目前最大的、可公开再分发的实验红外波段列表集合,数据来源于开放获取化学文献,并通常附带共报告的1H/13C NMR化学位移列表和解析结构。该数据集共包含约12万条记录,其中最大可商用子集(CC-BY及CC0许可)包含88,545条记录;结构解析过的子集包含43,060条记录,其中有33,201条同时包含红外、氢谱、碳谱和结构信息。每条记录以JSON行格式存储,关键字段包括:红外波段列表(ir_bands_cm-1,单位为cm⁻¹的峰值位置)、SMILES表示、SELFIES表示、氢谱文本(h_nmr)、碳谱文本(c_nmr)、InChIKey、来源DOI、PMCID、许可类型及许可池。数据集提供多个配置,以适应不同使用场景:推荐用于训练的无基准泄漏子集(train_no_bench,42,808条记录)、纯红外预训练子集(pretrain_ir)、完整多许可数据集(all)等。IRexp主要用于训练和评估从红外波段列表预测分子结构的机器学习模型,特别是与配套的IRSpectra-Bench基准测试(含194个盲测结构解析问题)联合使用。注意:该数据集提供的是文献中报告的波段列表(中位数9个波段),而非完整吸收光谱,且结构解析率约为35%。

IRexp is currently the largest publicly redistributable collection of experimental infrared band lists, sourced from open-access chemical literature and typically accompanied by co-reported 1H/13C NMR chemical shift lists and resolved structures. The dataset contains approximately 120,000 records, with the largest commercially viable subset (CC-BY and CC0 licenses) comprising 88,545 records; the structure-resolved subset includes 43,060 records, of which 33,201 contain both IR, 1H NMR, 13C NMR, and structural information. Each record is stored in JSON line format, with key fields including: infrared band list (ir_bands_cm-1, peak positions in cm⁻¹), SMILES representation, SELFIES representation, 1H NMR text (h_nmr), 13C NMR text (c_nmr), InChIKey, source DOI, PMCID, license type, and license pool. The dataset offers multiple configurations to suit different usage scenarios: the recommended training subset without benchmark leakage (train_no_bench, 42,808 records), the pure IR pre-training subset (pretrain_ir), the full multi-license dataset (all), etc. IRexp is primarily used for training and evaluating machine learning models that predict molecular structures from infrared band lists, particularly in conjunction with the accompanying IRSpectra-Bench benchmark (containing 194 blind structure elucidation problems). Note: The dataset provides band lists reported in the literature (median 9 bands), not full absorption spectra, and the structure elucidation rate is approximately 35%.

创建时间:
2026-08-24
原始信息汇总

IRexp 数据集概述

IRexp 是一个从开放获取文献中挖掘的实验性红外(IR)波段列表数据集,是当前最大的可公开再分发的实验红外波段列表集合,同时包含共报告的 ¹H/¹³C 化学位移列表和已解析的分子结构。

核心特点

  • 数据形态:包含的是波段列表(以 cm⁻¹ 为单位的峰位置),而非数字化的吸收光谱迹线,这是文献出版物中报告的形式。
  • 数据规模:完整语料库包含 121,233 条记录,其中主可再分发子集(commercial 配置)包含 88,545 条记录。
  • 来源:119,345 条来自 PMC(PubMed Central),1,888 条来自 Chemotion/RADAR4Chem。
  • 多模态组合:包含 33,201 条同时具备完整 IR + ¹H + ¹³C + 结构的四元组记录。

配置与分割

配置名称 记录数 说明
commercial 88,545 主要可再分发子集(CC-BY + CC0)
all 121,233 完整语料库(多许可证,每行有标记)
non_commercial 21,823 保留的 CC-BY-NC 记录
sharealike 1,897 Chemotion CC-BY-SA-4.0 及少量 PMC SA
resolved 43,060 结构关联记录(100%,多许可证)
train_no_bench 42,808 推荐训练集,已排除基准测试重叠
train_no_bench_nmr 32,949 同上,但要求同时具备 ¹H 和 ¹³C

记录字段

每条 JSONL 记录包含以下字段:

  • id / inchikey:化合物标识符
  • smiles / selfies:分子结构表示
  • ir_bands_cm-1:红外波段列表(数值数组)
  • h_nmr / c_nmr:核磁共振位移列表(文本形式)
  • ir_source:IR 数据来源(实验)
  • source_doi / pmcid:文献来源标识
  • license / license_pool:许可证信息及商业可用性分类
  • license_source:许可证信息来源

配套基准

IRSpectra-Bench 是基于 IRexp 构建的盲测峰列表基准,包含 194 个结构解析问题。训练时不要使用 train_no_bench 之外的配置以避免基准泄漏,特别警告勿使用旧的 irexp_release/train.jsonl.gz 分割(与基准有 117/200 的 InChIKey-14 重叠)。

局限说明

  • 数据为波段列表而非完整光谱,PMC 来源中位数为 9 个波段(Chemotion 为 39 个)。
  • 文献转录数据,实验室和仪器存在异质性。
  • 结构解析覆盖率约为全部记录的 35%。
  • IR 字符串的提取召回率尚未经过人工审计(转录保真度已审计:60 篇文献共 560 个波段全部通过)。

许可证

多许可证混合,商业训练应使用 commercial 配置(CC-BY + CC0),完整 all 分割不应视为统一 CC-BY 许可。许可证信息按文章通过 Europe PMC 关联并标记于每条记录上。

搜集汇总
数据集介绍
IRexp 数据集图片
构建方式
IRexp数据集源自开放获取的化学文献,通过自动化文本挖掘技术,从119,345篇PMC文献及1,888条Chemotion记录中提取实验红外波段列表,并联合欧洲PMC获取每篇文章的许可信息,以‘license_pool’字段标记商业可用性。该数据集将红外波段、氢谱、碳谱及解析结构整合为多模态记录,其中结构关联记录达43,060条,完整四元组记录为33,201条。数据以JSONL格式存储,每条记录包含InChIKey、SMILES、SELFIES、红外波段数组及谱图文本,并通过多配置分割如‘commercial’、‘resolved’和‘train_no_bench’,以满足不同训练与评估需求。
特点
IRexp是当前可再分发的最大的实验红外波段列表集合,其核心特点在于严格的许可分级与基准兼容性。数据集旗舰配置‘commercial’包含88,545条可商用记录,而‘all’配置涵盖121,233条多许可记录,每条均标注许可来源。特别地,‘train_no_bench’配置剔除了IRSpectra-Bench基准中所有InChIKey-14重叠项,确保无泄漏训练。此外,数据集中所有波数均为文献报告的峰值列表,而非原始谱图,且结构解析率约35%,反映了文献挖掘的异质性。
使用方法
使用Hugging Face datasets库加载,示例代码为‘load_dataset("ilkhamfy/IRexp", "resolved")’或‘commercial’配置。推荐使用‘train_no_bench’配置进行监督微调,以避免基准泄漏。对于红外编码器预训练,可使用‘pretrain_ir’配置。评估模型性能时,应使用配套的IRSpectra-Bench基准(194个盲测问题)及评分脚本。用户需根据‘license_pool’字段过滤商用许可,注意勿将‘all’配置视为统一CC-BY许可。
背景与挑战
背景概述
红外光谱作为有机化学结构解析的核心手段,其谱带数据的系统化积累对于化学信息学的发展至关重要。然而,传统数据库(如SDBS、NIST)多收录全谱数据,且受许可限制难以自由重分发,限制了其在机器学习领域的广泛应用。为应对这一瓶颈,Ilkham Yabbarov、Rudra Sondhi与Rodrigo A. Vargas-Hernández等研究人员于2026年构建了IRexp数据集,旨在从开放获取文献中挖掘实验红外谱带列表,并附带核磁共振数据与分子结构信息。该数据集包含超过12万条记录,其中8.8万余条可商用重分发,填补了化学信息学领域可自由使用红外谱带数据资源的空白,为红外光谱预测、结构解析及大规模模型预训练提供了宝贵的数据基础。
当前挑战
IRexp数据集面临多重挑战。在领域问题层面,红外谱带数据的异质性和不完整性是首要难题,文献中报告的谱带数量、波数精度及仪器差异导致数据噪声较大,且仅35%的记录成功解析出分子结构,限制了监督学习任务的性能。此外,现有基准如IRSpectra-Bench仅覆盖194个盲测问题,难以全面评估模型泛化能力。在构建过程中,从开放获取文献中自动提取红外谱带文本需处理复杂的格式变体与单位转换,且需严格审核转录准确性(已审核560/560条,但提取召回率尚未人工审计)。同时,多源许可信息(如CC-BY、CC-BY-NC)的整合与合规性管理极为繁琐,需逐条标注许可池,确保数据可合法重分发,这构成了数据构建与发布的重要障碍。
常用场景
经典使用场景
IRexp数据集作为迄今规模最大的可再分发实验红外谱带集合,其经典使用场景聚焦于化学信息学中的分子结构解析与光谱预测。研究者可基于该数据集构建监督学习模型,从红外峰位列表(cm⁻¹)直接映射至分子结构(以SMILES或InChIKey表示),或采用多模态学习策略,联合红外、¹H NMR与¹³C NMR数据提升结构鉴定的准确性与鲁棒性。此外,该数据集可用于预训练红外光谱编码器,通过自监督或对比学习范式捕获谱图与化学结构间的潜在关联,为下游任务奠定基础。
实际应用
在实际应用中,IRexp助力制药与材料科学领域的自动化结构解析流程。例如,药物研发中快速鉴定合成中间体的红外光谱特征,或材料表征中聚合物与无机物的谱图检索。通过提供结构-光谱对,该数据集支持开发高通量筛选工具,用于验证合成产物的结构一致性,减少对人工谱图解读的依赖。此外,其与IRSpectra-Bench基准的配套使用,为工业级光谱解析软件的性能评估提供了标准化平台,推动从实验室研究到商业化应用的转化。
衍生相关工作
IRexp衍生了一系列经典工作,最突出的是其配套基准IRSpectra-Bench,该基准包含194个盲测结构解析问题,成为评估大语言模型(LLM)在化学结构解析能力的权威测试集。围绕该数据集,研究者开发了多种谱图-结构生成模型,并探讨了LLM在峰列表理解中的局限性,提出了基于召回率的诊断方法。此外,基于IRexp的预训练模型(如IR编码器)被广泛应用于迁移学习,提升了其他红外光谱任务的性能,同时催生了关于数据许可合规与开放科学实践的重要讨论,为构建可再分发的科学数据集树立了典范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务