IRexp
收藏资源简介:
IRexp是目前最大的、可公开再分发的实验红外波段列表集合,数据来源于开放获取化学文献,并通常附带共报告的1H/13C NMR化学位移列表和解析结构。该数据集共包含约12万条记录,其中最大可商用子集(CC-BY及CC0许可)包含88,545条记录;结构解析过的子集包含43,060条记录,其中有33,201条同时包含红外、氢谱、碳谱和结构信息。每条记录以JSON行格式存储,关键字段包括:红外波段列表(ir_bands_cm-1,单位为cm⁻¹的峰值位置)、SMILES表示、SELFIES表示、氢谱文本(h_nmr)、碳谱文本(c_nmr)、InChIKey、来源DOI、PMCID、许可类型及许可池。数据集提供多个配置,以适应不同使用场景:推荐用于训练的无基准泄漏子集(train_no_bench,42,808条记录)、纯红外预训练子集(pretrain_ir)、完整多许可数据集(all)等。IRexp主要用于训练和评估从红外波段列表预测分子结构的机器学习模型,特别是与配套的IRSpectra-Bench基准测试(含194个盲测结构解析问题)联合使用。注意:该数据集提供的是文献中报告的波段列表(中位数9个波段),而非完整吸收光谱,且结构解析率约为35%。
IRexp is currently the largest publicly redistributable collection of experimental infrared band lists, sourced from open-access chemical literature and typically accompanied by co-reported 1H/13C NMR chemical shift lists and resolved structures. The dataset contains approximately 120,000 records, with the largest commercially viable subset (CC-BY and CC0 licenses) comprising 88,545 records; the structure-resolved subset includes 43,060 records, of which 33,201 contain both IR, 1H NMR, 13C NMR, and structural information. Each record is stored in JSON line format, with key fields including: infrared band list (ir_bands_cm-1, peak positions in cm⁻¹), SMILES representation, SELFIES representation, 1H NMR text (h_nmr), 13C NMR text (c_nmr), InChIKey, source DOI, PMCID, license type, and license pool. The dataset offers multiple configurations to suit different usage scenarios: the recommended training subset without benchmark leakage (train_no_bench, 42,808 records), the pure IR pre-training subset (pretrain_ir), the full multi-license dataset (all), etc. IRexp is primarily used for training and evaluating machine learning models that predict molecular structures from infrared band lists, particularly in conjunction with the accompanying IRSpectra-Bench benchmark (containing 194 blind structure elucidation problems). Note: The dataset provides band lists reported in the literature (median 9 bands), not full absorption spectra, and the structure elucidation rate is approximately 35%.
IRexp 数据集概述
IRexp 是一个从开放获取文献中挖掘的实验性红外(IR)波段列表数据集,是当前最大的可公开再分发的实验红外波段列表集合,同时包含共报告的 ¹H/¹³C 化学位移列表和已解析的分子结构。
核心特点
- 数据形态:包含的是波段列表(以 cm⁻¹ 为单位的峰位置),而非数字化的吸收光谱迹线,这是文献出版物中报告的形式。
- 数据规模:完整语料库包含 121,233 条记录,其中主可再分发子集(
commercial配置)包含 88,545 条记录。 - 来源:119,345 条来自 PMC(PubMed Central),1,888 条来自 Chemotion/RADAR4Chem。
- 多模态组合:包含 33,201 条同时具备完整 IR + ¹H + ¹³C + 结构的四元组记录。
配置与分割
| 配置名称 | 记录数 | 说明 |
|---|---|---|
commercial |
88,545 | 主要可再分发子集(CC-BY + CC0) |
all |
121,233 | 完整语料库(多许可证,每行有标记) |
non_commercial |
21,823 | 保留的 CC-BY-NC 记录 |
sharealike |
1,897 | Chemotion CC-BY-SA-4.0 及少量 PMC SA |
resolved |
43,060 | 结构关联记录(100%,多许可证) |
train_no_bench |
42,808 | 推荐训练集,已排除基准测试重叠 |
train_no_bench_nmr |
32,949 | 同上,但要求同时具备 ¹H 和 ¹³C |
记录字段
每条 JSONL 记录包含以下字段:
id/inchikey:化合物标识符smiles/selfies:分子结构表示ir_bands_cm-1:红外波段列表(数值数组)h_nmr/c_nmr:核磁共振位移列表(文本形式)ir_source:IR 数据来源(实验)source_doi/pmcid:文献来源标识license/license_pool:许可证信息及商业可用性分类license_source:许可证信息来源
配套基准
IRSpectra-Bench 是基于 IRexp 构建的盲测峰列表基准,包含 194 个结构解析问题。训练时不要使用 train_no_bench 之外的配置以避免基准泄漏,特别警告勿使用旧的 irexp_release/train.jsonl.gz 分割(与基准有 117/200 的 InChIKey-14 重叠)。
局限说明
- 数据为波段列表而非完整光谱,PMC 来源中位数为 9 个波段(Chemotion 为 39 个)。
- 文献转录数据,实验室和仪器存在异质性。
- 结构解析覆盖率约为全部记录的 35%。
- IR 字符串的提取召回率尚未经过人工审计(转录保真度已审计:60 篇文献共 560 个波段全部通过)。
许可证
多许可证混合,商业训练应使用 commercial 配置(CC-BY + CC0),完整 all 分割不应视为统一 CC-BY 许可。许可证信息按文章通过 Europe PMC 关联并标记于每条记录上。




