遇见数据集

UniParser/MolParser-7M

收藏
Hugging Face2026-06-05 更新2026-01-03 收录
官方服务:

资源简介:

MolParser-7M是一个用于分子结构视觉识别的数据集,包含近800万对图像-SMILES数据。图像标注采用扩展的SMILES格式。数据集包括以下子集:MolParser-7M(预训练)包含超过770万合成训练数据;MolParser-SFT包含人类标记的真实分子图像用于微调;MolParser-Val包含一个小型验证集,用于训练过程中快速验证模型能力;WildMol Benchmark包含从真实专利或论文中裁剪的2万分子结构图像,分为test_simple_10k(WildMol-10k)和test_markush_10k(WildMol-10k-M)两个子集。该数据集基于论文《MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild》(ICCV2025接受)提出,主要用于非商业用途。

MolParser-7M is a dataset for visual recognition of molecule structures, containing nearly 8 million paired image-SMILES data. The image captions are in an extended-SMILES format. The dataset includes the following subsets: MolParser-7M (Pretrain) with over 7.7M synthetic training data; MolParser-SFT with human-labeled real molecule figures for fine-tuning; MolParser-Val, a small validation set for quick model validation during training; and WildMol Benchmark with 20k molecule structure images cropped from real patents or papers, divided into test_simple_10k (WildMol-10k) and test_markush_10k (WildMol-10k-M) subsets. It is proposed in the paper MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild (ICCV2025 accept) and intended for non-commercial use only.

提供机构:
UniParser
搜集汇总
数据集介绍
UniParser/MolParser-7M 数据集图片
构建方式
MolParser-7M数据集由深度求索(DP Tech)团队构建,旨在为分子结构图像的端到端视觉识别提供大规模训练资源。其预训练子集(pretrain_synthetic_7M)包含超过770万对合成图像与扩展SMILES标注,通过程序化渲染方式生成多样化的分子结构图,覆盖丰富的化学空间。微调子集(sft_real)包含超过9万张人工标注的真实分子图像,源自专利和学术文献,确保图像风格与现实应用场景高度一致。验证集(valid)精选403个野外样本,用于训练过程中的快速模型评估。此外,测试集分为test_simple_10k与test_markush_10k,各含1万张从真实文献裁剪的分子图,分别代表常规结构和马库什结构,构成WildMol基准测试。
特点
该数据集的核心特点在于其规模庞大且层次分明的结构设计。预训练数据采用合成方式,保证了数据量充足与标注一致性;而微调数据基于人工标注,弥补了合成数据与现实偏差,提升了模型在复杂场景中的鲁棒性。数据集统一采用图像与扩展SMILES字符串配对格式,其中扩展SMILES是论文中提出的新型分子表示法,提升了化学结构描述的完整性与解析能力。此外,数据集包含专门用于评估的WildMol基准,涵盖简单的常规结构与复杂的马库什结构,为分子光学识别任务提供了多维度的评测标准。所有数据均遵守CC-BY-NC-SA 4.0协议,仅限非商业使用。
使用方法
使用MolParser-7M时,可通过HuggingFace数据集加载接口直接获取各子集。预训练阶段推荐使用pretrain_synthetic_7M,结合模型进行图像到SMILES序列的映射学习;随后在sft_real子集上进行监督微调以增强对真实场景的适应性。验证集valid可用于训练过程中的性能监控。在评估阶段,test_simple_10k与test_markush_10k分别用于衡量模型在简单分子图与马库什结构图上的识别精度。考虑到部分sft_real数据已被预留用于后续举办的OCSR竞赛,用户需留意许可证变化和竞赛公告。加载时需指定配置名,例如'pretrain_synthetic_7M',每个配置包含image与SMILES两个特征字段。
背景与挑战
背景概述
在化学与药物研发领域,分子结构图的自动识别是实现大规模化学信息数字化和智能化处理的关键技术瓶颈。MolParser-7M数据集由深度求索公司(DP Tech)的方曦、王健坤等研究人员于2024年创建,旨在解决真实场景中分子结构图像的端到端视觉识别问题。该数据集包含近800万对图像与SMILES序列(扩展SMILES格式),其中预训练子集包含超过770万合成数据,微调子集包含超过9万人工标注的真实分子图,并构建了WildMol基准测试集,涵盖2万张源自真实专利和论文的分子结构图。作为首个大规模分子结构视觉识别数据集,MolParser-7M为光化学结构识别(OCSR)任务提供了标准化训练与评估平台,其影响力已获2025年ICCV会议接收。
当前挑战
该数据集面临的挑战主要来自领域问题和构建过程两个层面。在领域层面,真实场景中的分子结构图存在图像噪声、旋转扭曲、重叠标记及不同化学记法(如Markush结构)等复杂情况,传统的基于规则或OCR的方法难以应对,亟需端到端的视觉识别模型来直接解析结构信息。在构建过程中,合成数据与真实数据之间的分布差异显著,需针对性设计预训练-微调两阶段策略以提升模型泛化能力。此外,大规模数据的标注成本极高,9万张真实子集中的细致人工标注耗费大量资源,且数据集对不同化学文献风格的覆盖度需持续验证,以确保其在工业界的实用价值。
常用场景
经典使用场景
MolParser-7M作为大规模分子结构图像与SMILES表示的配对数据集,在化学信息学与计算机视觉交叉领域中开创了端到端分子结构识别的新范式。其经典应用场景聚焦于训练深度学习模型,将包含复杂化学结构的图像(如专利文献、学术论文中的化学式)直接转换为标准化的SMILES字符串。该数据集包含约770万条合成预训练数据及9万余条人工标注的真实分子图像数据,尤其适用于两阶段训练范式:先通过大规模合成数据预训练模型基础识别能力,再利用真实数据微调以增强对复杂布局、噪声背景和多样化风格的鲁棒性。其精心设计的测试集(如WildMol Benchmark)为评估模型在专利和论文场景下的泛化性能提供了标准化基准。
实际应用
在实际应用中,MolParser-7M赋能了多个对化学知识自动化获取有刚性需求的场景。在药物研发领域,它可自动提取文献和专利中的分子结构,辅助构建化合物活性数据库和结构-活性关系(SAR)分析,极大节省人工检索和录入的时间成本。在学术出版领域,该技术能够实现论文中化学式的自动索引与结构化归档,推动化学知识的机器可读化进程。此外,在化学教育和知识产权保护中,该系统可用于批量化识别化学专利中的关键分子,支持侵权检测和文献综述自动化。基于MolParser-7M训练的模型已在开源演示平台中展现了对复杂分子结构图谱的高质量解析能力,成为连接视觉化学信息与计算化学分析的重要桥梁。
衍生相关工作
MolParser-7M的提出催生了多项具有重要影响的衍生研究工作。其核心论文《MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild》已被ICCV 2025接收,标志着计算机视觉顶会对化学结构识别方向的认可。围绕该数据集,研究者们进一步探索了多模态预训练策略,利用图像与SMILES的联合表示提升分子属性预测性能;同时,基于其基准测试衍生出了OCSR竞赛,激发了对复杂结构(如Markush结构)识别算法的系统性改进。此外,部分工作尝试将解析结果与分子生成模型耦合,构建从文献图像到新化合物设计的闭环流程。这些衍生工作共同推动了化学领域从人工分析向量化自动解读的范式变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务