遇见数据集

insilicomedicine/chemcensor

收藏
Hugging Face2026-05-28 更新2026-06-14 收录
官方服务:

资源简介:

ChemCensor DataBase是一个SQLite数据库,用于ChemCensor框架,以评估反应的化学合理性。它通过分离反应中心(反应过程中变化的部分)和功能组上下文(必须容忍的部分),并检查类似模式是否有文献支持的合成先例,来评分反应。数据库基于USPTO-full反应数据集构建,包含从1976年至2016年9月美国专利中文本挖掘提取的反应。数据库包括反应中心先例信息、功能组兼容性信息以及ChemCensor评分管道所需的关系映射。数据集以压缩的.zip文件形式分发,解压后为.sqlite文件,适用于chemcensor>=1.0.0版本。

ChemCensor Database is a SQLite database designed for the ChemCensor framework, which is used to evaluate the chemical plausibility of reactions. It scores reactions by separating the reaction center (the moieties that change during the reaction) and the functional group context (the parts that must be tolerated), and checking whether similar patterns have literature-supported synthetic precedents. The database is built on the USPTO-full reaction dataset, containing reactions extracted and mined from the text of US patents published between September 1976 and September 2016. It includes reaction center precedent information, functional group compatibility information, and relational mappings required for the ChemCensor scoring pipeline. The dataset is distributed as a compressed .zip archive; once decompressed, it becomes a .sqlite file compatible with chemcensor >= 1.0.0.

提供机构:
insilicomedicine
搜集汇总
数据集介绍
insilicomedicine/chemcensor 数据集图片
构建方式
ChemCensor数据库基于USPTO-full反应数据集构建,该数据集由Lowe通过文本挖掘技术从1976年至2016年9月期间的美国专利中提取而成。数据库以SQLite格式存储,内含预计算的反应中心先例信息、官能团兼容性数据以及评分管线所需的关系映射。构建过程中,数据库将反应中心(反应过程中发生变化的化学位点)与官能团上下文(需被容忍的化学环境)分离,并系统性地检索文献中记载的合成先例,从而为每个候选反应赋予0至5的整数置信度评分,分值越高代表先例支持越强。
特点
ChemCensor数据库的核心特色在于其基于先例的化学合理性评估机制。通过分离反应中心与官能团上下文,数据库能够精准判断拟议的逆合成步骤是否与已报道的合成模式相符。该数据库与ChemCensor软件包深度集成,支持命令行与Python API调用,可直接在逆合成分析流程中调用。其评分结果以整数形式呈现,直观反映反应步骤的文献支持强度,为化学家提供了一种可量化、可复现的反应可行性评估工具。
使用方法
使用ChemCensor数据库需先从Hugging Face仓库下载并解压SQLite文件,随后克隆ChemCensor的GitHub代码库。将解压后的数据库文件置于ChemCensor配置指定的路径下,即可通过命令行或Python接口进行反应评分。典型工作流包括:下载数据集、解压数据库、安装ChemCensor、配置数据库路径、运行候选反应的评分程序。详细用法请参考ChemCensor官方仓库文档,其中提供了精确的API使用指南与示例。
背景与挑战
背景概述
化学逆合成分析是药物研发与有机合成中的核心任务,旨在将目标分子逐步拆解为简单易得的起始原料。近年来,深度学习方法在此领域取得了显著进展,但现有模型常生成化学上不可行的反应路径。为应对这一挑战,Insilico Medicine的研究团队于2026年推出了ChemCensor数据库,该数据库基于Lowe等人构建的USPTO-full专利反应数据集,涵盖了1976年至2016年间美国专利中通过文本挖掘提取的海量反应信息。ChemCensor通过将反应中心与官能团环境分离,并匹配文献记录以评估反应合理性,为逆合成预测提供了基于先例的化学可行性评分框架,有力推动了该领域的标准化评估。
当前挑战
当前逆合成预测面临的核心挑战在于生成路径的化学合理性难以保障,传统模型常用基于规则的评估或简单统计学检验,难以捕捉复杂反应中的官能团兼容性细节。ChemCensor的构建过程中,需从大规模、噪声较多的专利文本中抽取并结构化反应中心与官能团的先验知识,处理反应类型多样性及数据稀疏性问题。此外,将分离的反应中心与官能团环境进行高效索引和查询,并设计一致的评分体系(0至5级),要求兼顾计算效率与化学直觉,这构成了数据集构建与模型应用的双重挑战。
常用场景
经典使用场景
在逆合成分析与化学信息学领域,ChemCensor数据集为评估逆合成步骤的反应化学合理性提供了一个基于先例的知识框架。研究人员通常利用该数据集中的SQLite知识库,通过查询反应中心模式与官能团兼容性信息,对候选反应赋予0至5的置信度评分。这一过程使得计算化学家能够系统性地判断某一逆合成断裂方案是否有文献先例支撑,从而在数以千计的候选路线中筛选出合成可信度最高的步骤,成为现代计算机辅助合成规划中不可或缺的合理性验证工具。
实际应用
在新药研发与有机合成工业中,ChemCensor数据集的实际应用体现在作为药物化学家与自动化合成平台的决策支持引擎。当计算模型生成多条候选逆合成路径时,该数据库可快速过滤掉缺乏先例支持的不合理反应,将科研人员的注意力集中在最具有实验验证价值的转化上。此外,在专利化学反应挖掘与合成手册编纂工作中,其结构化的先例知识还能辅助审查人员判断特定反应类型在历史专利文献中的支持力度,加速药物分子与先进材料的合成路线优化进程。
衍生相关工作
基于ChemCensor数据集及其框架,衍生出了若干具有影响力的学术工作。首先,该数据库作为核心知识组件,支撑了ChemCensor评分系统的完整实现,其论文提出了重新思考单步逆合成基准的观点,引发了对LLM评估范式的广泛讨论。其次,该数据集促进了反应先例匹配算法的改进,推动了将官能团容忍性数据融入机器学习模型的尝试。此外,部分研究以USPTO-full数据子集为基准,结合ChemCensor的知识映射展开对比实验,进一步催生了融合化学先验与深度学习的新型逆合成规划策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务