遇见数据集

ChemCoTBench

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

ChemCoTBench是一个专注于化学分子编辑、优化、理解和反应推理的数据集。该数据集是原始ChemCoTBench的去重镜像,并统一添加了ground_truth、response和scoring_context三列。数据集包含四个子任务配置:mol_edit(分子编辑)、mol_opt(分子优化)、mol_und(分子理解)、reaction(化学反应),以及一个合并所有子任务的all配置。每个子任务均提供训练集和测试集,总样本量为:测试集1495条,训练集27494条。具体子任务数据分布:mol_edit训练集4497条、测试集100条;mol_opt训练集5025条、测试集600条;mol_und训练集7690条、测试集320条;reaction训练集10282条、测试集475条。数据集的训练集query根据子任务采用不同的渲染方式,例如对于六个子任务(add、delete、sub、equivalence、fs、rcr),其训练query完全按照对应子任务测试提示的完整格式渲染;其他子任务的训练query保留自身语料并附加基准回复格式块。特别地,fs子任务的训练集ground_truth使用反应的主要产物(来自meta.rxn_smiles),而非上游的副产物。该数据集适用于化学领域的分子编辑、优化、理解以及化学反应推理等任务。

ChemCoTBench is a dataset focused on chemical molecule editing, optimization, understanding, and reaction reasoning. It includes four subtask configurations: mol_edit (molecule editing), mol_opt (molecule optimization), mol_und (molecule understanding), and reaction (chemical reaction), as well as an all configuration that merges all subtasks. Each subtask provides training and test sets. Total samples: test set 1495, training set 27494. Subtask data distribution: mol_edit (training 4497, test 100), mol_opt (training 5025, test 600), mol_und (training 7690, test 320), reaction (training 10282, test 475). The training set query rendering varies by subtask; for the fs subtask, the ground_truth uses the main product of the reaction. The dataset is suitable for tasks in chemical molecule editing, optimization, understanding, and reaction reasoning.

创建时间:
2026-09-03
原始信息汇总

ChemCoTBench 数据集概述

基本信息

  • 许可证:MIT
  • 标签:化学(chemistry)、分子编辑(molecular-editing)、推理(reasoning)

数据集结构

该数据集包含 5 个配置(config),分别为 mol_editmol_optmol_undreactionall(综合配置),每个配置均提供训练集(train)和测试集(test)划分,数据文件以 Parquet 格式存储。其中 all 配置整合了前四个任务的全部训练和测试数据。

数据规模

配置 训练集 测试集
mol_edit 4,497 100
mol_opt 5,025 600
mol_und 7,690 320
reaction 10,282 475
总计 27,494 1,495

数据内容与特点

  • 该数据集是 mtybilly/ChemCoTBench 的去重镜像版本(版本标识:7b17148acba5e5aee716de1fe3d0db1a0bdf48e5),在保留原始字段的基础上,统一新增了 ground_truthresponsescoring_context 三列。
  • 六个子任务的训练集 query 字段以该子任务基准测试提示的完整格式呈现(包括 adddeletesubequivalencefsrcr),其余子任务的训练集 query 保持原语料措辞,并附加了基准的回复格式块。
  • 特别说明:fs 子任务的训练集 ground_truth 为反应的主要产物(源自 meta.rxn_smiles),而非上游的 gt(副产物,保留为原始列),因为该子任务的训练行现已按照测试提示所需的主产物格式呈现。

应用方向

该数据集面向化学领域的分子编辑与推理任务,涵盖分子编辑、分子优化、分子理解和化学反应等多个子任务场景。

搜集汇总
数据集介绍
ChemCoTBench 数据集图片
构建方式
ChemCoTBench数据集源自化学领域中对分子编辑、优化、理解及化学反应推理的复杂需求,通过整合mtybilly/ChemCoTBench原始数据并去重,构建了一个统一列格式(ground_truth, response, scoring_context)的多任务基准。数据划分为四类子任务(mol_edit, mol_opt, mol_und, reaction)及全量集合,其中训练集query针对各子任务测试提示结构进行了定制渲染,如化学编辑子任务采用完整提示形式,而其他子任务保留原始语料并附加回复格式模块。该构建方式确保了任务的一致性和提示的完整性,为后续模型评估提供了标准化基础。
使用方法
使用ChemCoTBench数据集时,研究者可根据研究目标选用特定子任务配置(如mol_edit或reaction)或全量配置(all),以训练和评估化学推理模型。数据格式为parquet,便于加载和处理。每条记录包含查询(query)和标准答案(ground_truth),并附带响应和评分上下文(response, scoring_context),支持多种评估协议。建议将测试集用于模型基准测试,训练集用于微调或提示工程,以优化模型在分子编辑和反应预测等任务上的表现。
背景与挑战
背景概述
ChemCoTBench数据集由AutoDataSci团队于近期创建,旨在系统评估和提升大语言模型在化学分子编辑与反应推理任务中的链式思考能力。该数据集覆盖分子编辑、分子优化、分子理解及化学反应四大核心子任务,包含超过27,000条训练样本和1,495条测试样本,为化学信息学与人工智能交叉领域提供了标准化基准。其影响在于推动LLM从静态分子性质预测向动态分子编辑与复杂反应推理的范式转变,为药物设计和合成路线规划等应用奠定数据基础。
当前挑战
该领域面临的核心挑战在于化学反应与分子编辑的复杂性:化学空间庞大且离散,反应条件多变,产物预测需多层次推理,而现有模型常缺乏化学常识和精确的空间异构理解。ChemCoTBench构建过程中,需统一多来源数据的标注格式(如将副产品与主产品分离),确保不同子任务提示的一致性,并构建高质量答案用于思维链训练。此外,数据去重和清洗以保证模型泛化能力,也是工程实践中的关键技术难点。
常用场景
经典使用场景
ChemCoTBench数据集是面向化学分子编辑与反应推理的多任务基准,专为评估和提升大语言模型在化学领域的复杂推理能力而设计。其经典使用场景包括分子编辑(如添加、删除、替换基团)、分子优化、分子理解以及化学反应预测等子任务。研究者可利用该数据集对模型进行微调或零样本测试,以检验其在化学语言理解、结构-性质关系推理以及反应条件预测等方面的表现。该数据集提供了结构化的训练与测试划分,支持多子任务联合训练与评估,为化学人工智能模型的开发与验证提供了标准化平台。
解决学术问题
该数据集解决了化学信息学中缺乏高质量、多任务、推理型基准的问题。传统数据集多聚焦于单一任务或静态性质预测,难以评估模型在动态分子编辑及反应逻辑上的推理能力。ChemCoTBench通过构建分子编辑、优化、理解和反应四大类任务,促进了模型对化学知识的内在表征学习,推动了从简单模式识别向因果推理的转变。其科学意义在于为化学大模型的研究提供统一评估框架,有助于揭示模型在化学推理中的短板,引导未来模型架构与训练策略的改进。
实际应用
在实际应用中,ChemCoTBench可助力药物研发中的分子骨架编辑、先导化合物优化、合成路线设计与反应产物预测等环节。例如,在药物化学中,研究人员可利用该数据集训练的模型快速生成候选分子并评估其可行性,从而缩短新药发现周期。在化学教育领域,该数据集可用于开发智能辅导系统,辅助学生理解分子结构与反应机理。此外,该数据集支持自动化合成规划平台,通过对反应产物的准确预测,减少实验试错成本,具有显著的工业价值。
数据集最近研究
最新研究方向
ChemCoTBench数据集的最新研究方向聚焦于化学分子编辑、优化、理解及反应预测的链式推理能力评估,其多子任务结构(mol_edit, mol_opt, mol_und, reaction)推动了大语言模型在化学领域的深度推理与知识整合。该数据集通过基准测试提示的统一渲染,强化了模型对分子结构变化、属性优化及反应路径的因果逻辑理解,为化学信息学中的自动化科学发现提供了标准化的评测基准。其大规模训练集与精心划分的测试集,支持了面向复杂化学问题的可解释AI模型开发,尤其在药物分子设计与合成路线规划中具有应用潜力,促进了化学与人工智能交叉领域的前沿探索与验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务