遇见数据集

CompChemBench

收藏
github2026-07-22 更新2026-07-27 收录
官方服务:

资源简介:

一个用于评估AI代理在真实计算化学工作上的基准数据集,涵盖输入准备、运行模拟、解析输出、调试故障设置和链式多步骤工作流,使用开源工具(ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit和xtb)。任务遵循Terminal-Bench / Harbor(TB 2.0)格式,包含40个任务,难度分为简单、中等和困难,并采用终端状态验证和独立重新计算进行评分。

A benchmark dataset for evaluating AI Agents on real-world computational chemistry tasks, covering input preparation, running simulations, parsing simulation outputs, debugging faulty workflow setups, and chained multi-step computational workflows. It utilizes open-source tools including ASE, LAMMPS, CP2K, Quantum ESPRESSO, RDKit, and xtb. The tasks follow the Terminal-Bench / Harbor (TB 2.0) format, comprising 40 tasks categorized into three difficulty levels: easy, medium, and hard. Scoring is performed via terminal state validation and independent recalculation.

创建时间:
2026-07-10
原始信息汇总

CompChemBench 数据集概述

基本信息

CompChemBench 是一个专门用于评估 AI 代理在真实计算化学工作流程中表现的基准测试数据集。该数据集基于 Terminal-Bench / Harbor (TB 2.0) 任务格式构建,确保任何兼容该格式的测试框架均可直接运行。

覆盖的软件工具:ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit、xtb(均为开放源代码工具)

任务类别:输入准备(6个)、执行(13个)、分析(11个)、调试(6个)、多步工作流(4个)

许可证:Apache License 2.0

数据集规模与难度分布(v1.1 — 40个任务)

软件 \ 类别 输入准备 执行 分析 调试 工作流 总计
ASE 2 2 2 1 1 8
LAMMPS 1 2 3 2 1 9
CP2K 4 1 1 6
Quantum ESPRESSO 1 2 2 1 1 7
RDKit 2 1 2 1 1 7
xtb 2 1 3
总计 6 13 11 6 4 40

难度分布:10个简单(25%)、18个中等(45%)、12个困难(30%)

评估机制

  • 终端状态验证:评分基于终端状态的四层验证体系,包括资产完整性验证、输出文件存在性验证、本地输出完整性验证、数值容差验证和交叉验证。
  • 独立重新计算:验证器使用镜像内软件重新计算代理的最终状态,确保只有真正完成了计算任务的代理才能通过。
  • 二进制评分:通过为1分,失败为0分,无部分得分。

仓库结构

compchem-bench/ ├── README.md # 本文件 ├── DATASET_CARD.md # 完整数据集卡片 ├── registry.toml # 数据集索引 ├── baselines/ # 排行榜与基线运行报告 ├── shared/ # 跨任务共享资源 │ ├── potentials/ # EAM势场文件、GTH赝势、基组 │ └── structures/ # 通用CIF/xyz起始结构 ├── tasks/ # 任务目录 │ └── <软件>-<主题>-<限定词>/ # 单个任务目录 │ ├── task.toml # 元数据/验证器/代理/环境配置 │ ├── instruction.md # 任务描述(不含参考值) │ ├── environment/ # 环境配置 │ ├── solution/ # 参考解决方案 │ └── tests/ # 测试与验证逻辑 └── .ci/ # 本地CI工具

可重复性保障

  • 规范架构:x86_64
  • 版本锁定:每个镜像固定精确版本(标签+摘要/tarball哈希)
  • 封闭运行时:运行时 network=false,所有依赖均在镜像内
  • 校准协议:参考求解在CI镜像上运行至少5次,容差 = max(3×观测散布, 物理最小分辨率)

当前排行榜

模型 代理 日期 通过率
deepseek-v4-pro (DeepSeek API) Claude Code 2.1.215 2026-07-21 32/40 = 80.0%

设计原则

  • 排除商业软件:不包含VASP、Gaussian等商业软件,所有任务均可使用自由分发的工具端到端运行和重新计算。
  • 防止数据污染:本仓库包含参考答案和参考求解,明确禁止用于模型训练。计划使用保留的私有分割作为后续评估。
  • 防作弊设计:每个任务附带一个作弊脚本,CI要求该脚本必须失败(同时参考求解必须通过、空代理必须失败)。

引用格式

bibtex @misc{compchembench2026, title = {CompChemBench: A Benchmark for AI Agents on Computational Chemistry Tasks}, author = {Wu, Chenghao}, year = {2026}, url = {https://github.com/Chenghao-Wu/compchem-bench} }

搜集汇总
数据集介绍
CompChemBench 数据集图片
构建方式
CompChemBench的构建遵循Terminal-Bench/Harbor(TB 2.0)任务格式,每个任务被封装为自包含的目录结构,包含指令文件instruction.md、环境配置Dockerfile、资产文件、参照及测试脚本。数据集覆盖六大开源计算化学工具(ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit、xtb)在输入准备、执行、分析、调试与工作流五个类别上的40项任务,难度分布为简单10项、中等18项、困难12项,通过registry.toml索引文件统一管理。
特点
该数据集的核心特点在于其严谨的反作弊与可复现性设计。评分采用终端状态验证,通过独立重计算机制确保结果的真实性——验证器在容器内利用原生软件重新评估智能体的最终状态,仅当原生日志、提交的results.json与重计算值在紧密容差内一致时才判定为通过。每个任务均配备必须失败的作弊基线脚本与必须通过的真实求解脚本,同时通过资产完整性校验、静态lint检查及离线运行时网络限制,杜绝数据泄漏与投机行为。
使用方法
使用CompChemBench时,研究者需借助兼容Harbor格式的运行器,指向tasks/目录下任一任务文件夹。运行器自动构建environment/Dockerfile中的镜像,将instruction.md呈现给智能体作为指令,任务完成后由tests/test.sh执行评估并写入/logs/verifier/reward.txt文件(1为成功,0为失败)。本地开发者可利用.ci/下的lint_task.py进行结构检查,通过run_ci.sh执行单任务完整CI流程,或借助run_all.sh对全部40项任务进行批量验证,确保新增任务满足严格的门控条件。
背景与挑战
背景概述
计算化学作为连接理论与实验的桥梁,其工作流高度依赖专业软件进行分子模拟与性质预测。然而,传统工作流涉及输入文件准备、仿真执行、结果解析及错误调试等多个繁琐环节,对研究人员的经验要求极高。随着人工智能代理技术的崛起,利用AI自动化执行此类复杂任务成为领域内的重要探索方向。2026年,研究者Chenghao Wu发布了CompChemBench基准测试集,旨在系统性评估AI代理在真实计算化学任务中的执行能力。该基准覆盖了ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit及xtb等六种广泛使用的开源工具,围绕输入准备、执行、分析、调试及多步骤工作流五大维度设计了40项任务,难度分布从简单至困难,为衡量AI代理的化学计算素养提供了标准化平台。
当前挑战
CompChemBench所面对的挑战是多维度的。在领域问题层面,计算化学工作流的自动化长期受困于任务的非标准化与高精度要求:不同软件间输入格式各异、参数组合复杂,且仿真结果的正确性需依赖严格的物理验证。现有AI系统往往在单一环节表现良好,却难以连贯完成从建模到分析的完整链路。在基准构建过程中,团队面临的关键挑战包括设计防作弊机制,确保智能体必须真实执行运算而非猜测答案;实现终端状态验证的独立重计算,通过容器内软件重现计算结果,杜绝任何形式的伪造;以及维护可复现性,通过锁定软件版本、使用无网络运行时环境等手段,保证每次评测结果的一致性。此外,还需平衡任务难度覆盖与工具多样性,在有限任务数内全面映射计算化学的典型场景。
常用场景
经典使用场景
在计算化学与人工智能交叉领域,CompChemBench被设计用于评估AI智能体在真实计算化学工作流中的端到端执行能力。其40个任务横跨ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit和xtb六款主流开源软件,覆盖输入准备、模拟执行、结果分析、程序调试及多步骤工作流程五大类别。任务难度分布为25%简单、45%中等和30%困难,通过终端状态验证和独立重计算机制确保评估的可靠性。研究者可利用该基准测试其AI系统在化学模拟全流程中的自主操作水平,尤其在处理真实科研环境中常见的软件配置错误、参数调优与输出解析等复杂场景时的表现。
衍生相关工作
CompChemBench的出现已催生了一系列重要的衍生研究方向。其基础架构被后续工作扩展至周期性体系电子结构计算的新任务,以及将密度泛函理论自动化粗粒化力场拟合等高级工作流程纳入评估范畴。基准的反作弊设计理念——包括资产完整性校验、本地重计算验证和知情欺骗攻击测试——已被多个AI4Science基准采纳为标准实践。此外,基于该基准的排行榜机制激发了多轮AI智能体架构的迭代,特别是围绕多步推理与工具调用的系统设计,推动了如面向科学计算的检索增强生成和自主验证反馈循环等新方法的产生。
数据集最近研究
最新研究方向
CompChemBench作为专为评估AI智能体在真实计算化学工作中表现而设计的基准测试,当前研究前沿聚焦于如何让大型语言模型驱动的自主代理高效完成多步骤、跨工具的复杂工作流。该基准覆盖了ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit和xtb等主流开源计算化学软件,任务涵盖输入准备、模拟执行、结果解析、错误调试及工作流编排五大核心类别,难度分布精心设置,其中中等难度任务占比最高。最新的基线测试显示,DeepSeek-v4-pro模型结合Claude Code代理已达到80%的通过率,标志着AI在计算化学自动化领域迈出了重要一步。研究热点包括通过独立性重计算验证机制防止作弊、实现终端状态验证的坚固性,以及通过私有测试集探测潜在的过拟合与数据污染问题。这一基准的推出对加速计算化学研究的自动化、降低重复性劳动门槛具有深远意义,也为AI agents在科学计算领域的通用性评估树立了新的标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务