CompChemBench
收藏资源简介:
一个用于评估AI代理在真实计算化学工作上的基准数据集,涵盖输入准备、运行模拟、解析输出、调试故障设置和链式多步骤工作流,使用开源工具(ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit和xtb)。任务遵循Terminal-Bench / Harbor(TB 2.0)格式,包含40个任务,难度分为简单、中等和困难,并采用终端状态验证和独立重新计算进行评分。
A benchmark dataset for evaluating AI Agents on real-world computational chemistry tasks, covering input preparation, running simulations, parsing simulation outputs, debugging faulty workflow setups, and chained multi-step computational workflows. It utilizes open-source tools including ASE, LAMMPS, CP2K, Quantum ESPRESSO, RDKit, and xtb. The tasks follow the Terminal-Bench / Harbor (TB 2.0) format, comprising 40 tasks categorized into three difficulty levels: easy, medium, and hard. Scoring is performed via terminal state validation and independent recalculation.
CompChemBench 数据集概述
基本信息
CompChemBench 是一个专门用于评估 AI 代理在真实计算化学工作流程中表现的基准测试数据集。该数据集基于 Terminal-Bench / Harbor (TB 2.0) 任务格式构建,确保任何兼容该格式的测试框架均可直接运行。
覆盖的软件工具:ASE、LAMMPS、CP2K、Quantum ESPRESSO、RDKit、xtb(均为开放源代码工具)
任务类别:输入准备(6个)、执行(13个)、分析(11个)、调试(6个)、多步工作流(4个)
许可证:Apache License 2.0
数据集规模与难度分布(v1.1 — 40个任务)
| 软件 \ 类别 | 输入准备 | 执行 | 分析 | 调试 | 工作流 | 总计 |
|---|---|---|---|---|---|---|
| ASE | 2 | 2 | 2 | 1 | 1 | 8 |
| LAMMPS | 1 | 2 | 3 | 2 | 1 | 9 |
| CP2K | — | 4 | 1 | 1 | — | 6 |
| Quantum ESPRESSO | 1 | 2 | 2 | 1 | 1 | 7 |
| RDKit | 2 | 1 | 2 | 1 | 1 | 7 |
| xtb | — | 2 | 1 | — | — | 3 |
| 总计 | 6 | 13 | 11 | 6 | 4 | 40 |
难度分布:10个简单(25%)、18个中等(45%)、12个困难(30%)
评估机制
- 终端状态验证:评分基于终端状态的四层验证体系,包括资产完整性验证、输出文件存在性验证、本地输出完整性验证、数值容差验证和交叉验证。
- 独立重新计算:验证器使用镜像内软件重新计算代理的最终状态,确保只有真正完成了计算任务的代理才能通过。
- 二进制评分:通过为1分,失败为0分,无部分得分。
仓库结构
compchem-bench/ ├── README.md # 本文件 ├── DATASET_CARD.md # 完整数据集卡片 ├── registry.toml # 数据集索引 ├── baselines/ # 排行榜与基线运行报告 ├── shared/ # 跨任务共享资源 │ ├── potentials/ # EAM势场文件、GTH赝势、基组 │ └── structures/ # 通用CIF/xyz起始结构 ├── tasks/ # 任务目录 │ └── <软件>-<主题>-<限定词>/ # 单个任务目录 │ ├── task.toml # 元数据/验证器/代理/环境配置 │ ├── instruction.md # 任务描述(不含参考值) │ ├── environment/ # 环境配置 │ ├── solution/ # 参考解决方案 │ └── tests/ # 测试与验证逻辑 └── .ci/ # 本地CI工具
可重复性保障
- 规范架构:x86_64
- 版本锁定:每个镜像固定精确版本(标签+摘要/tarball哈希)
- 封闭运行时:运行时
network=false,所有依赖均在镜像内 - 校准协议:参考求解在CI镜像上运行至少5次,容差 = max(3×观测散布, 物理最小分辨率)
当前排行榜
| 模型 | 代理 | 日期 | 通过率 |
|---|---|---|---|
| deepseek-v4-pro (DeepSeek API) | Claude Code 2.1.215 | 2026-07-21 | 32/40 = 80.0% |
设计原则
- 排除商业软件:不包含VASP、Gaussian等商业软件,所有任务均可使用自由分发的工具端到端运行和重新计算。
- 防止数据污染:本仓库包含参考答案和参考求解,明确禁止用于模型训练。计划使用保留的私有分割作为后续评估。
- 防作弊设计:每个任务附带一个作弊脚本,CI要求该脚本必须失败(同时参考求解必须通过、空代理必须失败)。
引用格式
bibtex @misc{compchembench2026, title = {CompChemBench: A Benchmark for AI Agents on Computational Chemistry Tasks}, author = {Wu, Chenghao}, year = {2026}, url = {https://github.com/Chenghao-Wu/compchem-bench} }




