遇见数据集

INCARBench

收藏
arXiv2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

INCARBench是由南开大学等机构构建的基准数据集,专门用于评估大语言模型在VASP软件INCAR文件配置任务上的性能。该数据集包含768个案例,涵盖48种来自16个材料家族的典型材料,并集成静态自洽场计算、几何弛豫等四种工作流类型,数据源自Materials Project的计算记录并经过标准化处理。数据集的构建通过系统化采样和错误注入流程,区分生成与修复任务以全面评估模型能力。该数据集主要应用于计算材料科学领域,旨在解决大语言模型在科学计算配置中物理意图编码、参数协调及工作流一致性等关键能力的量化评估难题。

INCARBench is a benchmark dataset developed by Nankai University and other institutions, specifically designed to evaluate the performance of large language models (LLMs) on INCAR file configuration tasks for the VASP software. This dataset includes 768 cases covering 48 representative materials from 16 material families, and incorporates four workflow types such as static self-consistent field (SCF) calculations and geometric relaxation. All data is derived from computational records of the Materials Project and has been standardized. The dataset is constructed via systematic sampling and error injection workflows, and distinguishes between generation and repair tasks to comprehensively assess model capabilities. Primarily applied in the field of computational materials science, this dataset aims to address the challenges of quantitatively evaluating core capabilities of LLMs in scientific computing configuration, including physical intent encoding, parameter coordination, and workflow consistency.

创建时间:
2026-06-23
原始信息汇总

数据集概述

INCARBench 是一个用于评估大语言模型在 VASP INCAR 文件科学配置任务上的基准测试。它涵盖任务感知的 INCAR 生成与修复,并公开发布了基准元数据、评分脚本以及排行榜摘要。

该基准测试在 arXiv 论文中介绍:

  • 论文标题: INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models
  • arXiv: https://arxiv.org/abs/2606.23571
  • 作者: Bin Shao, Jixiang Li, Xinyue Zhang, Baishun Yang, Zhiyang Liu, Weichao Wang

数据集规模与构成

  • 当前基准版本定义于 problems/problem_set_v1.0.csv
  • 包含 192 个 INCAR 生成案例和 576 个 INCAR 修复案例(派生自生成基准)。
  • 案例集覆盖四种任务类型:
    • static_scf
    • geometry_relax
    • line_mode_bands
    • dos_nscf
  • 涵盖多种材料系列和挑战类型,包括 NSCF 工作流配置、DFT+U、SOC、vdW 修正、展宽(smearing)、对称性以及磁初始化。

评估范围

  • 评估 LLM 在 VASP INCAR 工作流级配置上的能力。
  • 不评估:KPOINTS、POTCAR、完整 VASP 运行与收敛、以及能量、力、磁矩或能带结构等下游物理可观测量的质量。
  • 结果应解读为对工作流准备和配置正确性的评估,而非完整的电子结构基准。

仓库内容

  • config/:示例模型/配置模板及提示模板
  • problems/:基准问题集 CSV 文件
  • scripts/:构建、运行、评分和报告生成脚本
  • incar_generation_benchmark/:已发布的 INCAR 生成元数据和排行榜
  • incar_repair_benchmark/:已发布的 INCAR 修复元数据和排行榜

使用方式

安装: bash pip install .

本地开发模式:pip install -e .

构建基准案例

  • 生成案例:vasp-incar-build-generation --csv problems/problem_set_v1.0.csv
  • 修复案例:vasp-incar-build-repair

运行模型

  • 生成:vasp-incar-run-generation
  • 修复:vasp-incar-run-repair

评分

  • 生成:vasp-incar-score-generation --model-name your_model_name
  • 修复:vasp-incar-score-repair --model-name your_model_name

生成报告

  • 生成报告:vasp-incar-report-generation
  • 修复报告:vasp-incar-report-repair

配置: 复制示例配置文件并编辑本地模型端点和密钥: bash cp config/llm_benchmark_config.example.json config/llm_benchmark_config.json

已发布产出

  • incar_generation_benchmark/leaderboards/ 中的生成排行榜摘要
  • incar_repair_benchmark/leaderboards/ 中的修复排行榜摘要
  • 基准元数据索引和构建报告
  • 完整本地运行日志、私有凭据及全案例级模型输出不包含在此公共导出中。

许可证

本项目采用 MIT 许可证,详见 LICENSE 文件。

搜集汇总
数据集介绍
INCARBench 数据集图片
构建方式
INCARBench基于16类代表性材料家族的48种材料构建生成任务,每种材料均与四种典型VASP工作流(静态自洽场计算、几何弛豫、能带结构非自洽场计算及态密度非自洽场计算)配对,共产生192个生成案例。修复任务从每个生成案例衍生出三种变体:正确保留变体、工作流错误变体及物理错误变体,其中分别考察模型对有效配置的保留能力、对工作流设定错误的修正能力以及对物理设定错误的修正能力,最终形成576个修复案例。每个案例均标注物理感知挑战类型以定位失败模式。参考配置源自Materials Project的VASP计算记录,并经标准化处理以作为评测基准。
使用方法
使用INCARBench时,研究者需将模型生成的INCAR文件与标准化参考配置进行对比。语义参数采用精确匹配判定,策略参数依据参数特定等价或容差规则评估,任务关键正确性要求所有关键参数组同时正确。提示模板、解析流程及评分脚本对所有模型保持一致以保障可复现性。数据集公开于GitHub仓库,支持在生成与修复两种任务框架下评测模型将科学意图转化为计算配置的能力,并可通过失败定位分析识别当前模型在特定材料与挑战类型组合中的薄弱环节。
背景与挑战
背景概述
INCARBench是由南开大学电子信息与光学工程学院的Bin Shao、Jixiang Li、Xinyue Zhang及合作者于2026年提出的基准测试,旨在评估大型语言模型在维也纳第一性原理模拟包(VASP)输入配置文件(INCAR)的生成与修复任务中的科学配置能力。该数据集覆盖48种材料、16类代表性材料家族及四种典型工作流类型,共包含192个生成案例和576个修复案例,是首个系统评估LLM在科学计算配置领域表现的标准化平台。INCARBench通过语义正确性、策略正确性和任务关键正确性三个互补维度度量配置质量,揭示了当前前沿模型在参数级准确性与科学有效配置之间的显著鸿沟,为计算材料科学中AI系统的可靠性研究奠定了关键基础。
当前挑战
该数据集所应对的领域核心挑战在于,LLM需将科学意图精准转化为物理意义上合理且工作流一致的VASP INCAR配置,这要求模型在参数选择、物理假设协调及工作流约束同步满足等多方面具备高度整合能力。现有评估多聚焦于科学知识或下游任务表现,鲜少触及输入配置这一关键环节。在构建过程中,基准设计面临双重挑战:一是如何从192个生成案例中系统性地注入物理错误与工作流错误以生成576个修复案例,确保错误类型覆盖NSCF工作流、DFT+U、磁性、范德华修正等物理耦合场景;二是如何定义并实施语义、策略与任务关键正确性三类维度的定量评估指标,以区分参数级准确性与科学级有效性。此外,修复任务中错误修正与有效配置保留构成一对矛盾能力,当前模型在平衡二者时仍存显著困难。
常用场景
经典使用场景
INCARBench的核心设计旨在系统评估大语言模型在密度泛函理论计算中配置VASP输入文件INCAR的能力。这一基准涵盖生成与修复两大经典任务:生成任务要求模型依据给定的材料类型与计算工作流,产出语义正确、策略恰当且满足任务关键需求的完整INCAR配置;修复任务则考察模型在保留已有正确参数的同时,精准定位并修正注入错误的能力。通过48种涵盖金属、半导体、氧化物、磁性材料等16类代表性体系的材料,以及静态自洽场计算、几何弛豫、能带结构非自洽场计算和态密度非自洽场计算四种典型工作流,INCARBench构建了192个生成案例与576个修复案例,为量化大语言模型的科学配置能力提供了标准化测试平台。
解决学术问题
INCARBench致力于弥合大语言模型在参数匹配精度与科学配置有效性之间的鸿沟。现有评测方法多聚焦于通用科学知识或下游预测性能,鲜有深入探究模型能否将科研意图转化为物理合理且工作流一致的物理计算配置。该基准引入了三重评价维度——语义正确性、策略正确性与任务关键正确性,首次揭示了参数级准确性并不等同于科学有效性这一关键现象。实证研究表明,当前前沿模型在DFT+U、磁性与关联材料等物理耦合场景中系统性地表现薄弱,且修复任务中的配置保留能力显著低于错误修正能力,这证明了物理理解、数值策略选择与工作流一致性是相互关联却截然不同的能力维度,为建立更可靠的AI驱动计算材料科学工作流奠定了方法论基础。
实际应用
在实际科研工作流中,INCARBench直接服务于自动化第一性原理计算的全流程优化。材料科学家和计算物理研究者可依托INCARBench来筛选或微调大语言模型,以辅助完成从科研设想到计算任务配置的关键转换环节,极大缩短人工调试VASP输入文件的时间成本。鉴于当前课题组间广泛存在的计算参数配置不一致问题,该基准的高质量标准化案例与量化评估体系可促进跨团队协作与结果复现。此外,INCARBench的修复任务设计特别契合实际场景中需对现有计算配置进行迭代修改的需求,使得其能够无缝集成至材料高通量筛选、催化活性预测、电池材料设计等需要大量并行VASP计算的工业级应用管道,提高计算产出的科学与鲁棒性。
数据集最近研究
最新研究方向
当前围绕INCARBench数据集的前沿研究方向聚焦于评估大语言模型在材料科学第一性原理计算中的科学配置能力,尤其是VASP输入文件INCAR的生成与修复任务。研究发现,尽管前沿模型在语义和政策正确性上表现优异,但在任务关键正确性(TCC)方面显著不足,尤其是在涉及DFT+U、磁性和关联材料的物理耦合参数场景中,模型难以同时满足多重约束。此外,修复任务揭示出错误修正与有效配置保持是两种独立能力,而配置保持仍是主要瓶颈。这一成果将科学配置确立为大语言模型的可量化能力,为构建更可靠的AI驱动计算材料学系统奠定了基础,并推动了从参数级匹配向科学级有效配置评估的范式转变。
相关研究论文
  • 1
    INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models南开大学·电子信息与光学工程学院; 南开大学·天津市光电传感器与传感网络技术重点实验室; 南开大学深圳研究院; CIC nanoGUNE BRTA; 云南师范大学·能源与环境科学学院; 西南联合研究生院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务