遇见数据集

quantum-simulation-chemistry-materials

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

Neura Parse — 量子模拟化学与材料:编码、VQE/QPE与动力学数据集是一个专注于量子计算在化学和材料科学模拟应用领域的专业数据集。该数据集旨在为研究和开发量子计算感知的人工智能系统提供支持。数据内容深度覆盖量子模拟物质的核心主题,包括:电子结构与费米子到量子比特的编码(将化学/材料问题转化为量子比特哈密顿量,涉及二次和一次量子化电子结构哈密顿量、经典PySCF预处理、各种费米子-量子比特编码如Jordan-Wigner、parity、Bravyi-Kitaev等,以及基于Z2对称性的量子比特缩减);哈密顿量分解与容错资源估计(通过单/双/张量超收缩分解压缩双电子张量及其对哈密顿量1-范数和块编码成本的影响,针对FeMoco、催化、阴极等案例的端到端容错资源估计,以及对量子方法必须超越的经典竞争对手的客观评估);基态与激发态算法(提取本征态和性质的算法,如VQE变体与化学拟设、量子相位估计、量子子空间/Krylov和虚时方法、测量分组与采样预算,以及激发态、格林函数、响应和有限温度方法);动力学、凝聚态模型与模拟仿真(模拟量子物质在时间和晶格上的行为,包括Trotter和后Trotter实时动力学、淬火模拟、晶格规范理论与核/高能模型、凝聚态晶格模型,以及在中性原子、囚禁离子和超导硬件上的模拟/可编程模拟器)。数据集规模为213条记录,采用多格式混合结构,包含六种记录类型:概念条目(66条)、开放问答(63条)、多项选择问答(29条)、代码任务(24条)、语料(18条)和指令对(13条)。每条记录都按难度分级:本科生级别(24条)、研究生级别(93条)和研究级别(96条)。每条记录共享一个通用信封结构(包含id、domain、record_type、category、topic等元数据字段),并包含其特定记录类型的字段。数据来源是混合的,初始版本(v0.1)源自专家策划的研究分类法,并集成了策划和大型语言模型合成以进行扩展。数据集实施了严格的质量控制门限,包括:所有代码种子在固定环境中端到端执行并验证数值输出;所有引用的arXiv标识符均被验证;多项选择问答的答案草稿格式和干扰项均经过检查;费米子编码声明通过OpenFermion或Qiskit-Nature进行符号验证;资源估计数据均注明出处;化学惯例被明确定义;并通过主题范围分类器和审核确保内容聚焦于既定领域。该数据集适用于监督微调、评估/基准测试和持续预训练等多种机器学习任务。然而,需注意其局限性:合成记录虽然是经过验证的模型生成内容,但仍可能包含错误,因此不应将其视为权威的科学参考文献,关键事实需对照原始资料进行核实。

Neura Parse — Quantum Simulation in Chemistry and Materials: Encoding, VQE/QPE and Dynamics Dataset is a professional dataset focusing on the application of quantum computing in chemistry and materials science simulation. This dataset aims to support the research and development of quantum computing-aware artificial intelligence systems. The dataset covers core topics of quantum-simulated matter in depth, including: Electronic structure and fermion-to-qubit encoding (converting chemical/material problems into qubit Hamiltonians, involving second- and first-quantized electronic structure Hamiltonians, classical PySCF preprocessing, various fermion-to-qubit encoding schemes such as Jordan-Wigner, parity, Bravyi-Kitaev, etc., as well as qubit reduction based on Z2 symmetry); Hamiltonian decomposition and fault-tolerant resource estimation (compressing two-electron tensors and their impacts on the 1-norm of Hamiltonians and block encoding costs via single/two/tensor hypercontraction decomposition, end-to-end fault-tolerant resource estimation for cases including FeMoco, catalysis, cathodes, etc., and objective evaluation of classical competitors that quantum methods must surpass); Ground-state and excited-state algorithms (algorithms for extracting eigenstates and properties, such as VQE variants and chemical ansätze, quantum phase estimation, quantum subspace/Krylov and imaginary-time methods, measurement grouping and sampling budgets, as well as excited-state, Green's function, response, and finite-temperature methods); Dynamics, condensed matter models and simulation (simulating the behavior of quantum matter in time and lattice, including Trotter and post-Trotter real-time dynamics, quenching simulations, lattice gauge theory and nuclear/high-energy models, condensed matter lattice models, and simulation/programmable simulators on neutral atom, trapped ion, and superconducting hardware). The dataset contains 213 records in total, with a mixed multi-format structure, including six record types: Concept entries (66), Open-ended questions (63), Multiple-choice questions (29), Coding tasks (24), Corpora (18), and Instruction pairs (13). Each record is graded by difficulty: Undergraduate level (24), Graduate level (93), and Research level (96). Each record shares a universal envelope structure (including metadata fields such as id, domain, record_type, category, topic, etc.), and contains fields specific to its record type. The data sources are mixed; the initial version (v0.1) is derived from expert-curated research taxonomies, and integrated with curated content and large language model synthesis for expansion. The dataset implements strict quality control thresholds, including: All code seeds are executed end-to-end in a fixed environment and their numerical outputs are verified; All cited arXiv identifiers are validated; The draft answer formats and distractors of multiple-choice questions are checked; Fermion encoding claims are symbolically verified via OpenFermion or Qiskit-Nature; Resource estimation data are all cited with their sources; Chemical conventions are clearly defined; and content is ensured to focus on the established domain via topic scope classifiers and audits. This dataset is applicable to various machine learning tasks such as supervised fine-tuning, evaluation/benchmarking, and continued pre-training. However, its limitations should be noted: Although synthetic records are generated by validated models, they may still contain errors, so they should not be regarded as authoritative scientific references, and key facts need to be verified against original sources.

创建时间:
2026-07-01
原始信息汇总

数据集详情总结

基本信息

  • 数据集名称: Neura Parse — Quantum Simulation of Chemistry & Materials: Encodings, VQE/QPE & Dynamics
  • 领域: 量子模拟-化学-材料
  • 语言: 英语
  • 记录总数: 263条
  • 记录类型: code, concept, corpus, instruction, qa_mcq, qa_open
  • 许可证: CC-BY-4.0
  • 版本: 0.7.0

数据构成

按记录类型分布

记录类型 数量
qa_open (开放式问答) 86
concept (概念) 75
qa_mcq (多选题问答) 35
code (代码) 28
corpus (语料) 23
instruction (指令) 16
总计 263

按难度分布

难度 数量
本科 24
研究生 103
研究 136

主题分类

  1. 电子结构及费米子-量子比特编码(5个主题)

    • 化学/材料问题转化为量子比特哈密顿量
    • 一阶和二阶量子化电子结构哈密顿量
    • PySCF预处理(积分、基组、活性空间、嵌入)
    • 费米子-量子比特编码(Jordan-Wigner、parity、Bravyi-Kitaev、ternary-tree、locality-preserving)
    • Z2对称性量子比特缩减
  2. 哈密顿量分解与容错资源估计(3个主题)

    • 双电子张量压缩(单重/双重/张量超收缩分解)
    • 端到端容错资源估计(FeMoco、催化、阴极材料)
    • 经典竞争对手的诚实评估(CCSD(T)、DMRG、QMC、张量网络)
  3. 基态与激发态算法(4个主题)

    • VQE变体与化学ansatze(UCCSD、k-UpCCGSD、hardware-efficient、ADAPT)
    • 量子相位估计
    • 量子子空间/Krylov与虚时间方法
    • 测量分组与射击预算、激发态/格林函数/响应/有限温度方法
  4. 动力学、凝聚态模型与模拟仿真(3个主题)

    • Trotter与后Trotter实时动力学
    • 淬火模拟
    • 格点规范理论、凝聚态模型(Fermi-Hubbard、自旋格点)、模拟/可编程模拟器

数据模式

每条数据包含统一信封字段:id, domain, record_type, category, topic, subtopics, difficulty, language, source, source_url, license, tags, provenance, quality, metadata,以及记录类型特有的字段。

数据来源与方法

  • 混合来源:由专家策划的研究分类体系生成(方法=curated)
  • 策划与LLM合成结合用于规模化
  • 每条记录携带 provenance 对象(方法、生成器、流水线版本)和可选的 quality 对象(事实性/清晰度评分)

质量保证

  • 每个代码种子在固定环境中端到端执行,输出结果与参考值误差< 1 mHa
  • 所有引用的arXiv ID均经过验证
  • 多选题有四个选项、一个正确答案和一行理由说明
  • 费米子编码声明使用OpenFermion或Qiskit-Nature符号检查
  • 资源估计数据均附有具体论文和年份来源

预期用途与限制

  • 用于量子计算感知AI系统的研发
  • 合成记录虽经验证但可能包含错误
  • 不应将此数据集视为权威科学参考,关键事实请查证原始出处
搜集汇总
数据集介绍
quantum-simulation-chemistry-materials 数据集图片
构建方式
该数据集由Neura Parse团队基于专家策划的研究分类体系构建,融合了人工策展与大语言模型合成技术以扩展规模。其数据源自经过验证的量子化学与材料模拟文献,涵盖电子结构、费米子-量子比特编码、哈密顿量分解、基态/激发态算法及实时动力学等核心主题。构建过程中,所有代码种子均在锁定环境中端到端执行,确保数值输出与参考值误差小于1 mHa;每条记录均附带来源证明、质量评分及可追溯的分类标识,从而保证了数据集的高可靠性与专业深度。
特点
数据集拥有多格式统一架构,包含263条记录,涵盖指令/响应对、开放式与多选题问答、可执行代码任务及百科全书式概念条目,支持监督微调、评估基准与持续预训练等多元用途。记录按难度分层(本科24条、研究生103条、研究级136条),并细分为15个专题,覆盖VQE变分方法、容错资源估计、凝聚态格点模型与模拟量子模拟器等前沿领域。每条记录均附有来源、质量评分及严格的化学规范声明,确保内容的权威性与一致性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,使用`load_dataset("Neura-parse/quantum-simulation-chemistry-materials")`命令即可获取训练与测试分片。数据集支持按记录类型(如`qa_mcq`)或难度级别进行过滤筛选,便于构建针对性的训练集或评估集。此外,每条记录包含统一的元数据字段(如`record_type`、`difficulty`、`provenance`),用户可基于这些字段灵活组织数据流程,适用于量子计算领域的大型语言模型微调、知识问答系统开发及算法基准测试等场景。
背景与挑战
背景概述
随着量子计算技术的迅猛发展,如何精确模拟化学与材料中的量子多体问题已成为该领域最具挑战性的核心议题之一。在此背景下,由Neura Parse团队于2025年创建的quantum-simulation-chemistry-materials数据集应运而生,旨在弥合量子算法理论与实际应用之间的鸿沟。该数据集聚焦于电子结构问题、费米子到量子比特的编码、哈密顿量分解、基态与激发态求解算法以及实时动力学模拟等前沿主题,并提供了基于Qiskit Nature、OpenFermion、PennyLane-QChem和PySCF等主流框架的端到端资源估算与经典算法对比。通过集成263条涵盖代码、概念、问答及指令等多种形式的记录,该数据集为量子计算与人工智能交叉领域的研究者提供了一个系统化、可验证的知识库,极大地推动了量子模拟在催化、材料设计等实际场景中的落地。
当前挑战
该数据集所面对的领域挑战主要体现在量子模拟的复杂性与可扩展性上。首先,电子结构问题的精确求解面临指数级增长的希尔伯特空间,而现有量子硬件受限于有限的量子比特数和噪声,导致变分量子本征求解器(VQE)和量子相位估计(QPE)等算法在实际应用中难以收敛到化学精度。其次,费米子到量子比特的编码过程(如Jordan-Wigner、Bravyi-Kitaev等)引入了非局域的泡利算符,显著增加了量子线路深度和资源开销。在数据构建过程中,挑战尤为突出:每个代码种子必须在严格固定的计算环境中执行并验证数值结果(如VQE能量误差小于1 mHa),同时需确保所有引用的arXiv文献真实可查、化学约定一致(如哈特里能量单位与自旋轨道索引),并过滤掉与核心主题无关的内容(如通用QSVT或QUBO优化)。这些多重质量门控机制保证了数据集的可靠性,但大幅提升了构建成本与复杂度。
常用场景
经典使用场景
在量子计算与化学材料模拟的交叉领域中,该数据集为研究者提供了从费米子到量子比特编码、哈密顿量分解到基态与激发态算法等核心课题的丰富素材。其经典使用场景涵盖变分量子本征求解器(VQE)与量子相位估计(QPE)的算法实现,以及电子结构问题中的第二量子化与第一量子化形式构建。通过包含可执行代码与多格式问答对,数据集支持端到端的算法验证,使研究人员能够复现UCCSD、k-UpCCGSD等化学ansätze的量子线路设计,并评估容错量子计算所需的托福利门数与逻辑量子比特资源开销。
解决学术问题
该数据集直击量子化学模拟在经典计算与量子硬件之间的鸿沟,系统性地解决了电子结构哈密顿量的高效编码与压缩问题。通过详尽的费米子-量子比特映射(如Jordan-Wigner、Bravyi-Kitaev与三元树编码)和双电子张量的张量超收缩分解,数据集为降低量子门复杂度与提升模拟精度提供了标准化对照。它不仅量化了经典竞争方法(如CCSD(T)、DMRG、量子蒙特卡洛)的性能基准,还通过符号化验证确保能量误差小于1毫哈特里,从而为量子算法超越经典模拟设立了可重复的评判标准。
衍生相关工作
该数据集催生了一系列前沿工作,包括基于ADAPT-VQE的自适应算法改进、量子子空间展开与虚时间方法在激发态求解中的扩展,以及容错资源估计中的类张量网络近似技术。其中,针对费米-哈伯德模型与晶格规范理论的模拟研究,催生了后特罗特时间演化算法在核物理中的创新应用。数据集还支撑了量子机器学习在哈密顿量测量分组与预算优化中的研究,并推动了开源框架如Qiskit Nature与OpenFermion的社区协同发展,为大规模量子化学模拟建立了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务