quantum-error-mitigation-and-benchmarking
收藏资源简介:
Neura Parse是一个专注于量子误差缓解、表征与基准测试的专业数据集,旨在在容错量子计算时代之前,从噪声硬件获取可信答案并严格测量设备质量。它覆盖三大核心领域:误差缓解技术(如零噪声外推、概率误差消除)、表征/层析协议(如门集层析成像、噪声学习)以及基准测试套件(如随机化基准测试、量子体积)。数据集包含可运行的Mitiq、pyGSTi和Qiskit Experiments代码流程,并采用多格式混合设计,包括指令/响应对、开放式及多项选择问答、可执行代码任务和百科全书式概念条目,统一于一个模式之下,因此既适用于监督微调,也适用于评估/基准测试和持续预训练。数据集包含14,321条记录,分为六种类型:概念条目(3404条)、开放式问答(3306条)、代码任务(2516条)、多项选择问答(2502条)、指令对(1787条)和语料文本(806条)。记录按难度分为入门级(1条)、本科级(4423条)、研究生级(6760条)和研究级(3137条)。内容主题详细划分为误差缓解技术、相干误差抑制与噪声整形、表征、层析成像与噪声学习、随机化基准测试与整体基准测试。通过严格质量门控确保质量,包括模式验证、范围界定、成本诚实性说明、代码可执行性、多选题完整性、事实性核查、时效性(2025-2026)、符号一致性、去重以及来源和许可合规性。数据集旨在用于量子计算感知人工智能系统的研究和开发,但需注意其包含模型生成的合成记录,可能存在错误,不应作为权威的科学参考文献。
Neura Parse is a professional dataset focused on quantum error mitigation, characterization, and benchmarking, designed to obtain reliable answers from noisy hardware and rigorously measure device quality before the era of fault-tolerant quantum computing. It covers three core areas: error mitigation techniques (such as zero-noise extrapolation, probabilistic error cancellation), characterization/tomography protocols (such as gate set tomography, noise learning), and benchmarking suites (such as randomized benchmarking, quantum volume). The dataset includes runnable code workflows for Mitiq, pyGSTi, and Qiskit Experiments, and employs a multi-format hybrid design, including instruction/response pairs, open-ended and multiple-choice Q&A, executable code tasks, and encyclopedic concept entries, unified under a single schema, making it suitable for supervised fine-tuning, evaluation/benchmarking, and continued pre-training. It contains 14,321 records, categorized into six types: concept entries (3,404), open-ended Q&A (3,306), code tasks (2,516), multiple-choice Q&A (2,502), instruction pairs (1,787), and corpus texts (806). Records are divided by difficulty into beginner (1), undergraduate (4,423), graduate (6,760), and research (3,137) levels. Content topics are detailed into error mitigation techniques, coherent error suppression and noise shaping, characterization, tomography and noise learning, randomized benchmarking and holistic benchmarking. Quality is ensured through rigorous gating, including schema validation, scoping, cost honesty statements, code executability, multiple-choice completeness, fact-checking, timeliness (2025-2026), symbol consistency, deduplication, and source and license compliance. The dataset is intended for research and development of quantum computing-aware AI systems, but note that it contains model-generated synthetic records that may contain errors and should not be used as authoritative scientific references.
数据集概述
基本信息
- 数据集名称: Neura Parse — Quantum Error Mitigation, Characterization & Benchmarking
- Hub ID:
Neura-parse/quantum-error-mitigation-and-benchmarking - 发布版本: v3.1.0
- 许可证: CC BY 4.0
- 语言: 英文(单语)
- 数据规模: 113,440 行(100K < n < 1M)
- 数据分割:
train和test
数据集描述
这是一个专注于量子计算中错误缓解、表征和基准测试的多格式、来源可验证的研究数据集。涵盖从嘈杂硬件获取可信结果以及严格测量设备质量的方法,包括错误缓解技术、表征/层析成像协议和基准测试套件。数据包含可运行的 Mitiq、pyGSTi 和 Qiskit Experiments 管道,并记录采样开销和偏差/方差。
记录类型与数量
| 记录类型 | 数量 | 说明 |
|---|---|---|
qa_open |
33,686 | 开放答案量子问题 |
code |
24,739 | 可执行的量子/软件任务 |
instruction |
23,330 | 指令与答案对 |
qa_mcq |
21,348 | 选择题(含答案解释) |
concept |
10,185 | 结构化概念条目 |
corpus |
152 | 预训练风格技术段落 |
| 总计 | 113,440 |
难度分布
| 难度 | 数量 |
|---|---|
| 本科生(undergrad) | 32,630 |
| 研究生(graduate) | 52,036 |
| 研究级(research) | 28,774 |
主题分类
数据集涵盖以下四大类主题(共15个细分主题):
- 错误缓解技术 — 零噪声外推、概率错误消除(含稀疏 Pauli-Lindblad 噪声学习)、Clifford 数据回归、对称性验证、读出错误缓解、采样开销与偏差/方差核算、缓解方法的适用范围与限制。
- 相干错误抑制与噪声定制 — 动态去耦脉冲序列、Pauli/Clifford 混洗与随机编译。
- 表征、层析成像与噪声学习 — 状态与过程层析成像、门集层析成像(pyGSTi)、可扩展 Pauli/Lindblad 噪声学习、哈密顿量表征、相干性与读出表征(T1/T2、分配矩阵、串扰)、噪声模型验证。
- 随机基准测试与整体基准 — 标准/交错/同时/循环/镜像随机基准测试、交叉熵基准测试、量子体积、CLOPS、算法量子比特。
数据集格式
数据以 Parquet 格式存储,包含显式的 train 和 test 分割。数据文件路径为 data/train-*.parquet 和 data/test-*.parquet。
数据模式(Schema)
所有记录共享公共字段:id、domain、record_type、category、topic、subtopics、difficulty、language、source、source_url、license、tags、provenance、quality、metadata。各记录类型特有字段如下:
| 记录类型 | 特有字段 |
|---|---|
qa_open |
question, answer |
code |
prompt, code, expected_output |
instruction |
prompt, response |
qa_mcq |
question, choices, answer, answer_index |
concept |
term, definition |
corpus |
text |
来源验证
- 每行数据均带有
source_url溯源,标注为source=neura-parse-research - 来源验证检查:697 个来源URL,0 个无效;513 个 arXiv ID,0 个伪造
- 代码记录:177,532 条编译成功,0 条编译失败
- 质量控制包括:模式验证、范围边界检查、开销诚实性、代码可执行性、选择题完整性、事实性评分等
推荐用途
- 量子计算辅助助手的监督微调
- 量子推理的多选题和开放答案评估
- 基于来源的检索增强生成(RAG)
- 量子代码生成与代码评估
- 在结构化、来源可验证的技术文本上进行继续预训练




