quantum-computing
收藏资源简介:
Neura Parse — Quantum Computing 是一个多格式的量子计算数据集,涵盖了从理论基础到硬件实现的广泛领域。该数据集旨在支持量子计算领域AI系统的研发,包含指令/响应对、开放式问答、多项选择问答、可运行代码任务、百科概念条目以及预训练风格文本等多种记录类型,因此可同时用于监督微调、评估/基准测试以及继续预训练。
Neura Parse — Quantum Computing is a multi-format quantum computing dataset covering a wide range of fields from theoretical foundations to hardware implementations. This dataset is designed to support the development of AI systems in the quantum computing domain, and it includes multiple types of records such as instruction-response pairs, open-ended question answering tasks, multiple-choice question answering tasks, runnable code tasks, encyclopedic concept entries, and pre-training-style texts, thus making it applicable for supervised fine-tuning, evaluation/benchmark testing, and continued pre-training.
Neura Parse — Quantum Computing 数据集详情
数据集概览
| 字段 | 值 |
|---|---|
| Hub ID | Neura-parse/quantum-computing |
| 版本 | v3.1.0 |
| 数据行数 | 117,041 |
| 数据切分 | train、test |
| 数据格式 | code、concept、corpus、instruction、qa_mcq、qa_open |
| 许可证 | cc-by-4.0 |
| 主要来源字段 | source_url |
| 语言 | 英语 |
这是一个多格式、来源可验证的研究数据集,涵盖从量子比特、量子门、算法到量子处理器、量子纠错、量子软件及量子机器学习的理论与硬件内容。所有记录以指令/响应对、开放式与多项选择题、可执行代码任务、百科概念以及预训练风格文本的形式呈现,支持监督微调、评估和持续预训练。
记录类型与数量
| 记录类型 | 数量 | 内容说明 | 最佳用途 |
|---|---|---|---|
qa_open |
33,098 | 开放式问答的量子问题 | 推理评估、RAG答案生成、辅导 |
code |
24,919 | 可执行的量子软件任务 | 代码生成、代码审查、工具使用评估 |
qa_mcq |
22,399 | 带答案解析的多项选择题 | 基准测试、评分、对比评估 |
instruction |
22,139 | 指令与答案配对 | SFT、助手行为塑造、任务跟随 |
concept |
12,886 | 结构化概念条目 | 词汇表、检索、课程构建 |
corpus |
1,600 | 预训练风格的技术文本段落 | 持续预训练和有来源支持的上下文 |
| 总计 | 117,041 |
难度分布
| 难度等级 | 数量 |
|---|---|
| 入门 | 5,233 |
| 本科 | 30,356 |
| 研究生 | 57,965 |
| 研究 | 23,487 |
主题分类
数据集涵盖以下九大主题类别(共约136个子主题):
- 量子信息基础 — 线性代数与量子力学基础:量子比特、叠加、干涉、布洛赫球、狄拉克符号、希尔伯特空间、纠缠、测量坍缩等(13个主题)
- 量子门、电路与编译基元 — 单比特及多比特量子门、旋转门、通用门集、Clifford/稳定子形式化、电路优化等(12个主题)
- 量子算法与变分/NISQ方法 — Deutsch-Jozsa、Grover、QFT、相位估计、Shor、HHL;VQE、QAOA、变分量子算法等(29个主题)
- 量子硬件与量子处理器 — 超导传输子、离子阱、中性原子、光子等量子比特实现;T1/T2相干时间、门保真度等(14个主题)
- 量子纠错与容错 — 噪声信道、重复码、Shor/Steane/CSS码、表面码、逻辑量子比特、阈值定理等(16个主题)
- 软件、开发工具包与编译 — Qiskit、Cirq、PennyLane、Q#、Braket、tket等SDK;OpenQASM;电路优化等(13个主题)
- 量子机器学习与人工智能 — 数据编码、变分分类器、量子核方法、量子神经网络、贫瘠高原问题等(12个主题)
- 量子信息论与复杂性 — 不可克隆定理、量子隐形传态、Bell/CHSH非局域性、量子熵、BQP/QMA等复杂性类(14个主题)
- 应用、产业与生态系统 — 量子化学、组合优化、后量子密码学、量子传感、量子网络等(13个主题)
数据模式(Schema)
每条记录共享公共字段:id、domain、record_type、category、topic、subtopics、difficulty、language、source、source_url、license、tags、provenance、quality、metadata。
各记录类型的专有字段:
| 记录类型 | 专有字段 |
|---|---|
qa_open |
question、answer |
code |
prompt、code、expected_output |
qa_mcq |
question、choices、answer、answer_index |
instruction |
prompt、response |
concept |
term、definition |
corpus |
text |
来源验证与质量门控
v3.1.0 来源已验证版本。 每条发布记录均带有 source_url 溯源和 source=neura-parse-research 标签。
| 验证项 | 结果 |
|---|---|
| 数据组合计行数 | 1,891,534 |
| 数据集数量 | 17个公开仓库 |
| 来源URL | 697个已检查,0个无效 |
| arXiv ID | 513个已验证,0个伪造 |
| 代码记录数 | 177,532个已编译,0个编译失败 |
数据集经过以下质量门控:模式验证、引用完整性、去重、MCQ完整性、代码可执行性、事实性评分、版本与时效性准确性、符号一致性、难度校准、溯源与许可证合规、切分卫生。




