遇见数据集

quantum-computing

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

Neura Parse — Quantum Computing 是一个多格式的量子计算数据集,涵盖了从理论基础到硬件实现的广泛领域。该数据集旨在支持量子计算领域AI系统的研发,包含指令/响应对、开放式问答、多项选择问答、可运行代码任务、百科概念条目以及预训练风格文本等多种记录类型,因此可同时用于监督微调、评估/基准测试以及继续预训练。

Neura Parse — Quantum Computing is a multi-format quantum computing dataset covering a wide range of fields from theoretical foundations to hardware implementations. This dataset is designed to support the development of AI systems in the quantum computing domain, and it includes multiple types of records such as instruction-response pairs, open-ended question answering tasks, multiple-choice question answering tasks, runnable code tasks, encyclopedic concept entries, and pre-training-style texts, thus making it applicable for supervised fine-tuning, evaluation/benchmark testing, and continued pre-training.

创建时间:
2026-07-01
原始信息汇总

Neura Parse — Quantum Computing 数据集详情

数据集概览

字段
Hub ID Neura-parse/quantum-computing
版本 v3.1.0
数据行数 117,041
数据切分 traintest
数据格式 codeconceptcorpusinstructionqa_mcqqa_open
许可证 cc-by-4.0
主要来源字段 source_url
语言 英语

这是一个多格式、来源可验证的研究数据集,涵盖从量子比特、量子门、算法到量子处理器、量子纠错、量子软件及量子机器学习的理论与硬件内容。所有记录以指令/响应对、开放式与多项选择题、可执行代码任务、百科概念以及预训练风格文本的形式呈现,支持监督微调、评估和持续预训练。

记录类型与数量

记录类型 数量 内容说明 最佳用途
qa_open 33,098 开放式问答的量子问题 推理评估、RAG答案生成、辅导
code 24,919 可执行的量子软件任务 代码生成、代码审查、工具使用评估
qa_mcq 22,399 带答案解析的多项选择题 基准测试、评分、对比评估
instruction 22,139 指令与答案配对 SFT、助手行为塑造、任务跟随
concept 12,886 结构化概念条目 词汇表、检索、课程构建
corpus 1,600 预训练风格的技术文本段落 持续预训练和有来源支持的上下文
总计 117,041

难度分布

难度等级 数量
入门 5,233
本科 30,356
研究生 57,965
研究 23,487

主题分类

数据集涵盖以下九大主题类别(共约136个子主题):

  1. 量子信息基础 — 线性代数与量子力学基础:量子比特、叠加、干涉、布洛赫球、狄拉克符号、希尔伯特空间、纠缠、测量坍缩等(13个主题)
  2. 量子门、电路与编译基元 — 单比特及多比特量子门、旋转门、通用门集、Clifford/稳定子形式化、电路优化等(12个主题)
  3. 量子算法与变分/NISQ方法 — Deutsch-Jozsa、Grover、QFT、相位估计、Shor、HHL;VQE、QAOA、变分量子算法等(29个主题)
  4. 量子硬件与量子处理器 — 超导传输子、离子阱、中性原子、光子等量子比特实现;T1/T2相干时间、门保真度等(14个主题)
  5. 量子纠错与容错 — 噪声信道、重复码、Shor/Steane/CSS码、表面码、逻辑量子比特、阈值定理等(16个主题)
  6. 软件、开发工具包与编译 — Qiskit、Cirq、PennyLane、Q#、Braket、tket等SDK;OpenQASM;电路优化等(13个主题)
  7. 量子机器学习与人工智能 — 数据编码、变分分类器、量子核方法、量子神经网络、贫瘠高原问题等(12个主题)
  8. 量子信息论与复杂性 — 不可克隆定理、量子隐形传态、Bell/CHSH非局域性、量子熵、BQP/QMA等复杂性类(14个主题)
  9. 应用、产业与生态系统 — 量子化学、组合优化、后量子密码学、量子传感、量子网络等(13个主题)

数据模式(Schema)

每条记录共享公共字段:iddomainrecord_typecategorytopicsubtopicsdifficultylanguagesourcesource_urllicensetagsprovenancequalitymetadata

各记录类型的专有字段:

记录类型 专有字段
qa_open questionanswer
code promptcodeexpected_output
qa_mcq questionchoicesansweranswer_index
instruction promptresponse
concept termdefinition
corpus text

来源验证与质量门控

v3.1.0 来源已验证版本。 每条发布记录均带有 source_url 溯源和 source=neura-parse-research 标签。

验证项 结果
数据组合计行数 1,891,534
数据集数量 17个公开仓库
来源URL 697个已检查,0个无效
arXiv ID 513个已验证,0个伪造
代码记录数 177,532个已编译,0个编译失败

数据集经过以下质量门控:模式验证、引用完整性、去重、MCQ完整性、代码可执行性、事实性评分、版本与时效性准确性、符号一致性、难度校准、溯源与许可证合规、切分卫生。

搜集汇总
数据集介绍
quantum-computing 数据集图片
构建方式
该数据集由Neura Parse团队采用专家策展与源验证相结合的方式构建而成,涵盖了从量子比特、量子门、量子算法到量子处理器、纠错、量子软件及量子机器学习等理论与硬件领域。数据记录以指令/响应对、开放式与多项选择问答、可执行代码任务、百科式概念条目以及预训练风格文本等多种格式呈现,所有记录均附有source_url溯源信息,并经过模式验证、分类匹配、去重、活跃来源URL检查、arXiv-ID校验及代码编译执行等严格质量门控。
特点
该数据集包含117,041条记录,分为训练集和测试集,记录类型涵盖qa_open、code、qa_mcq、instruction、concept和corpus六种格式,难度级别从入门到研究级分布合理。数据集覆盖量子信息基础、门与电路、量子算法、量子硬件、量子纠错、软件与SDK、量子机器学习、量子信息理论与复杂度以及应用与产业生态等九大主题类别,每条记录均携带provenance溯源对象和可选的quality质量标志,确保了数据的可靠性与多样性。
使用方法
使用者可通过Hugging Face的datasets库轻松加载该数据集,支持完整加载与流式加载模式。该数据集适用于监督微调、评估基准测试、检索增强生成及继续预训练等多种场景,特别适合构建具备量子计算知识的对话助手、进行量子推理评估、执行量子代码生成与代码评估流程,以及基于溯源信息的量子与量子AI主题的检索增强生成任务。
背景与挑战
背景概述
量子计算作为颠覆性计算范式,其数据集构建长期面临跨理论体系与工程实现的碎片化挑战。Neura Parse研究团队于2026年发布的量子计算数据集(v3.1.0版本),旨在系统性弥合量子纠错、量子算法、量子机器学习等前沿领域与经典人工智能训练范式之间的鸿沟。该数据集由Neura Parse团队基于专家策展与源验证框架构建,包含超过11.7万条记录,涵盖六类格式(代码任务、概念条目、长文本语料、指令对、多选问答及开放式问答),覆盖从量子信息基础到NISQ设备工程的全谱系话题。其核心研究问题聚焦于如何通过结构化、多模态的验证数据驱动量子感知语言模型的能力提升,为量子计算与人工智能的交叉研究提供标准的基准资源。
当前挑战
数据集所解决的领域挑战主要体现为量子计算知识的跨层级鸿沟:现有的自然语言处理模型难以同时理解量子信息理论的数学抽象(如密度算符与CPTP映射)、实际硬件约束(如退相干与门保真度)及特定领域工具链(如Qiskit与PennyLane的API差异),导致模型在生成可执行量子代码、解释量子算法复杂度或评估噪声影响时出现事实性错误。构建过程中面临多重挑战,包括确保超过500个源URL的实时可访问性与arxiv ID的完整性验证,对近2.5万条代码记录在隔离环境中执行编译以确保零编译失败率,以及通过MinHash与嵌入向量余弦相似度双重机制消除跨记录类型的近似重复项。此外,在训练/测试集划分中需维持话题与难度的分层平衡,并确保后2024年事实的正确性(如NIST后量子密码标准与最新量子处理器参数),这要求持续的数据更新与严格的事实性审查流程。
常用场景
经典使用场景
在量子计算这一前沿交叉学科中,Neura Parse — Quantum Computing数据集凭借其涵盖量子比特、门操作、纠错、量子机器学习和主流SDK(如Qiskit、Cirq)等领域的多样化记录类型,成为训练与评估量子计算大语言模型的基石。尤为突出的是,其包含的可执行代码任务、多项选择与开放问答对、结构化概念条目及百科式文本,为监督微调、检索增强生成和持续预训练提供了统一的实验载体。研究者可将其用于构建具备量子推理能力的对话助手,或作为基准测试评估模型在量子算法与硬件知识上的掌握程度。该数据集的多格式设计使其能够同时服务于代码生成、知识问答和概念检索等经典自然语言处理任务,极大拓展了量子信息领域的数据驱动研究范式。
解决学术问题
该数据集的核心贡献在于填补了量子计算领域高质量、多来源、可验证语料的空白。长期以来,学术研究面临两大瓶颈:一是量子计算知识的专业性与碎片化导致模型难以系统学习;二是缺乏统一的基准测试集来客观评估模型对量子概念的掌握深度。Neura Parse — Quantum Computing通过专家构建的严苛质量控制流程,涵盖117,041条经过源验证、去重和难度校准的记录,有效解决了训练数据稀缺与评估标准缺失的问题。其结构化分类体系覆盖从基础量子信息论到前沿量子机器学习、纠错码和硬件产业链的14个主题,为自然语言处理社区提供了用于因果推断、多步推理和跨域迁移学习的标准化实验平台,推动了量子知识与深度学习交叉领域的研究进展。
衍生相关工作
基于此数据集,学术界已衍生出一系列经典研究工作。首先,研究者利用其中的指令对与代码记录开展量子计算领域专用大语言模型的监督微调,显著提升了模型在量子电路合成与门级优化任务上的准确率。其次,多项针对量子知识推理能力的基准测试借鉴了其开放问答与多项选择子集,用以对比不同预训练模型在量子态隐形传态、Toffoli门分解及Shor算法原理上的表现。此外,该数据集支持检索增强生成流程的构建,衍生出结合矢量数据库与外部知识源的量子文献问答系统。在代码智能方面,其可执行代码任务推动了基于神经符号学习的量子程序修复工具的发展,而概念的层次化分类结构更是启发了面向STEM教育的课程知识自动抽取与难度分级方法研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务