遇见数据集

PQID

收藏
Hugging Face2026-03-26 更新2026-03-27 收录
官方服务:

资源简介:

Parallel Quantum Instruction Dataset (PQID) 是一个包含10,718个指令-响应对的高质量语料库,旨在弥合自然语言意图与多抽象量子逻辑之间的差距。该数据集专为量子软件工程中大型语言模型(LLMs)的指令调优而构建。数据集采用双抽象架构,将用户提示与等效的量子电路生成配对,包括高级Python(Qiskit)和低级硬件表示(OPENQASM 3.0)。每个数据行代表一个交互,格式为JSON对象,包含三个字段:`instruction`(自然语言请求,如“构建一个贝尔态电路”)、`qiskit_code`(使用IBM Qiskit框架的Python代码)和`qasm_code`(等效的OPENQASM 3.0表示)。数据集可通过Hugging Face的`datasets`库直接加载。

The Parallel Quantum Instruction Dataset (PQID) is a high-quality corpus containing 10,718 instruction-response pairs, aiming to bridge the gap between natural language intent and multi-abstraction quantum logic. This dataset is specifically constructed for instruction tuning of large language models (LLMs) in quantum software engineering. The dataset adopts a dual-abstraction architecture, pairing user prompts with equivalent quantum circuit generation, including high-level Python (Qiskit) and low-level hardware representation (OPENQASM 3.0). Each data entry represents an interaction, formatted as a JSON object with three fields: `instruction` (natural language requests, e.g., "Construct a Bell state circuit"), `qiskit_code` (Python code utilizing the IBM Qiskit framework), and `qasm_code` (equivalent OPENQASM 3.0 representation). The dataset can be directly loaded via Hugging Face's `datasets` library.

创建时间:
2026-03-24
搜集汇总
数据集介绍
构建方式
在量子计算这一前沿领域,指令数据集的构建对于推动量子编程的自动化与智能化至关重要。PQID(Parallel Quantum Instruction Dataset)的构建遵循了许可感知与质量审计并重的严谨路线。其核心数据来源于对多种开源量子计算代码仓库的系统性爬取与筛选,每条数据均包含一条自然语言指令及其对应的Qiskit实现代码。构建过程中,团队对每一行数据进行了详尽的来源追溯,依据上游许可证类型(如宽松许可、版权左派许可及手动审查的其他许可)进行严格分类与标注,并辅以行级别元数据记录许可证据与归属信息。最终,通过自动化的质量审计流水线,剔除了无许可的行,形成了包含422,580行数据、结构清晰、来源可溯的许可有效版本。
使用方法
使用PQID数据集进行量子编程指令微调或代码生成任务时,可通过Hugging Face的`datasets`库便捷加载。用户只需执行`load_dataset("Elias-Abebe-Gasparini/PQID")`,即可自动获取包含训练、验证与测试三个划分的数据集对象。加载后,每条数据以JSON格式呈现,其中`instruction`字段存储自然语言指令,`output`字段对应Qiskit代码实现,而`metadata`字段则封装了许可证与归属等治理信息。用户应依据行级元数据中的许可证类别(如`permissive`、`copyleft`)及其对应的上游许可证要求,合规地使用数据。对于需要进一步探索或复现数据集构建流程的研究者,公开的GitHub仓库与Zenodo归档提供了完整的脚本与文档,支持自定义数据过滤与审计分析。
背景与挑战
背景概述
量子计算作为下一代计算范式的核心驱动力,正逐步从理论探索走向工程实践,然而其编程生态的成熟度仍远逊于经典计算领域。在此背景下,PQID(Parallel Quantum Instruction Dataset)应运而生,由研究者Elias Abebe Gasparini于2026年构建并发布,旨在弥合自然语言指令与量子编程实现之间的鸿沟。该数据集包含超过42万条经过许可审计和质量审核的指令-代码对,覆盖Qiskit框架下的多种量子算法实现,并嵌入行级元数据以支持溯源、验证与发布治理。PQID的推出不仅为量子编程的指令微调提供了规模化、高质量的语料基础,更通过严格的许可合规流程树立了数据集治理的新标杆,对推动量子计算领域的可复现研究与负责任开源具有深远影响。
当前挑战
PQID所应对的核心领域挑战在于量子编程指令数据的稀缺性与异构性:现有量子计算教材与代码库多呈松散分布,缺乏统一、可微调的结构化语料,限制了大型语言模型在量子代码生成任务上的性能提升。构建过程中,研究者面临三重关键挑战:其一,需从海量开源仓库中筛选量子编程相关代码,并确保其与自然语言指令的语义对齐,这要求精细的自动化流水线与人工校验机制;其二,许可证合规性成为数据治理的复杂难题,源材料涵盖MIT、BSD-3-Clause、GPL等多种许可证,需逐行解析授权义务并排除无许可行,最终导致12.7万行数据被隔离于公开版本之外;其三,质量审计需兼顾代码正确性与可执行性,通过种子生成与元数据评估流程平衡数据规模与可靠性,从而在422,580行公开数据中实现高保真度的指令遵循能力。
常用场景
经典使用场景
在量子计算与自然语言处理的交叉领域,PQID(Parallel Quantum Instruction Dataset)作为首个经过许可审计与质量校验的指令微调数据集,其经典使用场景聚焦于量子编程代码生成任务。该数据集将自然语言描述的量子计算指令与对应的Qiskit实现代码进行配对,为训练能够理解量子算法意图并生成可执行OpenQASM代码的大型语言模型提供了标准化训练语料。研究者可基于其42万余条经过许可合规性验证的样本,开展从量子门操作描述到量子电路自动合成的端到端学习,从而推动量子软件工程中自动化编程工具的演进。
解决学术问题
PQID的提出有效解决了量子编程领域中高质量指令数据稀缺与版权合规性模糊的双重学术困境。传统量子代码数据集多缺乏细粒度的许可溯源机制,导致模型训练与部署面临法律风险;而PQID通过行级元数据记录每一条样本的上游许可类别与归属信息,为可复现、可审计的量子编程研究奠定了数据治理基准。该数据集使学界能够系统性地探究许可感知训练策略对模型生成代码合规性的影响,并首次在量子计算领域实现了大规模指令数据集的标准化发布,填补了量子编程指令微调数据集的空白。
实际应用
在实际应用层面,PQID为量子计算软件的工业化开发提供了关键基础设施。基于该数据集训练的代码生成模型可辅助量子算法工程师快速将自然语言需求转化为标准化的Qiskit或OpenQASM代码,显著降低量子编程的入门门槛。此外,其内置的许可审计机制使企业级用户能够在合规框架内安全地复用开源量子代码片段,适用于量子云平台中的智能代码补全、量子电路优化建议以及自动化测试用例生成等场景,加速量子计算从实验室走向产业落地的进程。
数据集最近研究
最新研究方向
当前量子计算领域正从理论探索迈向实用化编程,而指令微调数据集的匮乏成为制约大语言模型辅助量子代码生成的关键瓶颈。PQID(Parallel Quantum Instruction Dataset)作为首个许可证感知、质量审计的量子编程指令数据集,整合了超过42万条自然语言指令与Qiskit实现配对,并创新性地引入行级元数据以管理上游许可证合规性与归属追溯。该数据集不仅涵盖宽松、版权型及手动审核的多种许可证类别,还通过严格的证据链审计确保数据治理的透明性,为量子软件工程中的模型微调、代码生成评估及合规复用提供了标准化基准。其发布标志着量子编程与AI交叉领域从粗放数据收集向精细化、负责任的开放科学范式转变,对推动量子-经典混合计算生态的可靠发展具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务