quantum-networking-and-distributed
收藏资源简介:
Neura Parse — 量子网络、中继器与分布式量子计算数据集是一个专注于量子设备连接前沿领域的多格式数据集。其核心主题涵盖量子网络与分布式计算,具体包括:1) 纠缠分发与蒸馏(通过Bell态测量进行纠缠交换、LOCC提纯协议);2) 量子中继器与速率-距离界限(超越信道损耗的中继器架构、无中继PLOB/TGW密钥容量界限);3) 量子互联网协议栈、路由与仿真(分层纠缠中心网络架构、纠缠路由与调度、NetSquid/SeQUeNCe离散事件仿真器);4) 量子存储器与网络转换(缓冲光子量子比特的量子存储器、连接超导处理器与电信光纤的微波-光转换器);5) 分布式与模块化量子计算(模块间的非局域/隐形传态门、纠缠辅助的电路编织、分布式算法的通信成本);6) 网络化密码学与委托计算(网络上的盲验证委托量子计算、设备无关与多方原语、卫星/城域QKD实际部署)。该数据集包含215条记录,涵盖六种记录类型:概念条目(69条)、开放式问答(69条)、多项选择问答(32条)、可运行代码任务(19条)、语料(17条)和指令/响应对(9条)。记录难度覆盖入门级(3条)、本科级(45条)、研究生级(101条)和研究级(66条)。每条记录共享一个通用元数据信封(如ID、领域、记录类型、类别、主题、难度、语言、来源、许可证、标签、来源、质量等),并包含特定于记录类型的字段。数据集采用混合来源,结合了专家策划的研究分类法和LLM合成,并经过严格的质量控制,包括模式验证、范围遵循、引用完整性、去重、多项选择题完整性、代码可执行性、数值正确性、事实性与时效性(截至2025-2026年)以及符号一致性检查。该数据集旨在用于研究和开发量子计算感知的人工智能系统,适用于监督微调、评估/基准测试以及持续预训练。但需注意,其中包含模型生成的合成记录,可能存在错误,不应将其视为权威的科学参考。
Neura Parse — Quantum Networks, Repeaters, and Distributed Quantum Computing Dataset is a multi-format dataset focused on the cutting-edge field of quantum device connectivity. Its core themes cover quantum networks and distributed computing, specifically including: 1) Entanglement distribution and distillation (entanglement swapping via Bell state measurements, LOCC purification protocols); 2) Quantum repeaters and rate-distance bounds (repeater architectures beyond channel loss, repeaterless PLOB/TGW key capacity bounds); 3) Quantum internet protocol stack, routing, and simulation (hierarchical entanglement hub network architectures, entanglement routing and scheduling, NetSquid/SeQUeNCe discrete event simulators); 4) Quantum memories and network transducers (quantum memories buffering photonic qubits, microwave-to-optical transducers connecting superconducting processors to telecom fibers); 5) Distributed and modular quantum computing (non-local/teleportation gates between modules, entanglement-assisted circuit knitting, communication costs of distributed algorithms); 6) Networked cryptography and delegated computing (blind verification delegated quantum computing over networks, device-independent and multi-party primitives, practical satellite/metropolitan QKD deployments). The dataset contains 215 records, covering six record types: concept entries (69), open-ended questions (69), multiple-choice questions (32), runnable code tasks (19), corpora (17), and instruction/response pairs (9). Record difficulty ranges from introductory (3), undergraduate (45), graduate (101), to research (66). Each record shares a common metadata envelope (e.g., ID, domain, record type, category, topic, difficulty, language, source, license, tags, provenance, quality) and includes record-type-specific fields. The dataset uses mixed sources, combining expert-curated research taxonomies and LLM synthesis, with rigorous quality controls including schema validation, scope adherence, citation integrity, deduplication, multiple-choice completeness, code executability, numerical correctness, factuality and timeliness (as of 2025-2026), and symbol consistency checks. It is intended for research and development of quantum computing-aware AI systems, suitable for supervised fine-tuning, evaluation/benchmarking, and continued pre-training. However, note that it contains model-generated synthetic records that may contain errors and should not be considered authoritative scientific references.
数据集概述
Neura Parse — Quantum Networking, Repeaters & Distributed Quantum Computing 是一个专注于量子网络与分布式量子计算领域的高质量、多格式数据集。该数据集属于 Neura Parse 数据集系列,旨在为量子系统互联提供系统级前沿知识。
- 领域: quantum-networking-and-distributed
- 语言: 英语 (en)
- 记录总数: 267 条
- 记录类型: 包括
code(代码)、concept(概念)、corpus(语料)、instruction(指令)、qa_mcq(多项选择题)、qa_open(开放问答) - 许可证: cc-by-4.0
- 版本: 0.7.0
数据构成
数据集采用混合格式,包含指令/响应对、开放与多项选择问答、可执行代码任务以及百科式概念条目,适用于监督微调、评估/基准测试和持续预训练。
按记录类型分布:
| 记录类型 | 数量 |
|---|---|
qa_open (开放问答) |
92 |
concept (概念) |
79 |
qa_mcq (多项选择) |
40 |
code (代码) |
24 |
corpus (语料) |
21 |
instruction (指令) |
11 |
| 总计 | 267 |
按难度分布:
| 难度 | 数量 |
|---|---|
| 入门 | 3 |
| 本科 | 50 |
| 研究生 | 128 |
| 研究 | 86 |
分类体系
数据集涵盖以下六大主题分类,共 14 个子主题:
- 纠缠分发与蒸馏:涉及跨网络生成、扩展和提纯共享纠缠,包括信号链路生成、基于贝尔态测量的纠缠交换,以及 LOCC 蒸馏/提纯协议(保真度阈值和产率)。(3 个主题)
- 量子中继器与速率-距离界限:涵盖超越信道损耗的中继器架构(第一/二/三代、全光子),以及无中继器 PLOB/TGW 密钥容量、速率-距离-资源权衡等基本极限。(2 个主题)
- 量子互联网协议栈、路由与仿真:涉及分层纠缠中心网络架构(物理/链路/网络/传输层)、纠缠路由与调度,以及用于设计和基准测试的离散事件模拟器与分析工具(NetSquid, SeQUeNCe)。(3 个主题)
- 用于网络的量子存储器与换能:涵盖节点侧支持硬件,如缓冲光子量子比特的量子存储器(性能指标、多路复用)和连接超导处理器到电信光纤的微波-光换能器。(2 个主题)
- 分布式与模块化量子计算:涉及跨网络节点计算,包括模块间的非局域/隐形传态门、纠缠辅助电路编织、分布式算法,以及将计算分割到真实量子链路上的通信成本。(2 个主题)
- 网络密码学与委托计算:涵盖网络上的密码学任务,包括盲量子计算与可验证委托量子计算、设备无关及多方基元,以及真实的卫星/城域 QKD 部署。(3 个主题)
数据模式
每一行数据共享一个通用信封字段 (id, domain, record_type, category, topic, subtopics, difficulty, language, source, source_url, license, tags, provenance, quality, metadata),并包含其记录类型特有的字段。
可直接使用以下 Python 代码加载数据集:
python from datasets import load_dataset ds = load_dataset("Neura-parse/quantum-networking-and-distributed") print(ds["train"][0])
按记录类型过滤
mcq = ds["train"].filter(lambda r: r["record_type"] == "qa_mcq")
来源与方法
数据来源为混合来源。v0.1 版本基于专家策划的研究分类体系(方法:策划)。通过策划与 LLM 合成相结合的方式实现规模化扩展。每条记录都携带 provenance 对象(包含方法、生成器、流水线版本)和可选的 quality 对象(事实性/清晰度分数)。
质量控制
数据集经过严格的质量把关,包括:
- 模式有效:每条记录都针对其记录类型的 JSON 模式进行验证;拒绝未知字段;每个
topic_id和category都解析到此分类体系。 - 范围遵守:每条记录都映射到分类体系内的主题;拒绝范围外内容(如片上光子/CV 硬件、单节点设备物理/控制、无网络的纯电路编织等)。
- 引用完整性:无孤立主题;每个主题至少包含 12 条记录;没有列出的格式留空。
- 去重:记录类型内部或跨记录类型无完全或近似重复(MinHash Jaccard < 0.9,嵌入余弦点检 < 0.92)。
- 多项选择完整性:恰好一个正确选项,4 个选项 A-D,正确答案位置均匀分布,干扰项合理,无选择项泄露。
- 代码可执行:每条代码记录都能在声明框架和版本(qiskit>=1.x/qiskit-aer, numpy, sequence)的固定、网络隔离环境中运行,具有确定性并匹配其声明的输出。
- 定量正确性:速率/损耗/保真度声明均经过单位检查和数值验证(如 PLOB 容量、光纤损耗、保真度阈值)。
- 事实性与时效性 (2025-2026):验证 2023 年后的事实(如 RFC 9340, 牛津大学分布式受控-Z 门隐形传态保真度 86%);仅引用经过验证的 arXiv ID/DOI。
- 符号与来源:一致使用狄拉克符号和符号;每条记录都带有来源、source_url、许可证和方法信息;合成内容有标记;不包含个人信息。
预期用途与局限
- 预期用途:用于量子计算感知人工智能系统的研究与开发。
- 局限性:合成记录虽经过验证,但可能包含错误;请勿将此数据集视为权威科学参考。关键事实需与原始资料核对。




