遇见数据集

pqcbench

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

PQCBench 是 GSPC(通用安全与性能检查)框架中衡量模型在后量子迁移方面能力的基准数据集。该数据集由 CSOAI Ltd 发布,基于冻结的语料锚定地面真值进行评分。数据集共包含 13 个样本,每个样本被标注为三类之一:QUANTUM_VULNERABLE(易受量子攻击)、QUANTUM_SAFE(抗量子安全)或 NOT_APPLICABLE(不适用)。数据集适用于文本分类任务,可用于评估模型对后量子密码学相关内容的判断能力。作为 GSPC 的六个轴之一,该数据集旨在测量模型在连续性维度上的表现,即模型从当前密码学标准迁移到后量子标准的能力。注意:该数据集规模较小(n<1K),且存在已知局限性,如无前沿裁判验证和项目难度依赖于评估模型群。

PQCBench is a benchmark dataset within the GSPC (General Security and Performance Check) framework that measures a models capability in post-quantum migration. It is released by CSOAI Ltd and scored based on frozen corpus-anchored ground truth. The dataset contains 13 samples, each labeled as one of three categories: QUANTUM_VULNERABLE, QUANTUM_SAFE, or NOT_APPLICABLE. It is suitable for text classification tasks and can be used to evaluate a models judgment ability regarding post-quantum cryptography. As one of the six axes of GSPC, this dataset aims to measure the models performance on the continuity dimension, i.e., the ability to transition from current cryptographic standards to post-quantum standards. Note: The dataset is small (n<1K) and has known limitations, such as no frontier judge verification and project difficulty depending on the evaluation model ensemble.

创建时间:
2026-08-04
原始信息汇总

PQCBench 数据集概述

基本信息

  • 名称:PQCBench — 后量子迁移(GSPC 连续性轴)
  • 许可证:Apache-2.0(数据集条目),卡片为 CC-BY-4.0
  • 发布机构:CSOAI Ltd(英国公司编号 16939677),独立 AI 测量机构
  • DOI:10.5281/zenodo.21755657
  • 规模:13 个条目(n<1K)
  • 任务类型:文本分类
  • 语言:英语

数据内容

标签分布:

标签 条目数
QUANTUM_VULNERABLE 5
QUANTUM_SAFE 4
NOT_APPLICABLE 4

共 13 个条目。该基准评估后量子迁移能力,基于冻结的语料锚定真实结果评分。每个条目有三种可能结果:measured(已测量)、unmeasured(未测量)、failed(失败),未评分的生成不会被计为错误答案。

基准测量行为(30 个模型,参数规模 494M 至 20B,3 种架构)

统计量 数值 含义
平均难度 0.321 模型正确回答条目的比例
区分度(最大−最小) 0.350 最好与最差模型之间的分离程度
死亡条目 2 / 13 所有模型均通过或均未通过,无信息量
负向区分条目 5 整体更优的模型表现更差,已移交仲裁而非删除
可用条目数 6 既非死亡也无负向区分的条目
可引用性 低于可用条目数 ≥30 的门槛

结论:该轴未达到饱和。区分度 0.350 表明它能区分模型,但可用条目数仅为 6,不足以发布 95% 置信区间(需要可用条目数 ≥30 才能将区间缩窄至 ±0.169)。死亡条目计数仅在模型数 N>19 时可靠,本次运行在 N=30 下经过认证。

所属 GSPC 框架

PQCBench 是 GSPC 工具的六个轴之一,六个轴共 90 个条目:

基准 任务 条目数
治理 GovBench EU AI 法案风险等级 24
安全 DefBench 校准拒绝 14
溯源 ProvBench C2PA 清单存续 15
连续性 PQCBench 后量子迁移 13
一致性 MCPBench MCP 工具契约一致性 11
开放性 OSSBench 许可证与用途兼容性 13

使用须知

  • 报告应使用 usable_n 而非 n
  • 95% 区间重叠的比较标记为 NOT_RESOLVED
  • 评分带为描述性,不构成认证或合规评估
  • 监管裁定权保留给监管机构

已知局限

  • 无前沿裁判模型验证;评分采用精确标签匹配或经 98.9% 验证的拒绝检测器(基于 92 个手工标注响应,单一标注者,无交叉标注一致性)
  • 条目难度是条目与模型群的联合属性,而非条目本身属性
  • 条目区分度在当前模型群规模下为估计值而非最终结论
搜集汇总
数据集介绍
pqcbench 数据集图片
构建方式
PQCBench数据集是GSPC评估体系中的连续性轴,专注于衡量大型语言模型在后量子密码迁移方面的能力。该数据集由CSOAI Ltd构建,包含13个精心设计的项目,每个项目均基于固定的、锚定语料的真实情况判定,并标注为QUANTUM_VULNERABLE、QUANTUM_SAFE或NOT_APPLICABLE。其构建过程严格遵循测量科学原则,不涉及合格评定,且通过DOI进行版本化发布,确保可追溯性和可复现性。
特点
PQCBench数据集的核心特点在于其稀缺性和高度的领域特异性。与大规模通用数据集不同,该数据集规模极小(n=13),却能在模型评估中展现出显著的区分度(spread=0.350),有效分离不同能力的模型。值得注意的是,该数据集明确报告了可用项目数(usable_n=6),并坦承其统计功效的限制,这种透明性在同类基准中实属罕见。此外,数据集采用三分类标签,将无法评估的生成结果视为未测量而非错误,体现了测量严谨性。
使用方法
使用PQCBench时,研究者应关注三个关键点:首先,必须基于可用项目数(usable_n)而非总项目数来解释模型得分,避免高估证据强度;其次,比较模型表现时应采用置信区间,当95%区间重叠时,结论应标为‘未解决’;最后,该基准的分数是描述性的,而非认证结果,不可用于合规判定。建议结合GSPC的其它五个轴(如Governance、Safety等)综合评估模型的整体AI治理能力,以获得更全面的画像。
背景与挑战
背景概述
随着量子计算技术的迅猛发展,传统公钥密码体系面临严峻的生存威胁,后量子迁移(post-quantum migration)已成为全球信息技术领域的核心议题。在此背景下,CSOAI Ltd(英国注册号16939677)于2026年发布了PQCBench基准数据集,作为其GSPC仪器六大轴之一,专门用于评估大语言模型在后量子迁移任务上的连续性与知识储备。该数据集包含13个精心构造的测试项,依据量子脆弱性、量子安全及不适用三类标签进行标注,并借助10.5281/zenodo.21755657的DOI实现持久标识。PQCBench的诞生为衡量AI系统在量子安全领域的认知能力提供了标准化工具,其测量结果对欧盟AI法案等治理框架下的技术合规性评估具有潜在参考价值,推动了AI治理与密码学前沿的交叉研究。
当前挑战
PQCBench的构建与应用面临多重挑战。领域层面,后量子迁移涉及复杂的密码算法更迭与安全标准演进,要求模型具备精准的量子威胁判别能力,而当前模型在该任务上的平均难度仅为0.321,且存在5项负向区分项,表明模型能力与任务需求之间存在显著鸿沟。构建层面,数据集的规模受限(n=13),其中2项因所有模型均正确或均错误而成为死项,导致可用项仅6个,远低于统计显著性所需的30个阈值,使得95%置信区间无法有效收窄,难以支撑可靠的性能比较。此外,标注过程依赖单一标注者,缺乏交叉验证,拒绝检测器虽达到98.9%的准确率,但仍存在主观偏差风险。这些问题共同制约了该基准的测量可信度与推广价值。
常用场景
经典使用场景
PQCBench作为后量子迁移连续性轴的核心基准,专注于评估大语言模型在密码学范式转换中的知识完备性与判断准确性。该数据集包含13个精心设计的文本分类任务,覆盖量子脆弱性、量子安全及不适用三类标签,为研究者提供了标准化的测试集以度量模型对后量子密码学(如格基密码、多变量密码等)的认知水平。其典型应用场景包括:衡量模型能否准确识别传统RSA、ECC等易受量子攻击的算法,并区分已迁移至抗量子标准的系统。通过冻结的语料锚定真值,该基准确保了评测的客观性与可复现性,成为AI治理与密码学交叉领域的关键评估工具。
衍生相关工作
PQCBench的发布催生了多项相关研究与实践。其所属GSPC框架下的六轴基准(如GovBench、DefBench)共同构成一个多维AI治理评估体系,为该方向的开创性工作。基于PQCBench的统计数据,学者开始探索跨模型规模(494M-20B)的量子安全知识分布规律,并发展出针对死项检测的N≥19模型序列方法。此外,其关于负向区分度条目应移交仲裁而非删除的原则,引发了对基准设计中数据质量控制的后续讨论。数据集亦促进了后量子迁移语料库的构建,支撑了面向特定行业(如电信、政务)的模型微调与知识蒸馏研究,进一步推动了抗量子生态的智能化落地。
数据集最近研究
最新研究方向
PQCBench作为GSPC框架中评估后量子迁移能力的基准,其最新研究方向聚焦于在AI治理规范化背景下,构建面向后量子密码学过渡的连续性测量体系。该数据集通过13个精心设计的项目,对大规模语言模型进行量子安全分级,涵盖量子脆弱、量子安全及不适用三种状态,反映了对量子计算威胁下AI系统韧性评估的前沿探索。结合EU AI Act等监管政策,PQCBench致力于提供可量化、可复现的测量工具,推动行业在密码学迁移中的标准化进程,其创新在于引入死项与负判别分析以确保评估可靠性,尽管当前样本量有限,但已显露出区分模型性能的潜力,为未来大规模多架构验证奠定方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务