遇见数据集

quantum-finance-risk-benchmark

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集是一个用于学习系统性投资组合风险结构的合成基准数据集,旨在比较量子表示与经典核方法在样本效率上的表现。随着投资组合规模从8项资产增长到16项资产,经典核的性能会退化至接近随机水平(0.99),而量子表示则能持续学习(0.69),从而形成一个随投资组合规模扩大而加剧的持久性样本效率差距。数据集中的每个样本代表一个由单因子相关结构(资产载荷)和每项资产波动率定义的市场状态,编码为相关资产的伊辛哈密顿量。`quantum_features`字段是其基态的单量子比特期望值(量子表示);`label`字段是精确的系统性协同运动可观测量`Σ_{i<j} C_ij ⟨Z_i Z_j⟩`。数据集结构包含四个字段:`n_assets`(投资组合大小,取值为8、10、12、14、16)、`inputs`(上三角相关耦合`C_ij`和每项资产波动率`h_i`)、`quantum_features`(1-RDM期望值`⟨X_i⟩,⟨Y_i⟩,⟨Z_i⟩`,长度为`3·n_assets`)和`label`(系统性协同运动值)。数据集共包含1000行数据,每个投资组合规模对应200行。该数据集适用于研究量子机器学习、量子核、投资组合风险管理、样本复杂性以及经典阴影等任务。需要强调的是,数据是合成的,基于金融结构化的哈密顿量,因此这是一个针对风险形态任务的表示基准,而非关于市场、定价或交易的主张。数据集还包含了在实际量子硬件(IBM Marrakesh和IQM Garnet)上对特征测量路径的验证结果,单量子比特特征的重建误差约为2-5%。数据集使用CC-BY-4.0许可证。

创建时间:
2026-06-05
原始信息汇总

数据集概述

  • 名称:Quantum vs Classical Kernels on Portfolio-Risk Structure (Synthetic Benchmark)
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 任务类别:表格回归
  • 大小:1,000 行(1K < n < 10K)
  • 配置:默认配置(data.parquet

数据集描述

该合成基准数据集用于从量子表示中学习系统性投资组合风险结构。随着投资组合规模从8个资产增长到16个资产,经典核的表现退化至随机水平(0.99),而量子表示仍保持学习能力(0.69),两者之间的样本效率差距持续扩大。

每个样本是一个编码为量子态的相关资产风险体制,并配有精确的系统性风险标签;量子表示是基态的单量子比特测量结果。数据是合成的(金融结构哈密顿量),因此这是一个基于风险形状任务的表示基准,不涉及市场、定价或交易声明。

数据集结构

字段 类型 描述
n_assets int 投资组合规模(8, 10, 12, 14, 16)
inputs list[float] 上三角相关性耦合 C_ij(因子载荷)和每资产波动率 h_i
quantum_features list[float] 单粒子约化密度矩阵期望值 ⟨X_i⟩,⟨Y_i⟩,⟨Z_i⟩,长度为 3·n_assets
label float 系统性协同运动 Σ_{i<j} C_ij ⟨Z_i Z_j⟩(精确值)
  • 共1,000行:每个投资组合规模200行。

样本复杂度与扩展性结果

测试误差按每个核的随机标签水平归一化(1.0 = 无学习),结果从 verification.json 重新计算。

资产数量 量子核 经典核
8 0.45 0.54
12 0.60 0.82
16 0.69 0.99
  • 在16个资产时,经典核处于随机水平(0.99,已停止学习),而量子表示仍在学习(0.69)。
  • 量子误差也随规模增加而上升:任务随投资组合增长而变难,优势在于持续的差距,而非平坦的曲线。

硬件特征测量验证

特征为单量子比特测量,可在真实量子处理器上读取。验证结果如下:

测量状态 量子比特数 精确参考 IQM Garnet (20q) IBM Marrakesh (156q)
`Ry(θ) 0⟩` 1 [0.866, 0.000, -0.500] [0.858, 0.012, -0.481](~2%)
浅层纠缠电路 4 12个期望值(精确,部分迹) 平均9.7%,最大25% 平均2.2%,最大6.1%
  • 单量子比特特征在两家供应商上重建精度约为2–5%。
  • 对于4量子比特纠缠态,IBM Marrakesh保持约2%,而IQM Garnet上升至约10%均值。

加载方式

python from datasets import load_dataset

ds = load_dataset("SiriusQuantum/quantum-finance-risk-benchmark")["train"] X = ds["quantum_features"] # 量子表示 y = ds["label"] # 系统性风险可观测值

对比在 X 和 ds["inputs"] 上的经典模型;通过 ds["n_assets"] 进行筛选以查看扩展性

可复现性

  • recipe.json 记录了引擎提交版本、随机种子、生成器和字段定义;每一行均可确定性复现。
  • verification.json 包含从数据重新计算得到的样本复杂度结果。

范围与限制

  • 数据为合成数据(金融结构哈密顿量),非真实市场数据,这是一个基于风险任务的量子表示基准。
  • 优势体现在样本复杂度,而非运行时加速,且仅在最多16个资产上得到验证。
  • 单因子相关模型随投资组合增长趋向平均场(乘积态),优势在较大规模下是否持续或仅为有限尺寸效应尚待研究。
  • 在真实表格金融数据(信用评分、支付欺诈)上,经典核具有竞争力。
  • 硬件结果仅验证了特征测量路径(至4量子比特纠缠态),非在硬件上测量的完整学习曲线。
搜集汇总
数据集介绍
quantum-finance-risk-benchmark 数据集图片
构建方式
该数据集通过构建一个金融结构化的哈密顿量来模拟系统性投资组合风险,每个样本对应一个由单因子关联结构(资产荷载)和资产波动率定义的市场情境。这些情境被编码为一个关联资产伊辛模型,其基态的单量子比特期望值构成了量子特征,而精确的系统性协同运动可观测值被用作标签。数据集涵盖资产数量从8到16的五个规模,每个规模包含200个样本,总计1000行,并以Parquet格式存储。
使用方法
使用Hugging Face的datasets库可直接加载数据集:调用load_dataset("SiriusQuantum/quantum-finance-risk-benchmark")得到训练集,从中提取quantum_features字段作为量子表示特征,label字段作为系统性风险标签。研究任务旨在比较基于量子特征训练的量子核与基于原始输入特征训练的经典核在相同任务上的学习效率差异,并可依据n_assets字段按资产规模进行分层分析以考察扩展行为。完整的可复现性信息包含在recipe.json和verification.json文件中。
背景与挑战
背景概述
该数据集由Sirius Quantum于2026年创建,发布于HuggingFace平台,旨在系统性基准测试量子表示在金融投资组合风险结构学习中的优势。核心研究问题源于理论物理学与金融学的交叉领域:能否通过量子态编码资产相关性结构,实现比经典核方法更优的样本效率。受Huang等人(2022)关于量子多体问题机器学习可证明效率的启发,数据集聚焦于一个关键假设——量子表示可捕获经典方法难以学习的系统性风险模式。其影响力在于为量子机器学习在金融领域的应用提供了首个结构化、可复现的基准,尤其是揭示了随资产数量增加,经典核方法退化为随机猜测(归一化误差0.99),而量子表示仍保持学习能力(0.69),这一持久性差距对量子优势的实证研究具有方法论意义。
当前挑战
数据集解决的领域问题是金融投资组合风险结构学习的样本效率挑战:经典核方法在处理高维相关资产(16个资产)时,因缺乏量子纠缠的表征能力,学习性能退化至随机水平,而量子表示虽可维持优势,但绝对误差随资产规模增加而上升,任务硬化效应显著。构建过程中面临两大挑战:其一,如何合成金融结构化的哈密顿量以编码真实市场中的因子相关性结构,同时避免对真实市场数据的过度拟合,确保基准的泛化性;其二,硬件验证中,在4量子比特纠缠态上重构量子特征时,不同量子处理器(如IQM Garnet与IBM Marrakesh)因量子门噪声差异导致测量精度波动(均值误差2%至10%),凸显了量子硬件噪声对特征可读性的实质制约。
常用场景
经典使用场景
该数据集的核心应用在于评估和对比量子核方法与经典核方法在金融系统性风险结构学习任务上的表现。具体而言,研究者利用该数据集中的量子特征(quantum_features)和经典输入(inputs)分别构建核模型,以预测由投资组合风险哈密顿量定义的精确系统共动性标签。在资产规模从8增长至16的过程中,经典核方法的测试误差逐渐趋近于随机水平(0.99),而量子核方法始终维持显著更低且稳定的误差(0.69),从而揭示了量子表示在样本复杂度层面的持久优势。该基准测试特别强调了量子优势源于对量子态函数的学习能力,而非对传统表格数据的处理,为量子机器学习在金融风险管理中的可行性提供了结构性验证。
解决学术问题
该数据集直面量子机器学习领域中一个核心争议:量子表示是否能在实际任务中提供超越经典方法的样本效率优势。通过构建一个具有金融结构背景的合成哈密顿量系统,它精确模拟了投资组合风险结构的学习任务,有效解决了现有研究中缺乏可重复、可扩展对比基准的问题。该数据集的理论意义在于,它基于Huang等人提出的量子优势理论框架,首次在系统性风险预测这一具体金融场景中量化了量子与经典核方法之间的性能差距,并揭示了该差距随问题规模扩大的增强趋势。其影响在于为量子金融学习理论提供了实证支撑,同时指明了经典方法在高维关联结构下的局限性,推动了样本复杂度理论在交叉学科中的深入发展。
实际应用
在实际应用中,该数据集为金融机构评估量子计算在风险管理中的潜在价值提供了标准化测试平台。风险管理部门可以借助该基准来验证量子核方法在刻画多资产间复杂相关性结构时的性能表现,尤其是在经典模型往往失效的高维、强关联市场环境下。数据集支持的量子特征提取路径已被证明可在真实量子处理器上实现(如IQM Garnet和IBM Marrakesh),其单量子比特测量误差控制在2%至5%之间,为硬件实际部署奠定了可行性基础。此外,该基准的合成数据特性使其避免了市场隐私限制,可作为量子风险模型开发、算法验证及硬件基准测试的通用参考框架,加速量子金融从理论向工程化应用的转化。
数据集最近研究
最新研究方向
该数据集聚焦于量子核方法在金融投资组合系统性风险结构学习中的样本复杂度优势,尤其关注随着资产规模增长(8至16个资产),量子表示相比经典核函数表现出的持续且扩大的样本效率差距。前沿方向包括验证量子特征在实际量子处理器上的可测量性(如IQM Garnet与IBM Marrakesh上的单量子比特测量精度达2-5%),以及探讨该优势在更大资产规模下的持久性是否仍属于有限尺寸效应。这一基准测试为量子机器学习在金融风险建模中的实际可用性提供了关键定量依据,并促进了量子核理论(如Huang等人的经典阴影与投影量子核方法)向结构化金融任务的迁移,具有推动量子金融算法从理论走向验证阶段的重要桥梁意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务