遇见数据集

OpenAutocall

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

Autocallable Notes Pricing (Synthetic) 是一个完全合成的数据集,专为机器学习在衍生品定价领域的应用而设计。其核心目的是通过生成大量的自动赎回结构化票据定价场景及其对应的公允价值,来训练快速的替代定价模型(代理模型)、对表格回归模型进行基准测试,并研究产品具体条款(如票息、障碍)与市场状态(如标的资产价格、相关性、波动率曲面)如何共同决定产品的公允价值。数据通过蒙特卡洛模拟方法,基于随机波动率模型(主要是Heston模型)从第一性原理生成,不包含任何真实市场数据或专有报价,确保了数据的可复现性和开源性质。数据集的主要任务是表格回归,目标变量是票据的公允价值(`PV`)。数据集规模在100万到1000万行之间,以宽表格CSV格式呈现,包含约1531列。每行代表一个独立的定价场景。数据列可详细分为以下几组:1. 标识符与元数据:如估值日期、模型索引、观察索引、资产数量等。2. 产品条款:如票据期限、票息率、票息障碍、自动赎回障碍、是否包含看跌期权、是否包含记忆效应、看跌期权行权价等。3. 市场状态:如无风险利率、各标的资产的初始即期价格、估值日即期价格、资产间相关系数等。4. 固定时间表与隐含波动率曲面:包含最多12个固定观察日期,以及每个资产在每个日期上对31个不同行权价的隐含波动率,共同构成了离散化的波动率曲面。5. 目标变量:核心是`PV`(票据公允价值,回归目标),同时提供`PV_std`(蒙特卡洛模拟的标准误差,用于评估标签噪声)。数据生成过程覆盖了多种参数配置,包括1至4个标的资产的资产篮子、最差表现(worst-of)或最小篮子(min-basket)的收益约定、可选的记忆票息等。生成参数如期限、票息范围、障碍范围、相关系数范围、Heston模型参数范围等均在README中明确列出。该数据集适用于以下场景:开发用于加速复杂衍生品定价的机器学习模型、研究定价模型对输入参数的敏感性、以及作为金融领域表格回归任务的高质量合成基准。需要注意的是,由于数据完全基于模型模拟生成,基于此训练的模型学习的是特定模拟定价器的行为,而非真实市场的定价规律;此外,数据存在由蒙特卡洛模拟引入的标签噪声,且对于资产数量少于4的场景,波动率曲面部分存在大量零填充列。

创建时间:
2026-06-25
原始信息汇总

数据集概述

数据集名称:Autocallable Notes Pricing (Synthetic)
许可协议:CC-BY-4.0
语言:英文
数据集大小:1M < n < 10M 行
任务类型:表格回归(Tabular Regression)
标签:金融、量化金融、衍生品、结构化产品、可自动赎回票据、期权定价、蒙特卡洛、Heston模型、合成数据

核心任务

  • 主要任务:表格回归——根据产品条款和市场状态预测可自动赎回票据的公允价值(PV)。
  • 辅助任务:定价加速与模型蒸馏、敏感度分析与校准研究。

数据生成方式

  • 完全合成:基于蒙特卡洛模拟生成,使用Heston随机波动率模型。
  • 生成工具:开源流水线 VegaInstitute/RG-ML-Autocall-Dataset
  • 不包含:任何真实市场数据、专有报价或抓取内容。

基础模型

模型 动态特性 说明
Heston 随机波动率 产生波动率微笑,参数从设定范围内采样

生成参数(默认配置)

参数 值/范围
年交易日数 252
期限(年) {1, 2, 3}
年观察次数 {1, 2, 4}
每篮子资产数 1–4
票息率 [0.01, 0.50]
票息障碍 [0.80, 1.00]
自动赎回障碍 [1.00, 1.30]
看跌行权价 [0.70, 1.30]
资产间相关性 [-0.80, 0.80]
无风险利率 0.0
现货/名义本金 1.0
蒙特卡洛路径数 最多 1,000,000
篮子约定 最差/最小篮子
MC质量过滤 保留 PV_std ≤ 0.01 的场景
Heston: 均值回归速度 κ [1.0, 10.0]
Heston: 波动率波动 ν [0.01, 1.0]
Heston: 价格/方差相关性 ρ [-0.95, -0.10]
Heston: 长期方差 θ [0.01, 0.20]
Heston: 初始方差 V₀ [0.0001, 0.04]

数据结构

数据集为宽格式CSV表格,每行对应一个定价场景,完整多资产配置下约有 ~1,531列。列分组如下:

标识符与元数据

  • value_date:估值日期(年分数)
  • value_date_memory:记忆票息特征的估值日期
  • model_idx:模型参数集索引
  • observation_idx:某个模型内的产品抽取索引
  • frequency:观察/固定频率
  • use_min_basket:是否采用最差/最小篮子约定

产品条款

  • tenor:到期期限(年)
  • coupon:票息率
  • coupon_barrier:票息障碍(现货的百分比)
  • autocall_barrier:自动赎回障碍
  • is_put:到期是否适用向下敲入看跌期权
  • has_memory:是否累积未付票息(记忆效应)
  • strike_put:看跌行权价(现货的百分比)

市场状态

  • rate:无风险利率
  • num_assets:标的资产数量(1–4)
  • spot_asset_{1..4}:每个资产的初始现货价格
  • value_date_spot_asset_{1..4}:估值日每个资产的现货价格
  • corr_asset_i_j:资产间的成对相关性

观察日期与隐含波动率曲面

  • Date{1..12}:固定/观察日期(年分数)
  • Asset{a}_Date{d}_vol_{k}:资产 a、固定日期 d、行权价指数 k 的隐含波动率(1–31)

Asset{a}_Date{d}_vol_{1..31} 块编码了离散化的隐含波动率曲面:每个资产每个固定日期对应31个行权价,最多4个资产、12个日期。

目标变量

  • PV:票据的公允价值(回归目标)
  • PV_std:PV的蒙特卡洛标准误差(标签的不确定性)

使用示例

python from datasets import load_dataset ds = load_dataset("VegaInstitute/autocallable-notes-pricing", split="train") print(ds.features) print(ds[0]["PV"])

使用pandas:

python import pandas as pd df = pd.read_csv("hf://datasets/VegaInstitute/autocallable-notes-pricing/data/heston/dataset.csv") y = df["PV"] X = df.drop(columns=["PV", "PV_std", "model_idx", "observation_idx"])

局限性

  • 合成数据:价格和波动率曲面源于模型假设,并非真实交易报价。
  • 标签噪声:PV存在蒙特卡洛误差,可用PV_std加权或过滤。
  • 模型覆盖:限于Heston模型及给定参数范围,超出范围的产品条款将超出分布。
  • 宽且稀疏:波动率曲面块占主导列数,资产数小于4时许多列被零填充。
  • 利率为零:默认生成时无风险利率设为0。

引用

bibtex @misc{vegainstitute_autocall_synthetic, title = {Autocallable Notes Pricing (Synthetic)}, author = {Vega Institute}, year = {2026}, howpublished = {Hugging Face Datasets}, url = {https://huggingface.co/datasets/VegaInstitute/autocallable-notes-pricing}, note = {Synthetic Monte Carlo dataset for pricing autocallable structured notes} }

搜集汇总
数据集介绍
OpenAutocall 数据集图片
构建方式
OpenAutocall数据集的构建依托于蒙特卡洛模拟与随机波动率模型,通过开源的生成管线,在Heston随机波动率框架下对自动赎回型结构化票据进行定价。数据集涵盖了1至4种标的资产的组合,采用最差或最小篮子支付结构,并可选配记忆票息机制。每次定价均通过最多一百万条蒙特卡洛路径计算票据的公允价值,同时记录模拟标准误。生成的参数空间广泛,包括票息率、障碍水平、期限、相关性以及波动率参数等,确保数据覆盖多样化场景。
使用方法
OpenAutocall数据集主要面向表格回归任务,旨在训练能够快速逼近蒙特卡洛定价器的代理模型。用户可通过Hugging Face的datasets库直接加载数据,或使用pandas读取CSV文件。在建模过程中,建议将PV作为回归目标,PV_std作为逐行权重或噪声过滤依据,同时剔除纯索引性质的model_idx和observation_idx列。数据集支持多种机器学习模型,包括梯度提升树和神经网络,用于定价加速、模型蒸馏以及参数校准研究。
背景与挑战
背景概述
OpenAutocall数据集由Vega Institute于2026年发布,旨在通过机器学习方法对自动赎回型结构化票据进行定价。在金融衍生品领域,此类复杂产品的定价通常依赖蒙特卡洛模拟等数值方法,计算成本高昂且难以实时应用。该数据集通过赫斯顿随机波动模型生成完全合成的数据,涵盖了1至4个标的资产的篮子、多种产品条款参数及市场状态,构建了一个规模达数百万行的表格回归任务。其核心研究问题在于训练能够快速准确预测票据公允价值的代理模型,以加速定价流程并支持敏感度分析与参数校准。作为金融领域中大规模、高质量的合成衍生品定价数据集,它为学术界和工业界提供了基准测试和模型蒸馏的重要资源,推动了机器学习在量化金融中的实际应用。
当前挑战
该数据集面临的首要领域挑战是衍生品定价的高计算复杂度,传统蒙特卡洛方法在实时交易和风险管理中难以满足速度要求,亟需通过机器学习构建高效且精确的替代定价模型。在数据构建过程中,主要挑战包括:赫斯顿模型参数空间的广泛采样与标签质量的平衡,蒙特卡洛模拟带来的固有标签噪声需要通过PV_std指标进行筛选与加权;高维特征空间(超过1500列)与稀疏性问题并存,尤其是隐含波动率曲面特征在低资产数量时大量零填充,对回归模型的特征工程和泛化能力提出严苛要求;固定零无风险利率的假设限制了模型在真实市场条件下的适用性。此外,完全合成数据的性质使得学习结果仅限于模拟定价器的逼近,无法捕捉真实市场的定价偏差与流动性效应。
常用场景
经典使用场景
在金融衍生品定价领域,自动赎回结构化票据因其复杂的路径依赖特征与多资产联动机制,对传统数值方法构成了显著挑战。该数据集作为首个大规模合成自动赎回票据定价基准,专为表格数据回归任务而设计,核心目标是从产品条款与市场状态变量到公允价值的映射学习。研究者可利用约1500维特征空间,涵盖息票率、障碍水平、资产间相关性及隐含波动率曲面等关键参数,训练替代定价模型,实现与蒙特卡洛模拟精度高度吻合的快速预测。这一场景取代了传统模拟计算中繁复的路径生成与折现过程,为量化分析提供了高效且可复现的研究平台。
解决学术问题
学术研究长期面临结构化产品定价中计算效率与模型复杂性的权衡困境。该数据集通过构建基于Heston随机波动模型的蒙特卡洛仿真引擎,系统性地生成了涵盖1至4个基础资产、多种敲出结构与记忆息票条款的定价样本,有效解决了真实市场数据稀缺、标签噪声难以量化及产品条款分布不均等瓶颈问题。它使得研究者能够在可控条件下验证不同回归模型对非线性、高维定价函数的逼近能力,深入探讨隐含波动率曲面离散化表示对定价精度的影响,以及标签噪声(MC标准误差)在模型蒸馏过程中的传播规律,推动了机器学习驱动衍生品定价的理论发展。
实际应用
在实际金融市场中,该数据集为投资银行与资产管理机构提供了构建快速定价引擎的训练基石。基于此数据训练的替代模型可嵌入交易前台系统,实现实时风险敞口计算与产品估值,将原本需要数分钟的蒙特卡洛模拟压缩至毫秒级响应。此外,它支撑着敏感性分析与对冲参数计算的高效实施,帮助交易员洞察息票率变动、相关性偏移对票据价值的动态影响。在金融科技领域,这一数据集被用于开发面向零售投资者的结构化产品定价工具,降低复杂衍生品的信息不对称程度,提升市场透明度和定价公允性。
数据集最近研究
最新研究方向
OpenAutocall数据集的问世标志着机器学习在金融衍生品定价领域迈入了一个崭新的范式。该数据集通过蒙特卡洛模拟,在赫斯顿随机波动率模型框架下生成了海量自动赎回型结构化票据的定价场景,为构建替代性定价代理模型提供了高质量的训练样本。当前前沿研究方向聚焦于利用深度神经网络与梯度提升模型对传统蒙特卡洛定价器进行速算蒸馏,以期在保持精度的前提下显著提升计算效率。这一方向的探索深刻契合了量化金融领域对实时风控与大规模敏感性分析的热切需求,为复杂结构性产品的市场定价与风险校准开辟了全新路径,其影响将辐射至金融工程与人工智能交叉研究的诸多层面。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务