遇见数据集

bennett-tan/kalshi-btc-15m-features

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1980个训练示例,涉及金融市场相关的时间序列数据,特征包括价格统计指标(如均值、标准差、偏度、峰度)、开盘价、收盘价、动量、波动率、交易量、成交额加权平均价格(VWAP)、熵、订单流不平衡(OFI)等,以及市场代码和时间范围信息,用于可能的市场预测或分析任务。

This dataset contains 1980 training examples of time-series data related to financial markets, with features including price statistics (e.g., mean, standard deviation, skewness, kurtosis), open price, last price, momentum, volatility, trade volume, volume-weighted average price (VWAP), entropy, order flow imbalance (OFI), along with market ticker and horizon information, likely intended for market prediction or analysis tasks.

提供机构:
bennett-tan
搜集汇总
数据集介绍
bennett-tan/kalshi-btc-15m-features 数据集图片
构建方式
该数据集基于Kalshi平台上一系列二元市场(Binary Markets)的交易数据构建而成。原始数据经过特定时间窗口(15分钟)的聚合处理,以捕捉比特币价格走势的微观结构特征。构建过程中,首先从高频交易记录中提取了价格统计量(如均值、标准差、偏度、峰度)和流动性指标(如成交量加权均价VWAP、订单流不平衡OFI),随后引入了市场微观结构理论中的关键变量,包括熵(entropy)、半漂移(half_drift)、自相关(ac1)以及成交量不对称性(cond_vol_asym)等。最终形成包含29个特征栏位的结构化数据集,覆盖1980个训练样本,每个样本均关联至特定市场代码(market_ticker)与到期时间(horizon)下的二元期权合约。
使用方法
该数据集的使用场景主要集中在金融时间序列预测与二元期权定价建模领域。用户可直接调用Hugging Face Datasets库加载默认配置下的训练分片(data/train-*),将29个数值型特征作为模型输入,以“resolved_yes”字段作为二元分类标签,训练分类器预测合约到期时涨跌方向。在模型构建过程中,建议对“market_ticker”与“horizon”进行独热编码或嵌入处理,以捕捉不同市场与到期期限间的异质性效应。由于数据集包含时间序列特性,用户可采用滑动窗口划分训练集与验证集,避免未来信息泄露。此外,对于需要预测连续价格的场景,可选取“p_last”或“p_move”作为回归目标变量。
背景与挑战
背景概述
预测市场作为新兴的金融衍生品领域,其价格发现功能与市场微观结构特征日益受到学术界与量化交易界的关注。Kalshi是美国商品期货交易委员会(CFTC)监管的预测市场平台,允许用户对各类事件结果进行交易。在此背景下,“kalshi-btc-15m-features”数据集应运而生,通过提取比特币相关预测合约在15分钟时间窗口内的多维特征,旨在为预测市场的价格行为建模提供结构化数据支持。该数据集由某量化研究团队构建,包含价格统计量、订单流不平衡、流动性度量及市场微观结构指标等26个特征字段,为后续机器学习模型探索预测市场的信息效率与交易策略奠定了数据基础。其核心研究问题聚焦于如何从高频市场数据中捕捉具有预测能力的信号,对理解算法交易在预测市场中的应用具有重要启发意义。
当前挑战
该数据集面临的核心挑战在于预测市场领域的固有复杂性与数据构建过程的诸多难点。首先是领域问题层面的挑战:预测市场的价格形成机制高度依赖事件结局的不确定性,与传统金融资产相比,其波动模式与信息传导路径更为非结构化,这使得传统量化模型难以直接迁移应用。其次是数据集构建过程中的挑战:原始数据需经过高频采样、缺失值处理及异常波动剔除等复杂预处理流程,以确保特征计算的稳健性;同时,时间窗口长度(15分钟)与预测合约存续期的匹配关系需精妙设计,稍有不慎便可能引入前瞻性偏差或信息泄露。此外,预测市场的流动性稀疏性导致部分时间片数据质量参差不齐,如何在特征工程中平衡信号纯度与样本可用性,成为提升数据集实用价值的关键难题。
常用场景
经典使用场景
在金融预测与量化交易的研究领域中,kalshi-btc-15m-features数据集为学者提供了精细化的市场微观结构数据,尤其适用于构建高频比特币价格走势预测模型。该数据集包含丰富的统计特征,如价格的均值、标准差、偏度、峰度、动量、VWAP,以及订单流不平衡(OFI)、熵、自相关系数等高级指标,使研究者能够捕捉市场情绪与流动性变化的微妙信号。经典应用场景包括利用这些特征通过机器学习算法预测15分钟时间尺度上的比特币方向性移动或波动率变化,从而验证市场有效性假说或开发新型交易策略。
解决学术问题
该数据集巧妙回应了金融计量学中关于预测市场短期异动与微观结构效应的核心挑战。传统研究中,由于缺乏高粒度且包含订单流与交易者行为代理变量的数据,难以有效刻画非对称信息与流动性博弈对价格的冲击。kalshi-btc-15m-features所涵盖的条件波动非对称性、滞后订单流不平衡及交易量加速等特征,为检验量化脆弱性、客户订单流对价格发现的动态影响提供了实证基础。其意义在于推动了对预测市场这一新兴交易机制的理解,揭示了聚合预测与现货市场价格发现之间的耦合关系,丰富了行为金融与信息经济学交叉领域的实证证据。
实际应用
在实际金融生态中,该数据集为算法交易系统的回测与优化提供了不可或缺的燃料。量化对冲基金与加密货币做市商可利用其包含的成交量倾斜、订单簿冲击不对称等特征,设计出能够实时识别短线噪音与趋势信号的交易逻辑,从而在比特币市场上执行更稳健的流动性获取与风险管理策略。此外,面向预测市场平台(如Kalshi)的风险评估工具也可通过该数据集中时间片占比与熵等指标,搭建实时的市场情绪监测仪表盘,帮助交易者预警极端行情或流动性枯竭前的结构性变化。
数据集最近研究
最新研究方向
该数据集聚焦于比特币15分钟高频交易特征工程,涵盖价格统计量(均值、标准差、偏度、峰度)、动量指标、订单流不平衡(OFI)、成交量加权均价(VWAP)及熵等复杂特征,旨在为预测二元事件合约(如Kalshi预测市场)的结算结果提供数据基础。近期前沿研究将此类微观结构特征与深度学习模型(如LSTM、Transformer)结合,探索市场微观噪声中的预测信号,尤其在事件驱动型交易策略中展现了潜力。伴随预测市场在金融科技领域的兴起,该数据集为量化分析合约结算概率、市场效率及信息不对称提供了实证工具,推动了算法交易与行为金融的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务