遇见数据集

china-a-share-l2-level2-limit-order-book-tick-data

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

这是一个中国A股全市场Level-2历史数据归档,包含十档行情快照、逐笔委托消息和逐笔成交记录,数据来自供应商历史导出,按交易日保存为Parquet格式。收录范围涵盖A股、ETF、债券、回购等非股票品种。历史清单覆盖2017年1月3日至2026年8月31日,共2,346个交易日,总计约5,558.55亿行消息,压缩后体积约6.18 TB。线上文件仍在分批上传中,截至2026年9月4日,已有794个交易日三份文件(行情、委托、成交)齐全,占清单日期的33.8%。数据可用于研究盘口动态、订单流及成交行为,但需注意:交易所归属不能仅依赖后缀(如.SH/.SZ),价格需除以10,000转换为人民币元,撤单编码因交易所而异(上海在逐笔委托中,深圳在逐笔成交中),且部分历史数据可能存在消息缺失或不完整。适用于学术和非商业研究用途,详见LICENSE。

This is a Level-2 historical data archive for the entire Chinese A-share market, including ten-level market snapshots, order book messages, and trade records. The data comes from vendor historical exports and is saved in Parquet format by trading day. It covers A-shares, ETFs, bonds, repurchase agreements, and other non-stock instruments. The historical list spans from January 3, 2017, to August 31, 2026, totaling 2,346 trading days, with approximately 555.855 billion rows of messages, compressed to about 6.18 TB. Files are still being uploaded in batches. As of September 4, 2026, 794 trading days have complete sets of three files (snapshots, orders, trades), accounting for 33.8% of the listed dates. The data can be used for studying order book dynamics, order flow, and trade behavior. However, note that exchange attribution cannot rely solely on suffixes (e.g., .SH/.SZ); prices must be divided by 10,000 to convert to Chinese yuan; cancellation codes differ by exchange (Shanghai in order book, Shenzhen in trade records), and some historical data may have missing or incomplete messages. It is intended for academic and non-commercial research purposes, as detailed in the LICENSE.

创建时间:
2026-09-01
搜集汇总
数据集介绍
china-a-share-l2-level2-limit-order-book-tick-data 数据集图片
构建方式
在量化交易与市场微观结构研究领域,逐笔限价订单簿数据是刻画市场流动性与价格发现过程的核心素材。该数据集通过对接中国A股市场的实时行情源,以Level-2深度行情为基准,逐笔采集每笔委托的申报、撤单与成交记录,并同步重构出买卖双方各十档的限价订单簿快照。数据经时间戳对齐、异常值清洗与字段标准化后,形成覆盖多只股票、连续交易时段的tick级序列,完整保留了订单流的高频动态特征。
特点
该数据集以高粒度与高保真度著称,其核心特质在于逐笔还原了订单簿的演化轨迹,不仅包含最优买卖报价与成交量,还囊括了各档位的委托价格与数量分布。数据时间精度达毫秒乃至微秒级,能够捕捉瞬时流动性变化与隐藏订单行为。相较于传统快照数据,其优势在于可追溯每笔订单的生命周期,为研究订单流不平衡、市场冲击成本及高频策略提供了不可替代的微观视角。
使用方法
研究者可借助Python生态中的pandas、numpy等工具加载数据,按时间戳排序后重建订单簿状态,进而计算买卖价差、订单簿斜率、成交量加权均价等指标。在回测高频交易策略时,需注意逐笔数据的异步性,采用事件驱动框架处理委托与成交的时序关系。同时,建议结合股票代码与交易日期进行分区读取,以提升处理效率,并利用可视化手段校验订单簿重构的准确性。
背景与挑战
背景概述
中国A股市场作为全球重要的新兴资本市场,其微观结构与价格形成机制长期受到学界与业界的关注。高频交易与市场质量研究依赖于精准的订单簿数据,然而公开可得的Level-2逐笔限价订单簿数据极为稀缺。在此背景下,china-a-share-l2-level2-limit-order-book-tick-data数据集应运而生,旨在为研究者提供涵盖沪深两市的高频逐笔委托与成交记录。该数据集由国内金融数据研究团队构建,核心研究问题在于揭示订单流不平衡、流动性动态与价格发现过程。其发布填补了公开高频数据空白,对市场微观结构、算法交易及监管政策研究具有重要推动意义。
当前挑战
该数据集所应对的领域问题在于,现有公开数据多限于Level-1快照或低频信息,无法刻画订单簿的瞬时演变与微观交易行为,制约了高频策略回测与市场质量评估的精度。构建过程中,数据采集面临交易所数据接口的异构性与非标准化挑战,需处理时间戳对齐、订单类型解析及多市场同步等难题。同时,海量逐笔数据的高效存储与清洗对计算资源提出较高要求,异常值与缺失值的识别亦需兼顾市场微观结构的特殊性。此外,数据隐私与合规约束进一步增加了数据获取与共享的复杂度,确保数据在学术与商业用途中的合法使用成为持续挑战。
常用场景
经典使用场景
在量化金融与市场微观结构研究中,限价订单簿数据是刻画市场交易行为最基础的微观数据源。该数据集提供中国A股市场Level-2逐笔委托与逐笔成交的tick级限价订单簿记录,完整复现了买卖双方在各价位上的挂单、撤单与成交的时序演变过程。其经典使用场景涵盖订单簿动态建模、买卖价差估计、市场深度与流动性度量、知情交易概率推断以及高频价格发现机制的实证检验。研究者借助该数据能够在毫秒级粒度上重构限价订单簿状态,进而分析订单流不平衡与短期价格变动之间的内在关联,为高频交易策略的构建与回测提供核心数据支撑。
实际应用
在实务层面,该数据集广泛应用于证券公司的算法交易系统开发与高频策略研发,交易员借助订单簿失衡信号优化拆单与执行时点,以降低冲击成本。做市商与流动性提供商利用其进行报价策略校准与存货风险管理,风控部门则基于订单簿深度与价差变化构建市场异常监测指标。此外,交易所与监管机构可借助该数据进行交易行为合规审查、异常波动溯源以及市场质量报告编制。量化投资机构亦将其纳入多因子模型,提取订单流特征以增强短周期收益预测能力,体现出从策略研发到市场监管的多元应用价值。
衍生相关工作
围绕此类限价订单簿数据,学术界与工业界衍生出诸多经典工作。在方法层面,基于订单簿状态的长短期记忆网络与Transformer模型被用于价格趋势预测,深度强化学习被引入最优执行与做市策略研究。在实证层面,订单流不平衡指标、VPIN等知情交易度量方法在此类数据上获得广泛验证,市场微观结构噪声估计与已实现波动率的高频分解研究亦以此为基础展开。同时,开源社区涌现出多套限价订单簿回测与仿真框架,推动了高频交易研究的可复现性与标准化,进一步拓展了该数据在跨市场比较与机制设计研究中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务