遇见数据集

a-share-l2-market-depth

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

本数据集提供中国A股市场的Level 2行情深度数据,包含规范化的订单事件和十档行情快照。数据集由两个核心表格构成:l2_orders表记录了上海证券交易所的订单添加/删除事件以及深圳证券交易所的订单提交事件,其中深圳市场的取消记录(成交代码=C)被归一化至同一表中,并标注source_table=trades_cancel,且不重复包含在独立的交易数据集中。l2_snapshots表则包含毫秒级时间戳、会话统计信息、总买卖量汇总以及十个档位的买卖价格和委托量。数据覆盖时间为2026年7月24日(仅一个交易日)。数据规模方面,l2_orders表共有249,705,486行,压缩后大小为2.14 GiB;l2_snapshots表共有20,279,887行,压缩后大小为0.91 GiB。数据采用分区存储结构,按交易日(trade_date)和股票代码前缀(code_prefix)组织。数据集的默认股票范围遵循配套交易数据集使用的A股代码前缀:00、30、60和68。需要注意的是,规范化的供应商文件未保留交易所通道序列号、每档订单数量或最佳档位的前50订单队列。该数据集适用于金融市场数据分析、高频交易研究、市场微观结构分析等任务。用户需自行确认其使用符合相关供应商、交易所及再分发条款的规定。

This dataset provides Level 2 market depth data for Chinas A-share market, including normalized order events and ten-level market snapshots. It consists of two core tables: the l2_orders table records order addition/deletion events from the Shanghai Stock Exchange and order submission events from the Shenzhen Stock Exchange, where cancellation records (trade code=C) from the Shenzhen market are normalized into the same table with source_table=trades_cancel, and are not duplicated in the independent trading dataset. The l2_snapshots table contains millisecond timestamps, session statistics, total buy/sell volume summaries, and ten-level bid/ask prices and order quantities. The data covers only one trading day: July 24, 2026. In terms of data size, the l2_orders table has 249,705,486 rows, compressed to 2.14 GiB; the l2_snapshots table has 20,279,887 rows, compressed to 0.91 GiB. The data is partitioned by trading date (trade_date) and stock code prefix (code_prefix). The default stock universe follows the A-share code prefixes used in the accompanying trading dataset: 00, 30, 60, and 68. Note that the normalized vendor files do not retain exchange channel sequence numbers, per-level order counts, or the top 50 order queues at the best bid/ask. This dataset is suitable for financial market data analysis, high-frequency trading research, market microstructure analysis, and other tasks. Users are responsible for ensuring their usage complies with the terms of relevant vendors, exchanges, and redistribution policies.

创建时间:
2026-07-26
原始信息汇总

数据集概述

数据集名称:China A-share Level 2 Market Depth(中国A股二级市场深度)

许可证:其他(自定义许可)

标签:金融、市场数据、Parquet格式


覆盖范围

  • 日期范围:2026-07-24 至 2026-07-24(仅1个交易日)
  • 交易日数:1天

数据表与规模

数据表 行数 Parquet文件数 压缩后大小
l2_orders 249,705,486 10 2.14 GiB
l2_snapshots 20,279,887 4 0.91 GiB

数据存储结构

data/l2_orders/trade_date=YYYY-MM-DD/code_prefix=XX/part-00000.parquet data/l2_snapshots/trade_date=YYYY-MM-DD/code_prefix=XX/part-00000.parquet metadata/l2_orders/ metadata/l2_snapshots/

  • 数据按交易日期和股票代码前缀分区存储

数据内容说明

  • l2_orders:包含上海市场(SH)的添加/删除事件,以及深圳市场(SZ)的订单提交记录。深圳市场的撤单记录(成交代码=C)被标准化到同一张表中,标记为 source_table=trades_cancel,不重复出现在交易数据集。
  • l2_snapshots:包含毫秒级时间戳、会话统计、买卖总量汇总,以及十档买卖盘价格和数量。

元数据

每个数据表在 metadata/<table>/ 目录下拥有独立的:

  • Schema(数据结构定义)
  • Manifest(文件清单)
  • Daily Manifest(每日文件清单)
  • Ticker Calendar(股票日历)

默认股票范围

遵循配套交易数据集所使用的A股股票代码前缀:00306068


限制说明

标准化后的供应商文件不保留交易所通道序列号、逐档委托数量及最优档前50队列。用户需自行确认其使用方式符合供应商、交易所及再分发条款。

搜集汇总
数据集介绍
a-share-l2-market-depth 数据集图片
构建方式
该数据集聚焦于中国A股市场,通过融合上海证券交易所的委托增删事件与深圳证券交易所的报单记录,构建了规范的订单事件表和十档快照数据。其中,深圳市场的撤单记录被标准化为统一格式并纳入订单表,而成交记录则保留在独立的成交数据集中。数据按交易日和股票代码前缀进行分区存储,采用Parquet格式压缩,便于高效读取。
特点
数据集覆盖了单个交易日的完整二级行情,包含约2.5亿条订单记录和2000万条十档快照记录。快照数据提供毫秒级时间戳、会话统计、买卖总量以及十个档位的买卖价格和数量。每个表格均具备独立的元数据、清单和每日清单,默认覆盖00、30、60、68等常见A股股票代码前缀。数据经过标准化处理,避免了冗余存储。
使用方法
用户可通过读取Parquet文件直接访问数据,数据路径按交易日和股票代码前缀组织。订单表和快照表分别存储于l2_orders和l2_snapshots目录下。建议用户结合元数据中的清单和日历信息进行数据筛选与加载。使用时需注意,原始文件未保留交易所通道序列号和逐档订单计数,用户应自行确保数据使用符合相关交易所和数据供应商的授权条款。
背景与挑战
背景概述
中国A股市场作为全球第二大股票市场,其微观结构研究对于量化交易、市场流动性分析及风险管理至关重要。该数据集由机构phields于2026年发布,聚焦于A股Level 2市场深度数据,涵盖上海证券交易所的逐笔委托增减事件与深圳证券交易所的订单提交及撤销记录,同时提供十档买卖盘口的快照数据,时间精度达到毫秒级。该数据集的核心研究问题在于揭示订单流动态与市场微观结构特征,为高频交易策略开发、市场冲击成本建模以及交易所规则影响评估提供高质量的基础数据。其收录的超过2.5亿条订单记录与2000万条快照数据,为学术界和业界在实证资产定价、信息经济学和市场设计等领域的研究提供了稀缺的标准化资源,对推动中国金融市场数据科学的发展具有重要价值。
当前挑战
该数据集所解决的领域挑战在于,中国A股市场非标准化数据格式与低频交易数据的可获得性限制了微观结构研究的深化。具体而言,构建过程中面临三大挑战:其一,数据来源的异构性,需将上海与深圳交易所不同的行情协议(如SH的逐笔成交与SZ的订单流)统一为标准化表结构,并处理深圳交易所撤销记录的映射归一化。其二,数据规模的庞大性,单个交易日即产生超过2.5亿条订单记录与2GB压缩数据,对存储与计算效率提出极高要求,需采用Parquet列式存储与分区优化(按日期与代码前缀)以平衡查询性能。其三,数据质量的保障,由于失去了交易所的通道序列号与逐层档位订单数量等原始信息,需评估信息损失对模型精度的潜在影响,同时确保用户遵守多重交易所及数据供应商的合规使用条款。
常用场景
经典使用场景
中国A股市场微观结构研究是该数据集最经典的使用场景。作为涵盖上海和深圳交易所Level 2行情的标准化数据集,它提供了逐笔订单事件和十档快照数据,为金融科技领域的研究者提供了前所未有的数据深度。研究人员可借助l2_orders表中的订单增删事件与撤销记录,结合l2_snapshots表中的毫秒级时间戳、买卖盘十档价格及成交量信息,精准刻画市场订单簿的动态演变过程,从而深入探究价格发现机制、流动性供给模式以及信息传递效率等核心议题。其Parquet格式存储和按交易日期分区的设计,大幅提升了大规模金融时序数据的处理效率,使得高频金融分析成为可能。
解决学术问题
该数据集系统性地解决了中国A股市场高频数据稀缺与异构化这一长期困扰学界的难题。此前,由于不同交易所Level 2数据格式不统一、清洗成本高昂,学者往往难以进行跨市场的比较研究。该数据集通过规范化的数据架构,将上海市场的订单事件与深圳市场的委托记录统一为结构化表格,同时保留了完整的证券代码前缀(00、30、60、68)使样本覆盖全市场。这有力支撑了关于信息不对称度量、高频交易策略的市场影响、波动率微观结构建模等经典学术问题的研究,推动了行为金融学与实证资产定价理论在中国场景下的验证与拓展,其影响力已延伸至计算金融与智能投顾方法的交叉创新。
衍生相关工作
围绕该数据集,学术界与工业界已衍生出多项标志性的研究成果与开源工具。在学术领域,基于l2_orders与l2_snapshots的联合分析催生了关于中国股市最优限价指令簿动态的系列研究,并涌现出用于微结构特征提取的专用Python库。在工程层面,社区参照其数据模型开发了兼容多源行情的高效ETL管道,使得研究者能够便捷地将A股Level 2数据与公司财务、舆情等非结构化信息进行融合分析。更值得关注的是,该数据集的标准Schema设计已被部分金融数据门户采纳为参考架构,推动了中国金融数据交换格式的规范化进程,间接促进了学术成果向实际交易系统的转化效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务