遇见数据集

a-share-l2-trades

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

该数据集是中国A股市场Level 2交易记录的规范数据集,以单一事实表形式存储。数据集覆盖2026年4月1日至2026年7月10日期间,包含65个交易日,总计10,689,329,078行交易记录,存储为467个Parquet文件,压缩后本地大小为87.52 GiB。数据采用Hive分区格式组织,按交易日(trade_date)和股票代码前缀(code_prefix)进行分区,其中code_prefix取股票代码的前两位字符。数据包含12个核心字段:股票代码(ticker)、时间戳(time_s)、交易ID(tran_id)、价格(price_x10000,需除以10000得到实际价格)、成交量(volume)、卖方订单量(sale_order_volume)、买方订单量(buy_order_volume)、交易方向(side)、卖方订单ID(sale_order_id)、卖方订单价格(sale_order_price_x10000)、买方订单ID(buy_order_id)和买方订单价格(buy_order_price_x10000)。数据集还提供三个元数据文件:每日清单(daily_manifest.parquet)、股票日历(ticker_calendar.parquet)和模式定义(schema.json)。该数据集适用于金融市场分析、高频交易研究、算法交易策略开发等金融科技应用场景。

This dataset is a standardized dataset of Level 2 trading records for the Chinese A-share market, stored as a single fact table. Covering the period from April 1, 2026 to July 10, 2026, it includes 65 trading days and a total of 10,689,329,078 trading records. The data is stored in 467 Parquet files, with a compressed local size of 87.52 GiB. Organized in Hive partitioned format, the data is partitioned by trading date (trade_date) and stock code prefix (code_prefix), where code_prefix is the first two characters of the stock code. The dataset contains 12 core fields: ticker, time_s, tran_id, price_x10000 (actual price is obtained by dividing the value by 10000), volume, sale_order_volume, buy_order_volume, side, sale_order_id, sale_order_price_x10000, buy_order_id, and buy_order_price_x10000. Additionally, the dataset provides three metadata files: daily_manifest.parquet (daily manifest), ticker_calendar.parquet (stock calendar), and schema.json (schema definition). This dataset is suitable for fintech application scenarios such as financial market analysis, high-frequency trading research, and algorithmic trading strategy development.

创建时间:
2026-07-09
原始信息汇总

数据集概述

  • 名称:China A-share Level 2 Trades
  • 许可证:其他(需自行确认合规性)
  • 标签:金融、市场数据、Parquet格式
  • 数据集类型:中国A股二级市场逐笔成交记录,以事实表形式存储

数据覆盖范围

  • 日期范围:2026-04-01 至 2026-07-10
  • 交易日数:65天
  • 总行数:10,689,329,078
  • Parquet文件数量:467个
  • 压缩后本地存储大小:87.52 GiB

数据存储与分区布局

  • 目录结构data/l2_trades/trade_date=YYYY-MM-DD/code_prefix=XX/part-00000.parquet
    • trade_date:交易日期(Hive分区列)
    • code_prefix:股票代码前两位(Hive分区列),例如 000001 -> 00300750 -> 30600519 -> 60688981 -> 68
  • 文件排序:按 tickertime_stran_id 排序
  • 行组参数:每行组200万行,使用zstd压缩

数据列说明

列名 类型 说明
ticker string 股票代码
time_s int32 交易时间(秒级)
tran_id int64 交易唯一标识
price_x10000 int64 成交价格(乘以10000)
volume int64 成交量
sale_order_volume int64 卖单委托量
buy_order_volume int64 买单委托量
side string 成交方向
sale_order_id int64 卖单委托编号
sale_order_price_x10000 int64 卖单委托价格(乘以10000)
buy_order_id int64 买单委托编号
buy_order_price_x10000 int64 买单委托价格(乘以10000)

元数据文件

  • metadata/daily_manifest.parquet:每日清单
  • metadata/ticker_calendar.parquet:包含字段 trade_datetickercode_prefixrow_countmin_time_smax_time_s
  • metadata/schema.json:数据模式定义

使用注意事项

  • 数据来源为Level 2市场数据
  • 用户需自行确认使用方式符合数据供应商、交易所及再分发条款
搜集汇总
数据集介绍
a-share-l2-trades 数据集图片
构建方式
在金融市场的量化分析与高频交易研究中,细粒度交易数据的可获取性至关重要。该数据集以规范化的范式构建,将中国A股市场Level 2逐笔成交记录整合为单一事实表。数据按交易日期与股票代码首两位前缀(如‘00’代表深市主板)进行Hive分区存储,文件格式采用Parquet并应用zstd压缩,每个行组容纳200万行数据,以确保高效的存储与查询性能。记录按照股票代码、交易时间毫秒级标签及成交序号严格排序,涵盖每笔交易的精确价格、买卖方向以及对应的委托单信息。
使用方法
使用者可通过Parquet读取引擎直接加载分区数据,利用Hive式的日期与代码前缀分区键进行高效过滤,适用于分析个股或板块在特定时间段内的交易行为。借助元数据中的每只股票每日的行数、时间范围(最小与最大时间戳)可以快速定位感兴趣子集。该数据特别适合用于高频因子挖掘、市场冲击成本建模及交易策略回测,但需注意遵守相关数据供应商、交易所及转授权的使用条款。
背景与挑战
背景概述
中国A股市场作为全球第二大股票市场,其微观结构研究对量化投资和金融风险管理的演进具有深远意义。在此背景下,a-share-l2-trades数据集由专业金融数据团队于2026年创建,覆盖2026年4月至7月共65个交易日的Level 2逐笔成交记录,包含逾106亿行数据,总压缩规模达87.52 GiB。该数据集以规范化的事实表格式存储,按交易日期和代码前缀进行Hive分区,并收录了价格、成交量、买卖订单明细等12个核心字段,为研究市场微观结构、订单流动态及高频交易策略提供了高保真的原始数据基础。其在金融数据科学领域的影响力体现在:首次以开源方式提供如此大规模的A股L2数据,填补了学术界与工业界在中国市场高频数据标准化存储的空白,推动了因子挖掘、市场冲击测算及流动性分析的实证研究发展。
当前挑战
该数据集所解决的领域问题挑战在于:中国A股市场长期缺乏公开可获取的高频逐笔交易数据,导致研究者难以复现市场微观结构分析、订单簿动态建模及高频因子有效性检验等关键研究,进而制约了量化投资策略的本土化创新。构建过程中面临的挑战包括:原始Level 2数据来源具有严格的授权与分发限制,需在合规框架下完成数据清洗与规范化;每日超200亿笔成交记录的分布式处理要求高效的文件组织与压缩方案,此处采用Parquet列式存储与zstd压缩,以平衡读写性能与存储成本;数据质量保障方面,需处理跨交易日的时间戳对齐、订单ID一致性校验及异常价格波动值过滤,确保106亿行数据的完整性。
常用场景
经典使用场景
在中国A股市场的高频交易与微观结构研究中,Level 2逐笔成交数据是不可或缺的基石。该数据集以其精细的时间粒度与完整的订单簿快照,为研究者提供了捕捉市场动态全貌的绝佳窗口。经典使用场景聚焦于基于逐笔数据的市场流动性测度、价格冲击模型构建以及交易者行为模式解析,例如通过成交方向与订单流失衡来揭示知情交易概率。
解决学术问题
该数据集精准地回应了金融学术领域对高质量、标准化高频数据的迫切需求。长期以来,学者们受困于A股市场数据获取成本高、格式不统一等问题,难以在买卖价差、订单簿深度、订单簿非对称性等关键维度上开展大规模实证研究。该数据集解构了这些壁垒,使得学者能够更为可靠地检验市场微观结构理论、评估信息效率假说,并深入探究订单流与价格发现的动态因果关系。这不仅推动了金融计量方法的革新,更为中国资本市场的定价机制研究提供了坚实的经验证据。
实际应用
在实际应用层面,该数据集是量化投资与算法交易策略研发的燃料。量化机构可利用其构建高频因子,如基于成交量和买卖订单压力的反转或动量信号,以提升日内交易策略的收益风险比。同时,交易执行团队可基于逐笔数据优化订单执行算法,最小化市场冲击成本。此外,监管科技领域也受益于此,通过分析异常订单流模式,可以更高效地识别潜在的市场操纵行为,如虚假申报或对倒交易,从而维护市场公平。
数据集最近研究
最新研究方向
中国A股市场微观结构与高频交易行为的前沿探索。a-share-l2-trades数据集以其2026年4月至7月间65个交易日的逾百亿笔逐笔成交记录,为研究市场微观结构提供了前所未有的粒度。该数据集涵盖完整的二级行情字段,包括逐笔成交价、成交量、买卖盘口深度及委托单标识,使得高频交易策略回测、订单流不平衡分析、以及市场操纵识别等前沿方向得以深入。在量化投资领域,该数据集支撑着对算法交易冲击成本的精准建模;在市场监管层面,它助力识别异常交易模式与信息披露违规。其结构化的Parquet存储与分区设计,更推动了千万亿级金融大数据的高效计算与分布式处理,成为连接传统计量金融与人工智能驱动市场分析的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务