遇见数据集

synthetic-timeseries-data

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集提供三天完整的真实加密市场微观结构数据(来自Binance现货交易),专为公共评估用途设计。数据经过脱敏处理,隐藏了绝对价格、日期和交易标的,但完整保留了逐笔交易的相对价格(以每日第一笔交易价格为1000.0为基准)、归一化成交量(以日均成交量单位)、交易方向(买方主动/卖方主动)以及5分钟聚合的订单簿不平衡指标(均值、最大值、最小值)和买卖价差(基点)。数据包含两个文件:trades/day_0N.parquet(每日约40万笔交易记录,字段包括毫秒级时间偏移、相对价格、成交量、交易方向)和flow/day_0N.parquet(每日约280个5分钟订单簿聚合记录,字段包括平均不平衡、不平衡极值、平均点差)。数据来源于实时交易所,经过序列间隔审计和每日完整性验证,适用于市场微观结构分析、时间序列建模、金融预测等任务。

This dataset provides three full days of real encrypted market microstructure data (from Binance spot trading), designed for public evaluation purposes. The data has been desensitized, hiding absolute prices, dates, and trading targets, but fully retains the relative price of each transaction (based on the first transaction price of the day as 1000.0), normalized volume (in units of daily average volume), trade direction (buyer-initiated/seller-initiated), and 5-minute aggregated order book imbalance indicators (mean, max, min) and bid-ask spread (in basis points). The data consists of two files: trades/day_0N.parquet (approximately 400,000 transaction records per day, with fields including millisecond-level time offset, relative price, volume, trade direction) and flow/day_0N.parquet (approximately 280 5-minute order book aggregation records per day, with fields including average imbalance, extreme imbalance, average spread). The data originates from real-time exchanges, has undergone sequence interval auditing and daily integrity verification, and is suitable for market microstructure analysis, time series modeling, financial prediction, and other tasks.

创建时间:
2026-07-31
原始信息汇总

数据集概述

数据集名称:cruscy data — market microstructure evaluation sample

许可证:其他(evaluation-sample),许可链接见 https://data.cruscy.com

数据集简介:该数据集包含三个完整交易日的真实加密货币市场微观结构数据(来自 Binance 现货市场),用于公开评估。数据集中隐藏了绝对价格、日期和交易品种,但完整保留了每日的逐笔相对价格、标准化成交量、交易方向和订单簿失衡等日度形态特征。

数据来源:实时交易所数据流,经过序列缺口审计和每日完整性清单校验。


数据文件

文件路径 每日数据量 内容说明
trades/day_0N.parquet 约 400,000 行 当日每一笔交易记录
flow/day_0N.parquet 约 280 行 5 分钟间隔的订单簿聚合数据

数据结构

trades/ 表

列名 类型 含义
sensor_c int64 当日起始以来的毫秒数
sensor_a float 相对价格(当日首笔交易价为 1000.0)
sensor_b float 交易规模(以当日平均交易规模为单位)
sensor_d int8 交易方向(1 = 主动买入,0 = 主动卖出)

flow/ 表

列名 类型 含义
sensor_c int64 当日起始以来的毫秒数
sensor_i float 5 分钟内平均订单簿失衡(范围 −1 到 1)
sensor_i_hi / sensor_i_lo float 窗口内订单簿失衡最大值 / 最小值
sensor_s float 平均买卖价差(基点为单位)

使用示例

以下代码展示了如何加载交易数据并生成分钟级 K 线:

python import pandas as pd df = pd.read_parquet("hf://datasets/GOD111111111/synthetic-timeseries-data/trades/day_01.parquet") candles = df.groupby(df.sensor_c // 60_000).sensor_a.agg(["first", "max", "min", "last"])


相关资源

  • 完整数据平台(含 27+ 数据流、SQL 控制台、回测运行器及面向 AI 代理的 MCP 访问):https://data.cruscy.com
  • 在线数据探索演示 Space:https://huggingface.co/spaces/GOD111111111/data-explorer
搜集汇总
数据集介绍
synthetic-timeseries-data 数据集图片
构建方式
该数据集源自币安现货交易所的真实加密货币市场微观结构数据,经过脱敏处理后保留了三个完整交易日的逐笔行情形态。构建过程中,原始数据以毫秒级时间戳记录每一笔成交,并将绝对价格转换为以当日首笔成交为1000.0基准的相对价格,成交量则归一化为当日平均成交规模。订单簿数据以五分钟为窗口聚合,计算买卖失衡度、失衡极值及平均买卖价差。数据采集环节配备序列缺口审计与每日完整性清单,确保时间序列的连续性与可信度,最终以Parquet列式格式存储,便于高效读取与批量分析。
特点
该数据集的核心特征在于以脱敏方式完整保留了市场微结构的动态形貌。逐笔成交文件每日约四十万行,蕴含毫秒级相对价格、归一化成交量与主动买卖方向三类信号,能够精细刻画价格形成过程中的买卖压力与流动性消耗。订单簿聚合文件每日约二百八十行,提供五分钟窗口内的平均失衡度、失衡上下界及以基点计量的平均价差,反映限价簿的深度与交易成本。数据覆盖连续三日,剔除绝对价格、日期与交易标的等敏感信息后,仍维持了日内与跨日的时序模式,适合用于模型评估与算法验证。
使用方法
数据以HuggingFace数据集仓库形式发布,用户可通过pandas读取Parquet文件直接加载,例如使用hf://路径加载逐笔成交数据后,按毫秒时间戳整除分钟数进行分组,即可聚合出开高低收的分钟K线。订单簿聚合文件可单独读取,用于流动性指标与价差分析。该数据集定位为公开评估样本,适用于时间序列建模、市场微结构研究、交易信号回测等场景。若需访问完整二十七路以上数据流,包括原始L2深度、秒级成交流及衍生特征与状态标签,可通过平台提供的SQL控制台、回测运行器及面向AI代理的MCP接口获取。
背景与挑战
背景概述
高频金融微观结构数据的稀缺性与敏感性长期制约着市场微观测算、订单流建模及执行算法研究的可复现性。cruscy data 团队于近年构建的 synthetic-timeseries-data 评估样本,取自币安现货市场的真实加密资产微结构记录,涵盖连续三个交易日的逐笔成交与五档订单簿聚合指标。该数据集在隐去绝对价格、日期及标的身份的前提下,完整保留了日内相对价格轨迹、归一化成交量、主动买卖方向及订单簿失衡等核心形态特征,为学界与业界提供了兼具真实性与脱敏性的基准素材。其发布推动了订单流预测、市场冲击评估及强化学习交易策略等领域在真实微观数据上的可验证研究,并对高频数据共享中的隐私保护范式产生了示范效应。
当前挑战
该数据集所应对的领域问题在于真实市场微结构数据的高维、非平稳与强噪声特性,使得订单流方向预测、短期价格形成机制识别及流动性动态建模面临严峻的信噪比挑战。构建过程中,研究团队须在保留逐笔序列完整形态与去除可识别信息之间取得平衡,涉及相对价格基准的归一化设计、成交量量纲的无损变换以及订单簿失衡指标的窗口聚合校准。脱敏处理可能导致跨日可比性与绝对尺度信息的丢失,而真实交易所馈送的序列缺口、时间戳抖动及事件异步性亦对数据完整性审计提出严格要求,如何在有限样本量下维持统计效力并避免过拟合,构成了该评估基准的核心方法学难题。
常用场景
经典使用场景
在金融市场微观结构研究与量化交易领域,高频逐笔数据构成了理解价格形成机制与流动性动态的基石。该数据集以三个完整交易日的加密资产现货市场真实撮合记录为蓝本,完整保留了逐笔相对价格、标准化成交量、主动买卖方向以及五档订单簿失衡度等核心字段,为研究者复现市场微观结构经典范式提供了高度拟真的实验场。其最典型的使用方式在于借助逐笔成交序列重构分钟级K线,或依托订单簿失衡指标构建短期价格漂移预测模型,从而在受控条件下检验做市策略、订单流毒性度量与价格发现效率等假设。
衍生相关工作
围绕该数据集所代表的加密市场微观结构数据生态,已衍生出一系列方法学与工程实践层面的经典工作。在特征工程方向,基于订单簿失衡与成交方向构造的订单流不平衡因子被广泛纳入短周期收益预测模型;在系统架构方向,支持SQL查询与回测运行的一体化平台设计启发了面向AI代理的数据接口标准化尝试;在数据治理方向,序列缺口审计与每日完整性清单的实践为高频数据的质量保障提供了可借鉴的流程范式。这些衍生工作共同拓展了受限数据条件下微观结构研究的可行边界。
数据集最近研究
最新研究方向
在市场微观结构领域,基于高频订单流与限价订单簿动态建模的研究正加速向可复现、隐私合规的方向演进。该数据集以匿名化方式保留加密货币现货逐笔交易相对价格、规模、买卖方向及订单簿失衡等核心微结构特征,为限价订单簿动态、订单流毒性、最优执行与做市策略等前沿课题提供了真实且可审计的评估基准。其三天连续高频切片契合当前对短周期市场冲击与流动性共变的研究热点,尤其支持基于深度学习的端到端微结构预测与强化学习交易代理的稳健性检验。在数据要素流通与AI代理接入交易系统并行的背景下,该评估样本通过序列缺口审计与完整性清单,强化了金融时间序列研究的可重复性与伦理合规,对推动跨市场微结构对比及监管科技应用具有实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务