遇见数据集

xylemgroup/hyperliquid-chain-captures

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Hyperliquid Chain Captures是一个按日期分区的HyperLiquid链状态捕获数据集,专为研究用途设计。每个日期分区包含原始节点输出(例如副本命令日志、每小时事件转储、L2订单簿快照)以及从这些原始捕获中衍生的已处理Parquet文件。数据集支持向前兼容性,每个日期都有独立的顶级目录。原始数据以lz4压缩格式存储,而处理后的数据则使用zstd压缩的Parquet格式,并附带_manifest.json文件记录行数、模式指纹和源文件信息。数据集覆盖特定日期(如2026-03-01)的块范围,并基于HyperLiquid链副本状态通过官方副本命令日志捕获。数据以CC0 1.0许可证发布,属于公共领域,无需署名。

Hyperliquid Chain Captures is a date-partitioned dataset of HyperLiquid chain state captures for research use. Each date partition includes both raw node outputs (such as replica command logs, hourly event dumps, L2 book snapshots) and processed Parquet files derived from those raw captures. The dataset is forward-compatible, with each date residing under its own top-level directory. Raw data is stored in lz4-compressed format where applicable, while processed data is in zstd-compressed Parquet files accompanied by _manifest.json files documenting row counts, schema fingerprints, and source file lineage. It covers specific dates (e.g., 2026-03-01) with block ranges, sourced from HyperLiquid chain replica state captured via official replica command logs. Released under the CC0 1.0 license, it is a public domain dedication with no attribution required.

提供机构:
xylemgroup
搜集汇总
数据集介绍
xylemgroup/hyperliquid-chain-captures 数据集图片
构建方式
Hyperliquid Chain Captures 数据集是为区块链研究领域精心打造的链状态快照集合。其构建方式遵循日期分区的组织逻辑,每个日期目录下均包含原始节点输出与经处理的 Parquet 文件两大模块。原始数据层由副本命令日志、按小时聚合的事件转储以及 L2 订单簿快照组成,均采用 lz4 压缩以优化存储效率。处理层则通过确定性推导流程,将原始数据转换为 zstd 压缩的 Parquet 格式,并附有 _manifest.json 文件记录行数、模式指纹及源文件追溯信息。
特点
该数据集具备显著的结构化与可扩展特性。所有数据按日期独立存放,便于按时间维度进行增量加载与查询。原始文件与处理文件清晰分离,既保留了链上数据的原生完整性,又提供了高性能分析格式。尤为重要的是,处理后的 Parquet 文件通过清单文件实现了完备的元数据管理,确保数据血缘清晰可溯。此外,数据集采用 CC0 1.0 公共领域许可证,彻底免除使用限制,极大降低了研究门槛。
使用方法
数据集的使用方法极为灵活且高效。研究人员可直接借助 Pandas 库,通过一行代码读取远程 Parquet 文件,例如使用 pd.read_parquet() 加载指定日期的副本命令数据。亦可利用 Hugging Face 的 datasets 库进行数据集加载,支持按文件路径筛选特定数据分区。每个日期目录下还提供了汇总的 _manifest.json 文件,便于程序化获取数据规模与结构信息。这种多路径访问设计,兼顾了快速原型开发与大规模分布式处理的需求。
背景与挑战
背景概述
该数据集由Xylem Group团队于2026年创建,专为研究HyperLiquid区块链的链上状态而设计。HyperLiquid作为高性能去中心化衍生品交易平台,其链上数据对理解DeFi生态中的订单簿动态、资产流动性及交易行为具有关键价值。数据集基于日期分区存储,包含从节点副本命令日志、逐小时事件转储到L2深度快照的原始输出,并衍生为高效的Parquet格式,便于大规模分析。其公开领域(CC0)授权促进了学术与产业界的广泛利用,为区块链分析、市场微观结构研究及模型训练提供了标准化数据基础。
当前挑战
当前面临的主要挑战包括:1) 领域问题层面,HyperLiquid链上数据揭示的去中心化交易所订单簿动态难以通过传统中心化市场模型直接解析,需开发适应区块链环境的新型分析框架;2) 构建过程中,原始节点输出体积庞大(单日约29.1 GB),且跨日期一致性维护困难,例如replica_cmds文件包含非连续块范围(如909,310,000–909,330,000),如何确保数据捕获的完整性与时间窗口对齐成为技术难点;3) 数据版本迭代较快,需持续更新清洗与合并流程以减少潜在噪声对下游研究结果的影响。
常用场景
经典使用场景
Hyperliquid链状态捕获数据集为去中心化衍生品交易市场的链上微观结构研究提供了前所未有的数据基础。研究者可基于该数据集中的原始节点输出和经过处理的Parquet文件,深入剖析Layer 2订单簿快照、区块间事件流及资产上下文信息。其经典使用场景聚焦于高频交易行为分析与做市商策略建模,通过逐笔订单簿重建与区块级交易指令回放,能够精准刻画Hyperliquid链上流动性的时空演化规律。
实际应用
在实际应用层面,该数据集为量化交易策略开发与风险管理工具构建提供了关键支撑。资产管理机构可利用历史链上数据训练订单流预测模型,优化衍生品市场的流动性供给算法。同时,区块链安全审计团队可借助区块级指令复现功能,检测异常交易模式与潜在的价格操纵行为,显著提升DeFi生态的透明度与抗风险能力。
衍生相关工作
该数据集催生了多个具有里程碑意义的衍生研究方向:基于L2订单簿快照的做市商收益归因分析框架得以建立,揭示了去中心化交易所中逆向选择成本的动态演变规律;跨链桥接延迟对套利效率影响的实证研究借助该数据的精确时间戳实现了因果推断;此外,基于指令日志的链上机器人博弈策略分类体系也应运而生,为理解MEV提取行为在Layer 2环境中的演化提供了标准化基准数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务