Chainticks/perp-data
收藏官方服务:
资源简介:
免费、每日更新的永续合约市场数据,旨在用于量化研究、回测和市场微观结构分析。该数据集初始提供来自链上来源的永续合约去中心化交易所(DEX)数据,从Hyperliquid开始,包括资金费率、交易、市场信息、未平仓合约和清算等子集,以分区Parquet格式存储。数据仅包含公开链/存档状态来源的记录,不包括场所REST API转售数据。
Free, daily-updated perpetuals market data intended for quant research, backtesting, and market microstructure analysis. This repository is initialized for chain-derived perp DEX data, starting with Hyperliquid, and includes subsets such as funding, trades, markets, open interest, and liquidations, stored as partitioned Parquet. The public dataset only contains records whose provenance is public chain/archive state, not venue REST API resale.
提供机构:
Chainticks搜集汇总
数据集介绍

构建方式
去中心化永续合约市场作为链上衍生品交易的核心基础设施,其海量订单簿与清算数据对量化研究至关重要。Chainticks Perp Data 通过解析 Hyperliquid 区块链节点状态与链上事件日志,提取出公开可验证的永续合约市场数据,涵盖资金费率、成交记录、市场快照、未平仓合约及清算事件。所有原始记录均标注数据来源标签(如`on_chain_event`),确保仅包含源于公共链上状态的记录,避免引入中心化交易所 API 转售数据。数据以 Parquet 格式按日期分区存储于 Hugging Face,提供分区文件和清单元数据,支持按需高效加载。
特点
该数据集的核心优势在于其纯粹的链上溯源特性与极致结构化设计。每条记录均保留来源证明字段,确保合规用于学术研究与回溯测试。数据按五类主题(资金费率、成交、市场状态、未平仓、清算)独立分区,采用高效列式存储,单日分区可能包含多个分片文件以应对高吞吐场景。配套的 schema 文件与 manifest 清单明确字段定义及分片分布,并维护最新可用日期指针,便于实时更新与增量处理。
使用方法
使用者可通过 Hugging Face Hub 直接访问 Parquet 文件,支持 Pandas、DuckDB、Polars 等多种工具链。典型流程为:通过`LATEST_DATE.txt`获取最新分区日期,利用`_manifest.json`枚举当日所有分片,拼接为完整 url 列表后批量读取。例如以 DuckDB 聚合清算次数,或以 Polars 加载未平仓合约表。需注意仅信任`source_kind`在指定白名单中的记录,并通过 schema 校验字段兼容性。
背景与挑战
背景概述
在去中心化金融(DeFi)领域,永续合约作为重要的衍生品工具,其市场数据的可获取性与透明度长期受到限制。Chainticks团队于近期推出了perp-data数据集,旨在为量化研究、回测及市场微观结构分析提供免费且每日更新的永续合约市场数据。该数据集起源于Hyperliquid链上状态,覆盖资金费率、成交记录、市场概况、未平仓合约及清算数据,并以分区Parquet格式进行存储,便于高效查询与分析。作为首个从链上推导永续DEX数据并公开分发的资源,perp-data为金融数据科学社区注入了新的活力,推动了对链上衍生品市场行为的深度理解与建模。
当前挑战
尽管perp-data弥合了永续合约市场数据的鸿沟,但其构建过程与领域应用仍面临多重挑战。从领域问题来看,现有的中心化交易所数据往往存在信息不透明或延迟问题,而链上衍生品数据的标准化程度低,缺乏统一的高频数据源,制约了量化模型的鲁棒性与可复现性。在数据构建过程中,确保数据来源的纯正性是一大难题——数据集严格限定仅收录源于公开链上状态或存档的记录,需排除任何通过交易所REST API转售的数据,这要求对数据来源进行精确标记与验证。此外,每日更新的庞大数据量,尤其是在交易高峰期的多分区存储与管理,对索引效率与存储架构提出了较高要求。
常用场景
经典使用场景
在加密金融与去中心化衍生品交易的研究领域,perp-data数据集为量化研究者与市场微观结构分析者提供了高保真、每日更新的链上永续合约市场数据。该数据集涵盖资金费率、成交记录、市场状态、未平仓合约及清算事件等核心指标,经Hugging Face以分区Parquet格式发布,便于通过Pandas、DuckDB或Polars等工具进行高效加载与时间序列分析。其经典使用场景包括构建交易策略回测引擎、分析资金费率与未平仓合约之间的动态关系,以及刻画市场极端波动下的清算传导机制。
解决学术问题
perp-data数据集为解决去中心化金融市场中的信息不对称与数据稀缺问题提供了关键基础设施。学术研究中,它助力探索链上永续合约市场的定价效率、流动性提供者行为模式以及清算事件对市场稳定性的冲击。通过对高颗粒度链上数据的分析,研究者得以验证传统金融理论在DeFi环境中的适用性,揭示资金费率定价中的套利机会,并为市场操纵检测与风险建模提供了可靠的实证基础,推动了加密金融实证研究的严谨性与可复现性。
衍生相关工作
围绕perp-data数据集,衍生出了一系列具有前瞻性的研究工作与工具生态。开发社区基于其标准化Parquet分区架构,构建了跨数据集的联合查询系统,实现了与中心化交易所历史数据的整合分析。学术界涌现出利用该数据集验证永续合约定价模型中保证金机制有效性的论文,以及对Hyperliquid链上清算网络拓扑结构的实证研究。同时,数据提供方Chainticks维护的_manifest.json与_schema.json元数据体系,为构建可复现的量化研究流水线树立了标杆,催生了多个基于Hugging Face Datasets库的自动化数据管道项目。
以上内容由遇见数据集搜集并总结生成



