遇见数据集

polymarket_historical_data

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

Polymarket Historical Data 是一个包含Polymarket预测市场历史数据的开源数据集。该数据集以Zstandard压缩的Parquet格式存储,自2026年7月23日起开始公开上传。数据大约每五分钟收集一次新批次,并按产品、日期和收集运行批次进行分区存储。数据集包含三个主要数据产品:1) market_snapshots:包含市场快照数据,如最佳买卖价、完整订单簿JSON、市场结果、资产ID、源时间戳和收集时间戳。2) order_book_depth:提供标准化的订单簿深度数据,包括买卖盘各水平的价格、数量、方向(买/卖)以及水平索引。3) top_holders:包含按市场和代币排名的持有者数据,如持有者余额以及相关的公共钱包或个人资料字段。文件采用data/<产品名称>/date=YYYY-MM-DD/<运行ID>.parquet的布局结构。该数据集适用于预测市场分析、金融时间序列研究、订单簿建模和持有者行为分析等任务。需要注意的是,所有时间戳均为UTC ISO 8601格式字符串;数据覆盖范围优先考虑近期交易量较高的活跃市场,并可能随市场开闭状态而变化;由于API响应可能为空或不可用,数据可能存在缺口,并非每个市场都会出现在每次收集中;本数据集为独立收集的研究数据集,并非Polymarket官方发布。

Polymarket Historical Data is an open-source dataset containing historical data from Polymarket prediction markets. The dataset is stored in Zstandard-compressed Parquet format, with public uploads starting from July 23, 2026. Data is collected in new batches approximately every five minutes and partitioned by product, date, and collection run batch. The dataset includes three main data products: 1) market_snapshots: contains market snapshot data, such as best bid/ask prices, full order book JSON, market outcomes, asset IDs, source timestamps, and collection timestamps. 2) order_book_depth: provides standardized order book depth data, including price, quantity, direction (bid/ask), and level index for each level of the bid and ask sides. 3) top_holders: contains holder data ranked by market and token, such as holder balances and associated public wallet or profile fields. The files follow a layout structure of data/<product_name>/date=YYYY-MM-DD/<run_id>.parquet. This dataset is suitable for tasks like prediction market analysis, financial time series research, order book modeling, and holder behavior analysis. Note that all timestamps are in UTC ISO 8601 format strings; data coverage prioritizes active markets with recent high trading volume and may change as markets open or close; data may have gaps due to API responses being empty or unavailable, and not every market appears in every collection; this dataset is an independently collected research dataset and is not officially released by Polymarket.

创建时间:
2026-07-23
搜集汇总
数据集介绍
polymarket_historical_data 数据集图片
构建方式
Polymarket Historical Data数据集聚焦于预测市场领域,系统性地收集Polymarket平台上的高频市场数据。该数据集采用Zstandard压缩Parquet格式存储,每约五分钟采集一批新数据,并按产品、日期和采集批次进行分区组织。数据收集自2026年7月23日起公开上传,涵盖了市场快照、订单簿深度和顶级持有者三类核心产品,其中市场快照包含最佳买卖价、完整订单簿JSON、结果、资产ID及源端与采集端时间戳;订单簿深度则提供标准化的买卖盘口层级信息,包含价格、数量、方向与层级索引;顶级持有者数据呈现按市场和代币排序的持有者余额及相关公开信息。文件遵循data/<product>/date=YYYY-MM-DD/<run-id>.parquet的布局规范,确保数据存储的条理性和可扩展性。
特点
该数据集的核心特点在于其高频采集的时间序列结构和标准化组织方式,为预测市场研究提供了丰富且持续更新的原始数据资源。数据覆盖活跃市场,尤其优先收录近期交易量较高的市场,同时随市场开闭或不可用状态动态调整。所有时间戳均采用UTC ISO 8601格式,便于跨时区分析。数据集以Hugging Face Datasets库为接口,通过配置名称(如market_snapshots、order_book_depth、top_holders)可灵活加载不同产品类型,且Parquet文件支持DuckDB、Polars、PyArrow等工具直接查询,极大提升了使用的便捷性和兼容性。此外,数据集采用CC-BY-4.0许可协议,允许商业使用和改编,但需注明出处,这为学术研究与工业应用提供了开放的法律保障。
使用方法
使用该数据集时,用户可通过Hugging Face Datasets库的load_dataset函数便捷加载,例如调用load_dataset('trentmkelly/polymarket_historical_data', 'market_snapshots', split='train')即可获取市场快照的训练集。对于需要更高效或定制化访问的场景,用户可直接利用DuckDB、Polars或PyArrow等工具对Parquet文件进行查询,无需依赖特定库。值得注意的是,数据集中可能存在由于API响应为空或不可用导致的采集间隙,因此用户应避免假设每个市场在每个采集批次中都出现。数据集为独立收集的研究资源,非Polymarket官方发布,使用者需自行确保遵守相关条款与法规。引用时建议采用提供的BibTeX格式,以尊重数据维护者的贡献。
背景与挑战
背景概述
预测市场作为去中心化金融(DeFi)领域的重要应用,通过聚合参与者信息以揭示事件概率,近年来受到学术界与业界的广泛关注。Polymarket Historical Data数据集由Trent Kelly于2026年创建,依托Hugging Face平台发布,旨在提供Polymarket平台的高频历史市场数据。该数据集包含市场快照、订单簿深度及顶级持有者信息,每约五分钟采集一次,并存储为Zstandard压缩的Parquet格式,支持高效查询与分析。其核心研究问题聚焦于预测市场的微观结构、价格发现机制及参与者行为,为金融时间序列、预测市场效率及去中心化交易等领域的研究提供了宝贵资源,对理解信息聚合与市场动态具有重要推动作用。
当前挑战
该数据集所解决的领域问题核心在于预测市场中高频数据的稀缺性与不完整性,传统金融数据集难以捕捉去中心化市场的独特动态。构建过程中面临多重挑战:一是数据采集的连续性,需定期从Polymarket API获取信息,而API响应可能为空或不可用,导致数据间隙;二是市场覆盖的波动性,数据集优先关注高交易量活跃市场,但市场状态随事件演变而动态变化,难以保证全覆盖;三是数据标准化与版本管理,需将异构的API响应统一处理为规范化结构,并随时间推移维护兼容性;四是法律与合规风险,作为独立收集的研究数据,需确保不违反平台使用条款,并明确版权归属与商业使用许可。
常用场景
经典使用场景
Polymarket Historical Data 数据集在预测市场与去中心化金融(DeFi)交叉领域扮演着基石角色。其经典用途在于为研究者提供高频、结构化的链上市场数据——涵盖订单簿深度、市场快照及顶级持有者持仓分布——从而支撑对预测市场微观结构的深度解析。通过该数据集,学者能够复现实时做市商行为、订单簿流动性动态以及信息传播效率等关键机制,为理解信息聚合过程提供了前所未有的数据窗口。
实际应用
在实际应用中,该数据集的价值超越了单纯的理论研究,为多个前沿领域注入了活力。量化交易团队可借其训练基于订单簿序列的预测模型,优化自动化做市策略;风险管理者利用持仓分布数据识别系统性风险积累;监管科技(RegTech)机构则通过市场快照与历史成交数据构建预测市场操纵行为的监测系统,为去中心化金融生态的健康发展提供数据驱动的监管抓手。
衍生相关工作
基于该数据集,一系列衍生性工作如雨后春笋般涌现。研究者开发出基于深度学习的订单簿变换器(Order Book Transformer)模型,精准预测短期价格波动;另有人构建了预测市场信息效率指数,量化不同品种的定价偏差;还有工作利用图神经网络对顶级持有者的社交网络与持仓行为进行共现分析,揭示了潜在的信息传播拓扑结构。这些工作共同构筑了预测市场数据科学的全新范式,显著拓展了区块链数据分析的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务