遇见数据集

bitcoin-mining-pool-templates

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集记录了比特币矿池构建区块时的模板信息,具体包括每个矿池在特定时刻向矿工发放的工作模板。数据由DataForge (dataforge-labs)收集,通过连接约120个对等节点,从2026年8月28日至9月3日共7天的固定窗口内采样。数据集包含约10万至100万条记录,以Parquet格式分区分块存储。主要数据表为`e20_stratum_jobs_direct`,每行代表一个矿池的一个作业,字段包括:所扩展的区块哈希、nTime(矿池本地时钟时间)、coinbase字段、Merkle分支计数及第一个条目、以及clean_jobs标志(指示是否切换区块)。数据适用于时间序列预测任务,可用于分析矿池行为、区块传播延迟、网络拓扑等。注意:该数据集仅从一个视角采样,不代表全网络;nTime为矿池自身时钟,不同步;共涉及11个端点(10个运营商),可能不反映各运营商的全部工作。数据采用ODC-BY许可,使用时需注明来源。

This dataset records the template information of Bitcoin mining pools when constructing blocks, specifically including the work templates issued by each pool to miners at specific moments. The data was collected by DataForge (dataforge-labs) by connecting approximately 120 peer nodes, sampled over a fixed 7-day window from August 28 to September 3, 2026. The dataset contains about 100,000 to 1 million records, stored in Parquet format partitioned into blocks. The main data table is `e20_stratum_jobs_direct`, where each row represents a job from a mining pool. Fields include: extended block hash, nTime (pools local clock time), coinbase field, Merkle branch count and first entry, and clean_jobs flag (indicating whether to switch blocks). The data is suitable for time series prediction tasks and can be used to analyze pool behavior, block propagation delay, network topology, etc. Note: This dataset is sampled from a single perspective and does not represent the entire network; nTime is the pools own clock and is not synchronized; it involves 11 endpoints (10 operators) and may not reflect all work of each operator. The data is licensed under ODC-BY, and attribution is required when using.

创建时间:
2026-08-28
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Bitcoin mining pool templates
  • 发布机构: DataForge (dataforge-labs)
  • 许可证: ODC-BY(允许自由使用,需注明出处:"DataForge (dataforge-labs)")
  • 数据集规模: 100K < n < 1M 条记录
  • 任务类型: 时间序列预测
  • 数据格式: Parquet 文件,按采集窗口分文件存储,路径结构为 dataset/YYYY/MM/
  • 数据覆盖时间: 2026-08-28 至 2026-09-03(固定7天样本窗口,不滚动更新)

核心内容

  • 数据集主题: 比特币矿池在每一秒正在构建的内容——即矿池向矿工分发的工作任务模板
  • 主要表: e20_stratum_jobs_direct,每一行代表一个矿池的一个工作任务,包含:
    • 矿池所扩展的区块
    • nTime(矿池自身时钟)
    • coinbase(矿池认领的奖励脚本)
    • Merkle 分支数量
    • clean-jobs 标志
  • 辅助表: e0_run_manifest,列出每个采集窗口的轮询次数和失败次数,完整发布、无窗口限制

数据关键洞察

  • 在同一区块上,不同矿池构建的内容存在结构性分歧,而非表面差异。例如:nTime 在单个区块上跨 30 秒分布,coinbase 长度从 318 到 1,488 字符不等,Merkle 分支数在 10 到 13 之间分裂
  • 同一运营商运行的两个端点在时间上可能相差 10 秒

重要字段说明

  • pool: 所连接的端点,而非从数据推断的身份
  • operator: 属于同一运营商的端点集合,建议按此字段进行数据分组
  • observed_ts: 跨矿池一致的时间戳,用于到达顺序排序
  • clean_jobs = true: 表示矿池切换区块,按 observed_ts 排序可得到矿池反应顺序

使用注意事项

  • 数据来自单一观察点,约连接 120 个对等节点(网络总数可达数万个),是网络样本而非全网数据
  • 共覆盖 11 个端点、10 个运营商;运行区域端点的矿池在其他区域可能提供不同的工作,因此这是运营商构建内容的样本而非完整普查
  • Merkle 分支仅存储计数和首个条目,完整列表较大且大部分冗余
  • 采集窗口之间的间隔是真实的、无法事后填补,数据无插值处理

访问方式

通过 Hugging Face Hub 下载: python from huggingface_hub import snapshot_download import pandas as pd, glob

path = snapshot_download("dataforge-labs/bitcoin-mining-pool-templates", repo_type="dataset", allow_patterns="e20_stratum_jobs_direct/") df = pd.concat(map(pd.read_parquet, glob.glob(f"{path}/e20_stratum_jobs_direct//*.parquet", recursive=True)))

联系与获取完整历史

  • 问题及完整历史数据请求可通过讨论区(Discussions tab)提出
  • 完整历史数据私有保存,可按需提供
搜集汇总
数据集介绍
bitcoin-mining-pool-templates 数据集图片
构建方式
该数据集由DataForge实验室构建,旨在捕捉比特币矿池在每一秒所构建的区块模板。数据通过连接矿池的Stratum端点,实时记录矿池发出的每项工作指令,包括其扩展的区块、nTime、coinbase、merkle分支计数及clean-jobs标志。每个数据行代表一个矿池的一个作业,涵盖了从2026-08-28至2026-09-03的固定7天样本窗口,以parquet格式按收集周期分区存储。观测过程中,单个区块上不同矿池的nTime跨度达30秒,coinbase长度从318到1488字符不等,merkle分支计数介于10到13之间,揭示了矿池间在区块组装上的结构性差异。
特点
数据集的核心特点在于其高精度的时序记录,每几秒更新一次矿池的工作模板,但区块一旦被发现,之前的模板便永久消失,因而这些数据具有不可再生性。数据源来自单一观察点,约120个对等节点,是网络的一个样本而非全貌。数据集区分了矿池端点与运营商,便于按运营商进行聚合分析。同时,clean_jobs标志可标记矿池切换区块的时刻,按观测时间排序即可得到矿池的反应顺序。数据未经过插值处理,窗口间的缝隙是真实存在的收集间隔,保证了数据的原始性和真实性。
使用方法
数据的使用需通过HuggingFace平台下载,可利用提供的Python代码加载所有parquet文件。分析时应以'operator'字段为分组依据,因为同一运营商可能运行多个端点,其行为模式更为一致。注意nTime反映矿池自身的时钟,而跨矿池排序应使用observed_ts字段。由于数据仅为样本,对于需要全量历史数据的研究,可通过讨论区向DataForge申请。此外,数据集附带的e0_run_manifest清单可用来了解每个收集周期的轮询次数和失败率,有助于评估数据质量。整体而言,该数据集适用于矿池行为分析、区块传播延迟研究以及比特币网络结构的动态监测。
背景与挑战
背景概述
比特币网络作为去中心化账本的典范,其安全性依赖于工作量证明(PoW)共识机制,而矿池作为算力聚合的关键实体,其行为模式深刻影响着网络的稳定性与去中心化程度。DataForge(dataforge-labs)于2026年创建了bitcoin-mining-pool-templates数据集,旨在捕捉矿池在秒级时间尺度上构建区块模板的实时动态,揭示不同矿池在同一区块上工作的结构性差异。该数据集通过连接比特P2P网络中的约120个对等节点,记录了十大矿池运营商的11个端点所发布的Stratum任务,包括模板所延伸的区块、nTime、coinbase内容、Merkle分支计数及clean-jobs标志等关键信息。其核心研究问题在于量化矿池间的行为异质性,并追踪区块发现前后模板的演化过程,为理解矿池策略、区块传播延迟及网络分区提供了前所未有的微观视角。该数据集填补了矿池内部工作细节公开数据的空白,对区块链监控、共识安全分析及矿池行为建模等领域具有重要的基准价值。
当前挑战
数据集构建面临的首要挑战源于比特币网络的动态与异构性:单一观测视角仅能触及约120个对等节点,相对于可访问的数万个节点而言,样本代表性有限,导致观测结果可能无法完全反映全网矿池的真实行为。其次,矿池之间在nTime更新节奏、Merkle分支计数(10至13不等)及coinbase长度(318至1488字符)上均存在显著差异,这种结构性分歧要求数据采集必须具备高频率与高精度,而网络延迟与节点故障则可能导致数据间隙,且这些间隙无法事后填补。此外,同一运营商的多个端点之间亦存在时间偏差(如相差10秒),这增加了数据对齐的复杂性。数据集还采用了固定7天的采样窗口,以避免冗余下载,但这也意味着长期趋势的捕捉需要依赖完整历史数据的私有请求。在构建过程中,还需保证Merkle分支以紧凑形式存储(仅存计数与首项),在信息完整性与存储开销之间取得平衡。这些挑战共同考验着数据集的完整性、一致性与可用性,也为后续研究在数据采集策略与偏差校正上提出了更高要求。
常用场景
经典使用场景
作为比特币挖矿生态的微观观测窗口,本数据集以秒级粒度捕获了十余个矿池在区块候选模板上的实时构建行为。其核心应用场景在于解析矿池间的结构性差异——从nTime的离散分布、coinbase长度的变异,到默克尔分支数的分歧,研究者得以量化不同运营者对区块延展策略的偏好。通过整理clean_jobs标志与observed_ts时序,该数据为追踪矿池在区块切换时的反应顺序提供了实证素材,是研究比特币网络区块传播动力学与矿池行为模式的基线资源。
解决学术问题
该数据集填补了矿池内部工作分配透明度缺失的空白,解决了长期困扰学术界的矿池异质性难以直接观测的问题。传统研究多通过出块记录推断矿池策略,而本数据直接呈现了每个矿池在每一秒正在构建的区块内容,使学者得以从微观层面验证关于挖矿策略、区块组装效率及网络同步延迟的理论假设。其明确的单观测点采样边界也促使方法论上更审慎地对待网络快照的代表性,推动了关于分布式系统采样偏差的讨论。
衍生相关工作
围绕此数据已萌生多个方向的衍生研究:其一,基于模板更新序列构建矿池行为指纹,用于运营商去匿名化与网络拓扑推断;其二,利用clean_jobs切换时间戳拟合矿池对新区块的响应延迟模型,进而评估分叉或网络分区下的挖矿协调效率;其三,结合coinbase长度与默克尔分支计数,有工作尝试重构矿池的内存池状态估计方法。此外,该数据集作为公开的stratum作业样本集,已成为训练区块传播预测模型与验证支付通道激励机制的测试平台,在开源社区中催化了多个基于真实矿池数据的模拟器项目。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务