遇见数据集

bitcoin-mempool-lifecycle

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集记录了加密货币交易从广播到被挖矿(或最终被丢弃)的完整生命周期,包括交易首次被观测到的时间、在mempool中的等待时间、支付的费用以及最终状态。主要聚焦于比特币,同时也包含莱特币和以太坊的类似数据。数据收集基于自建节点,通过轮询多个公共RPC服务来捕获字段,如第一观测时间、费用率、挖矿区块高度、等待区块数等。数据集包含多个子表格,适用于时间序列预测、交易费用分析、mempool行为研究等任务。

The dataset records the complete lifecycle of cryptocurrency transactions from broadcast to mining (or eventual drop), including the first observed time, mempool dwell time, fees paid, and final status. It primarily focuses on Bitcoin, with similar data for Litecoin and Ethereum. Data collection is based on self-built nodes polling multiple public RPC services to capture fields such as first seen timestamp, fee rate, mining block height, and number of blocks waited. The dataset includes multiple sub-tables and is suitable for time series forecasting, fee analysis, and mempool behavior research.

创建时间:
2026-08-27
原始信息汇总

Bitcoin Mempool 生命周期数据集

数据集概览

该数据集记录了比特币交易从广播到被挖出的完整生命周期,包括首次观察到的时间、等待时长、支付的手续费以及最终是否被挖出。同时覆盖莱特币和以太坊的同类数据,用于跨链对比分析。

数据内容

数据表名称 内容描述
e8_btc_mempool_lifecycle 比特币交易生命周期数据(首次观察时间、费率、挖出高度、等待区块数、最终状态)
e9_btc_mempool_divergence 不同提供方内存池规模与重叠度对比
e11_ltc_mempool_lifecycle 莱特币交易生命周期数据(同 e8 结构)
e15_fee_estimators 五个提供方在不同确认目标下的手续费估算
e1_mempool_minutely 以太坊内存池每分钟活动汇总(到达、状态变化、驻留时间分位数)
e1_mempool_dropped 未被挖出的以太坊交易完整记录
e3_mempool_divergence 以太坊节点与其他三个节点的待处理交易视图对比
e0_run_manifest 收集窗口清单(轮询次数、失败次数、覆盖计数)

数据规模

  • 总记录数:100万至1000万条
  • 格式:Parquet 文件,按收集窗口分文件存储于 dataset/YYYY/MM/ 目录
  • 当前仓库包含固定7天样本(2026-08-25 至 2026-08-31),完整历史数据需通过讨论区申请获取

关键使用注意事项

数据覆盖与质量

  • 时间戳说明first_seen_ts 为数据收集方自身轮询观察到的时间,并非网络首次广播时间
  • 预存交易处理:标记为 pre_existing = true 的交易在窗口开启前已在池中,其真实到达时间不可知,对应 first_seen_ts 为空值
  • 比特币丢弃记录fate = "dropped" 的记录自 2026-08-26 起有效,此前因技术缺陷无法记录丢弃事件
  • 费用率覆盖度fee_rate_sat_vb 字段为部分覆盖,覆盖度随时间变化(从最初的无覆盖到后期约75%),且受网络拥堵程度影响——网络越繁忙覆盖度越低
  • 丢弃交易的费用率缺失:几乎所有被丢弃交易(~1%)的 fee_rate_sat_vb 字段为空,这是结构性限制而非数据缺陷

数据局限说明

  • 内存池状态因节点而异,数据收集方节点可持有长达115天的交易记录,与比特币 Core 默认的336小时清除策略不同
  • 比特币交易驻留时间普遍较长,快速确认交易约10分钟,但池中常驻积压交易的中位年龄超过100天
  • 五个手续费估算提供方之间存在显著差异,同一目标下最大差值可达6.7倍
  • 零费率(fee_rate_sat_vb = 0)为真实存在的罕见情况(约1/6000),多数此类交易最终成功确认

数据分析建议

  • 使用前建议按分区计算费用率覆盖度,而非假设该字段恒定覆盖
  • 进行手续费相关分析时,应注意样本集可能不代表全网情况
  • 两套时间戳(自有轮询与节点首次观察)存在系统性差异(中位约7000秒),应视为不同测量而非同一数据的修正版本

许可证与联系

  • 许可证:ODC-BY(开放数据共享署名许可)
  • 使用要求:需署名"DataForge (dataforge-labs)"
  • 完整历史数据及问题咨询通过 Hugging Face 讨论区联系
搜集汇总
数据集介绍
bitcoin-mempool-lifecycle 数据集图片
构建方式
该数据集以比特币内存池(mempool)中交易的完整生命周期为观测对象,通过多源轮询与全节点采集相结合的方式构建。核心机制是记录交易从首次观察到被挖掘或丢弃的全过程,涵盖首次观察到的时间戳、费率、挖掘高度、等待区块数及最终命运等关键字段。为防止数据失真,构建时剔除了一个不存在的首次观察到字段,并为尚未入池的交易保留null值以如实反映不可知信息。特别地,关于费用的采样策略经过精心设计,受限于近期到达流的每次仅返回十条最新交易,因而覆盖率呈现动态变化,并在多次修复后仍受拥塞程度影响而无法达到100%。此外,对于从未被挖掘的交易,其费用信息因提供方的即时遗忘而结构性缺失,这一特性已被实证验证(如147笔确认丢弃交易的探测结果即证)。
特点
该数据集的核心特色在于对内存池动态的精确刻画与对数据局限性的坦诚记录。一方面,它提供了比特币、莱特币及以太坊多链的丰富指标,时间跨度覆盖了从广播到挖掘的全过程,并引入多个提供方之间的分歧度衡量(如交易排队规模差异、节点视角重叠度),以及多家费用预估服务的对比。另一方面,它明确标注了每条记录的来源与限制,如公开RPC节点因最大内存池配置不同而导致的覆盖率差异(从256MB节点的34%到4GB节点的93%),以及费率列在不同时间段的实测覆盖率,并特别警示了在拥堵期间该列代表性更差的系统性偏差。数据集中还包含了节点层面的衍生字段,如BIP-125可替换性标志、祖先/后代计数,这些在交易确认或驱逐后便不再存续。
使用方法
用户可通过HuggingFace Hub的Python客户端便捷下载固定七日样本(2026-08-25至08-31),并利用Pandas读取Parquet格式分区文件。例如,可依据`allow_patterns`参数选择特定表(如e8_btc_mempool_lifecycle)进行加载。对于涉及费率的分析,建议先基于`pre_existing`字段计算每个分区的实际覆盖率,避免将采样视为全量。因数据集包含分位数、时间序列及节点分歧度等结构化信息,适用于内存池滞留时间建模、费用预估策略评估及多节点视角对比研究。完整历史数据需通过讨论区申请获取,且无插值填补,使用时需注意窗口间间隙的真实性。
背景与挑战
背景概述
比特币交易的存活性与等待时间构成了区块链性能分析的核心维度,然而,交易从广播至被打包入块的完整生命周期数据长期缺失,因其一旦确认或丢弃便无法追溯。为填补这一空白,DataForge实验室于2026年推出了bitcoin-mempool-lifecycle数据集,旨在系统性记录比特币交易在内存池中的驻留时长、费用率及最终命运。该数据集通过高频轮询与多节点交叉验证,捕捉了从首次观察到确认或丢弃的全过程,并扩展至莱特币与以太坊,为研究网络拥堵、费用动态及内存池行为提供了独特视角。其发布对区块链分析领域产生了深远影响,成为首个公开、细粒度、可复现的内存池生命周期数据集,推动了交易费用预估与网络健康监测的研究进展。
当前挑战
该数据集构建面临多重挑战。首先,领域问题层面,比特币交易的不可追踪性使得未确认交易一旦被打包或丢失即从公开接口消失,导致生命周期数据难以完整采集,且不同节点内存池状态差异显著,增加了数据一致性的难度。其次,构建过程中,早期版本因技术缺陷导致费用率列覆盖率极低(首日无数据,后逐步提升),且采样上限受网络拥堵影响,高活跃期覆盖率不升反降;此外,被丢弃交易的费用率几乎无法恢复,因其离开内存池后立即无法通过API获取,测试中147条此类交易均无法检索。这些挑战要求研究者谨慎处理数据覆盖偏差,并对不同时间分区的数据质量进行独立评估。
常用场景
经典使用场景
该数据集以比特币为核心,系统记录了交易从广播至被挖掘的完整生命周期,涵盖首见时间、等待时长、费用率及最终命运等关键维度,为研究未确认交易池(mempool)的动态演化提供了高保真时间序列数据。其经典应用场景包括对区块确认时间的预测建模、交易费用动态的精细刻画以及网络拥堵程度的量化评估。凭借超过百万级的样本量,研究者可借此剖析比特币内存池在不同费率区间和拥堵水平下的行为特征,进而验证或修正既有的交易等待时间模型,推动对区块链底层运行机制的深入理解。
衍生相关工作
围绕该数据集,可催生一系列具有奠基效应的衍生工作。基于其长时间跨度的交易生命周期记录,可构建预测交易确认概率的机器学习模型,进而研究内存池动态对交易费用市场的反馈机制,形成更精细的比特币费率预估基准。其丰富的未被挖掘交易样本,为深入探讨交易替换(RBF)和子为父付费(CPFP)等复杂行为提供了实证素材,推动了关于激励机制设计的研究。此外,跨节点内存池差异对比数据可用于探究区块链网络的信息传播延迟与节点局部性现象。这些衍生工作不仅将深化对比特币自身协议的理解,其方法论亦可迁移至其他基于内存池的区块链系统,促进领域理论的交叉与融合。
数据集最近研究
最新研究方向
当前,比特币内存池生命周期的研究正聚焦于交易从广播到入块的完整时序追踪,尤其关注未确认交易的驻留时间、费率动态与最终命运。该数据集的出现填补了交易在进入区块后时序信息缺失的空白,为研究网络拥堵、交易替换(RBF)及CPFP费用 bumping 提供了细粒度数据支持。其独特的采集方法,如对丢弃交易的严格判定、对费率捕获偏差的量化分析,以及对不同节点内存池差异的揭示,引领了区块链数据基础设施的新范式。这不仅有助于优化费用估算模型,还为理解比特币手续费市场的长期结构提供了实证基础,对提升交易预测准确性和区块链系统性能分析具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务