遇见数据集

bitcoin-mempool-lifecycle

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集名为“Bitcoin mempool lifecycle”,主要关注交易从广播到被挖矿过程中的生命周期,包括首次被观察到的时间、等待时长、支付的费用以及是否最终被挖矿。数据集包含多个子表:比特币交易生命周期、不同提供者之间mempool状态差异的瞬时快照、莱特币交易生命周期、费用估算器及确认目标、以太坊mempool的每分钟聚合活动、从未被挖矿的以太坊交易完整记录、以太坊节点间mempool视图差异、每个收集窗口的轮询、失败和覆盖计数器。数据以Parquet格式存储,每个文件对应一个收集窗口,位于dataset/YYYY/MM/目录下。该仓库保留最近7天的滚动窗口,完整历史数据私有存储。数据集规模在1百万到1千万行之间。适用于时间序列预测任务,可分析交易费用市场、mempool动态、费用估算器性能等。注意:first_seen_ts是观察者自己的时间戳;pre_existing为true的交易真实到达时间未知;比特币交易的dropped命运从2026-08-26开始记录;fee_rate_sat_vb仅出现在约五分之一的到达交易中;mempool是节点本地的,驻留时间可能很长;费用估算器之间差异巨大。

The dataset is named Bitcoin mempool lifecycle, focusing on the lifecycle of transactions from broadcast to mining, including first observed time, waiting duration, fees paid, and whether they are eventually mined. It contains multiple sub-tables: Bitcoin transaction lifecycle, instantaneous snapshots of mempool state divergence between different providers, Litecoin transaction lifecycle, fee estimators with confirmation targets, per-minute aggregated activity of Ethereum mempool, full records of Ethereum transactions never mined, mempool view divergence among Ethereum nodes, and polling, failure, and coverage counters per collection window. Data is stored in Parquet format, with each file corresponding to a collection window, located under dataset/YYYY/MM/. The repository retains a rolling window of the last 7 days; full historical data is stored privately. Dataset size ranges from 1 million to 10 million rows. Suitable for time series forecasting tasks, analysis of transaction fee markets, mempool dynamics, fee estimator performance, etc. Notes: first_seen_ts is the observers own timestamp; transactions with pre_existing=true have unknown actual arrival time; Bitcoins dropped fate is recorded from 2026-08-26; fee_rate_sat_vb appears only in about one-fifth of arrival transactions; mempool is node-local, so residence time can be very long; fee estimators vary widely.

创建时间:
2026-08-27
原始信息汇总

数据集概述

数据集名称:Bitcoin mempool lifecycle, dwell times and fee estimates(比特币内存池生命周期、驻留时间与费率估算)

许可证:ODC-BY(开放数据共享署名许可)

数据集规模:1M < n < 10M(约100万至1000万行)

任务类型:时间序列预测

标签关键词:mempool、交易费用、费率估算、比特币、莱特币、以太坊、区块链、加密货币、时间序列


数据集内容

该数据集记录了比特币交易从广播到被挖出的完整生命周期,包括首次被观测到的时间、等待时长、支付的费率以及最终是否被挖出。核心表结构如下:

数据表 内容描述
e8_btc_mempool_lifecycle 比特币交易生命周期:首次观测时间、费率、挖出高度、等待区块数、最终状态
e9_btc_mempool_divergence 两个数据提供方在某一时刻的内存池规模及重叠程度对比
e11_ltc_mempool_lifecycle 莱特币交易生命周期(与e8结构相同,单一提供方,无交叉验证)
e15_fee_estimators 五个费率估算提供方在不同确认目标下的费率估算值
e1_mempool_minutely 以太坊内存池每分钟活动汇总:到达事件、状态变化、驻留时间分位数
e1_mempool_dropped 未被挖出的以太坊交易的完整记录
e3_mempool_divergence 一个以太坊节点与其他三个节点的内存池视图差异
e0_run_manifest 每个采集窗口的轮询次数、失败次数和覆盖计数器

重要使用注意事项

数据采集说明

  • first_seen_ts 字段为数据集采集方自身轮询首次观测到交易的时间,并非网络首次广播时间;数据集中从未使用提供方自身的首次观测字段。
  • 标记为 pre_existing = true 的行表示该交易在采集窗口开启前已在内存池中,其真实到达时间无法得知,因此 first_seen_ts 为空值而非虚构值。

数据质量说明

  • 比特币 fate = "dropped"(被丢弃)状态自2026-08-26起记录;此前存在记录缺陷,导致交易被替换时无法被识别为丢弃。早期分区数据保持原样,未做重写。
  • “丢弃”判定标准严格:交易必须同时满足已不在链上、不在两个提供方内存池中、连续十次轮询均缺失三个条件;更宽松的判定方法会产生大量误报。
  • fee_rate_sat_vb 仅存在于约五分之一的到达交易样本中,来源于近期交易流采样;其余交易该字段为空,以避免推测值对分析造成误导。
  • 费率为0是真实且罕见的(约占采样交易的1/6000),多数此类交易最终仍被确认;若零值影响计算可过滤 fee_rate_sat_vb > 0

内存池特性

  • 内存池数据具有节点本地性,节点保留交易时长由节点自身策略决定;本数据集提供方曾保留115天前的交易,而Bitcoin Core默认336小时(14天)后驱逐。
  • 比特币交易驻留时间较长:快速确认的交易约10分钟,但内存池中存在中位年龄超过100天的长期积压交易,这反映的是比特币费率市场的真实状况。
  • 不同费率估算提供方之间差异显著,样本显示同一6区块目标下五家提供方的费率估算差距可达6.7倍;目标值已归一化为区块数,原始数据字段保留供核验。

数据格式与发布方式

  • 数据集以Parquet格式分区存储,路径结构为 dataset/YYYY/MM/,每个采集窗口一个文件。
  • 此仓库滚动保留最近7天的数据面板,完整历史数据由数据提供方私下持有。
  • e0_run_manifest 表完整发布,列出每个采集窗口的轮询次数与失败次数;窗口间的时间间隙是真实的,无法事后填补,数据中不存在任何插值。

适用场景

该数据集适用于比特币、莱特币和以太坊内存池行为分析、交易费率预测模型构建、内存池生命周期时间序列研究、多数据源费率估算对比等研究方向。以太坊部分建议优先参考 Flashbots Mempool Dumpster(CC-0许可,覆盖更广节点网络,自2023年9月起每日发布)作为替代数据源。

搜集汇总
数据集介绍
bitcoin-mempool-lifecycle 数据集图片
构建方式
该数据集旨在捕捉比特币交易从广播至被挖掘的完整生命周期,其构建方式基于持续轮询多个节点与公共API,记录交易首次被观测的时间、等待时长、支付费率及最终命运。针对比特币、莱特币及以太坊分别设计了独立的数据表结构,其中比特币数据涵盖交易生命周期、节点间待确认池分歧度及费用估算等多维度信息。构建过程中特别避免了依赖提供方自报的首次出现时间,而是采用自有轮询时钟;对于预存在交易设置空值以示区分;对于未能确认的交易,仅当其在区块链及多个提供方池中均缺失且连续十次轮询未出现时才标记为丢弃。数据按日分区并以parquet格式存储,当前公开的为固定七天的样本集,完整历史数据则保留在私有存储中,可按需索取。
特点
该数据集的核心特征在于其详尽记录与严格验证,尤其注重数据的真实性与可靠性。每一笔交易均附带首次出现时间、费率、被挖掘高度等关键信息,且费率字段仅对约五分之一的到达样本进行采样,以避免估算失真。特别值得注意的是,数据集剔除了因节点本地策略导致的长时间驻留交易(如比特币待确认池中位数年龄超过100天),并将其解释为比特币费用市场的真实反映,而非采集错误。此外,数据集记录了不同费用估算提供商之间高达6.7倍的费率分歧,凸显了当前估算方法的差异性。以太坊数据则采用每分钟聚合及完整丢弃交易记录的形式,便于深入研究未上链交易的细节。
使用方法
数据集适用于时间序列预测、区块链行为分析及费用估算研究等场景。用户可通过Hugging Face提供的snapshot_download接口获取数据,并使用pandas读取parquet文件,例如加载比特币交易生命周期表(e8_btc_mempool_lifecycle)进行分析。在使用前,应关注README中的注意事项,如过滤费率为零的罕见样本、理解预存在交易的首次出现时间缺失等。由于公开样本为固定七天,建议用户先基于样本进行模式验证,再通过讨论区请求完整历史数据。结合e0_run_manifest表可了解各采集窗口的覆盖情况,避免对数据空缺进行不当插值,确保分析的科学性。
背景与挑战
背景概述
比特币交易的内存池(mempool)生命周期,作为区块链网络中交易从广播至确认的关键阶段,其动态行为揭示了手续费市场的微观结构与网络拥堵的实时状态。该数据集由DataForge (SleeveZipper)团队于2026年创建,旨在系统性地捕获交易在内存池中的等待时间、手续费率及最终命运,以弥补公共区块链数据在未确认交易时序信息上的缺失。通过对比比特币、莱特币及以太坊的观测,研究团队聚焦于跨链的内存池行为差异,并特别强调了诚实记录数据获取过程中的局限性,诸如首次观测时间偏差与已存在交易的不可知到达时间。此数据集为时间序列预测、手续费估算及区块链网络分析提供了宝贵的实证基础,对理解加密货币生态中交易确认的延迟与成本动态具有重要参考价值。
当前挑战
该数据集面临的首要挑战在于准确捕捉交易从广播到确认的完整生命周期,尤其是区分被替换交易与仍在等待中的交易,这一难题曾导致早期数据中无法可靠记录'丢弃'状态。其次,内存池的节点本地性致使不同观测者所见的pending集合存在显著差异,且节点保留交易的时间远超协议规定,加剧了数据一致性的难度。此外,手续费率的采样仅覆盖约五分之一观测到的新交易,且零费率交易的罕见性与必要性为数据过滤策略带来微妙考验。在构建过程中,团队需应对多提供者数据间的分歧及长时间跨度的数据收集缺口,所有缺失均如实记录而不予插值,以保证数据的真实性与原始性。
常用场景
经典使用场景
该数据集聚焦于比特币及部分其他区块链网络中交易从广播至被打包进区块的完整生命周期,精细刻画了交易首次被观测时间、驻留时长、所付费率及最终命运等关键指标。其经典使用场景涵盖区块链交易行为分析、内存池动态演化研究以及加密货币网络健康状况监测。研究者可借此深入探究交易在不同节点间的传播延迟、等待确认期间的状态变迁,以及未确认交易被替换或丢弃的规律,为理解去中心化账本的实时运作机制提供了前所未有的微观视角。
衍生相关工作
该数据集的设计灵感源于Flashbots Mempool Dumpster等开源项目,并在其基础上针对比特币和莱特币做了深度定制。与之相关联的经典工作包括:基于该数据开展的费用市场动态分析、不同节点内存池差异对比研究,以及交易驻留时间的分布拟合与预测模型。这些工作不仅深化了对区块链网络行为的理解,还促进了诸如贪婪型交易加速算法、优化版费率估算器等一系列衍生成果的出现,形成了实证研究与算法创新相互促进的良性学术生态。
数据集最近研究
最新研究方向
该数据集聚焦于比特币及主流公链内存池(mempool)中交易生命周期的完整追踪,涵盖交易首次广播至最终确认或丢弃的全过程,并记录费用率、等待时间及区块高度等关键参数。其最新研究方向主要围绕交易在内存池中的驻留时间(dwell time)分布、不同费用估算器(fee estimator)之间的差异及其对交易确认时间的影响,以及多节点内存池状态的分歧(divergence)分析。这一领域的前沿探索旨在揭示比特币费用市场的动态机理,优化交易费用预估算法,并提升链上交易的可预测性。该数据集填补了交易未被确认期间状态记录的空白,对研究网络拥塞、矿工行为及交易替换策略具有重要参考价值,也为构建更精准的区块链交易分析与预测模型提供了高质量的真实数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务