遇见数据集

bitcoin-fee-estimator-accuracy

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

本数据集记录了五个比特币费用估算器在不同时刻给出的费用建议,以及这些建议所对应的实际区块所需费用,用于评估估算器的准确性。数据集包含两个核心表格:e15_fee_estimators 记录了每个估算器在特定时刻针对不同确认目标(如1个区块、6个区块等)的推荐费用率;e28_fee_estimator_accuracy 则将每个区块与对应的估算器预测进行匹配,提供预测费用、实际清除费用(基于区块中独立交易的第10百分位费用率)、超付比例以及是否足够将交易纳入该区块的布尔值。数据规模介于10万到100万行之间,时间跨度为2026年8月26日至2026年9月5日(固定7天样本窗口),完整历史数据可应请求提供。数据以Parquet格式按年/月分区存储。主要字段包括:sufficient(是否足够)、overpay_ratio(预测费用除以实际清除费用,1.0表示精确,3.0表示支付了三倍)、target_blocks(估算器的预测目标区块数)、cleared_p10(独立交易的第10百分位费用率)、cleared_p10_all_txs(所有交易的第10百分位费用率)、n_standalone(区块中独立交易的数量)、lead_seconds(预测在区块实际出现前提前多少秒做出)。该数据集适用于时间序列预测、费用估算基准测试、区块链交易费用分析等任务。注意:仅包含五个无需API密钥即可使用的估算器,采样周期内交易量低时会增加百分位噪声,且安静的内存池会高估所有估算器的表现。数据集采用ODC-BY许可证,使用需注明“DataForge (dataforge-labs)”。

This dataset records fee recommendations from five Bitcoin fee estimators at different times, along with the actual fees required for the corresponding blocks, to evaluate the accuracy of the estimators. It contains two core tables: e15_fee_estimators records each estimators recommended fee rates for different confirmation targets (e.g., 1 block, 6 blocks) at specific times; e28_fee_estimator_accuracy matches each block with the corresponding estimator predictions, providing predicted fee, actual clearing fee (based on the 10th percentile fee rate of standalone transactions in the block), overpay ratio, and a boolean indicating whether the fee is sufficient to include the transaction in the block. The dataset size ranges from 100,000 to 1,000,000 rows, covering a time span from August 26, 2026 to September 5, 2026 (a fixed 7-day sample window), with full historical data available upon request. Data is stored in Parquet format partitioned by year/month. Key fields include: sufficient (whether the fee is sufficient), overpay_ratio (predicted fee divided by actual clearing fee, 1.0 means exact, 3.0 means paying three times), target_blocks (the number of blocks the estimator aims to predict), cleared_p10 (10th percentile fee rate of standalone transactions), cleared_p10_all_txs (10th percentile fee rate of all transactions), n_standalone (number of standalone transactions in the block), lead_seconds (how many seconds before the block actually appears the prediction was made). This dataset is suitable for tasks such as time series forecasting, fee estimation benchmarking, and blockchain transaction fee analysis. Note: It includes only five estimators that do not require API keys; low transaction volume during the sampling period may increase percentile noise, and a quiet mempool will overestimate the performance of all estimators. The dataset is licensed under ODC-BY, requiring attribution to DataForge (dataforge-labs).

创建时间:
2026-08-31
原始信息汇总

数据集概述

该数据集记录了五种比特币费用估算器在不同时间点给出的费用建议,以及实际区块确认交易所需的最低费用,用于评估各估算器的预测准确性。数据集的核心价值在于保存了“建议”这一不可回溯的稀缺数据——各服务商不提供历史建议记录,因此该数据填补了这一空白。

数据结构

数据集包含两个主要表:

  • e15_fee_estimators:每一行代表某一时刻某个服务商针对某个确认目标给出的费用建议。
  • e28_fee_estimator_accuracy:每一行将一个实际区块与某服务商对其的预测进行匹配,包含预测值、实际清算值以及预测是否有效(sufficient)。

关键字段与评估指标

  • sufficient:表示按照该建议支付费用是否能将交易纳入对应区块。
  • overpay_ratio:建议费用除以实际清算费用,1.0 表示精确匹配,3.0 表示支付了三倍费用。
  • target_blocks:服务商自身的预测时间跨度(如 1 个区块、6 个区块),预测与预测发布约 target_blocks 个区块后的实际区块匹配。
  • cleared_p10:区块内独立交易(无未确认父交易)费用率的第 10 百分位数,代表实际能够成功清算的最低费率。
  • cleared_p10_all_txs:包含所有交易(含非独立交易)的对应指标,用于展示不同定义下的差异。
  • n_standalone:每行均包含独立交易数量,数量过少时百分位估算噪声较大。
  • lead_seconds:预测实际提前于目标区块的时间(秒)。

数据覆盖与采样说明

  • 数据集包含约 10万 至 100万 行记录(100K<n<1M)。
  • 分区为 Parquet 格式,按 dataset/YYYY/MM/ 目录组织,每个收集窗口一个文件。
  • 当前公开部分为固定 7 天采样窗口,跨度为 2026-08-26 至 2026-09-05,用于验证数据模式与质量,不会随时间推进。
  • e0_run_manifest 表完整列出了所有收集窗口的轮询次数与失败次数,不进行窗口截断;窗口之间的空缺是真实的,数据未做任何插值补全。
  • 完整历史数据为私有持有,可通过讨论区请求获取。

使用注意事项

  • 所选五种服务商均为无需 API 密钥即可访问的服务,存在一定选择性偏差。
  • 底层费用数据覆盖不完整,百分位数基于采样到的交易计算,未做填补。
  • 当内存池空闲时,几乎所有交易都能确认,此时各服务商的“sufficient”表现都会虚高,同时“overpay_ratio”也会偏大。建议结合两个指标并按市场状态(regime)分组分析,而非跨月混合比较。

许可与联系方式

  • 许可协议为 ODC-BY:可自由使用,但需注明出处“DataForge (dataforge-labs)”。
  • 问题及完整历史数据请求请通过讨论区(discussions tab)联系。
搜集汇总
数据集介绍
bitcoin-fee-estimator-accuracy 数据集图片
构建方式
该数据集由DataForge实验室构建,旨在捕捉比特币交易手续费估算的稀缺信息——即各手续费估算服务提供商在特定时刻对特定确认目标的推荐值。构建过程分为两个核心表:e15_fee_estimators记录了单一提供商在某一时刻对某一确认目标的推荐值;e28_fee_estimator_accuracy则将每个区块与估算服务针对该区块的预测进行配对,评估预测值是否足以让交易进入该区块。数据通过定期轮询获取,每个收集窗口固定为7天,确保数据快照的可复现性。
使用方法
用户可通过HuggingFace数据集库便捷地下载和使用该数据集。示例代码展示了使用snapshot_download和pandas读取e28_fee_estimator_accuracy分区数据的方法,所有数据以parquet格式按月份存储于dataset/YYYY/MM/目录下。分析时需注意,建议将充分性与超额支付比率结合阅读,并按市场状态(如mempool拥堵程度)进行分时段分析,而非简单跨月聚合。此外,数据中n_standalone字段有助于识别低独立交易量区块,建议在构建模型或评估时予以考量。
背景与挑战
背景概述
比特币作为去中心化数字货币,其交易确认依赖于矿工打包,而用户需通过手续费激励矿工优先处理交易。手续费估算的准确性直接影响用户体验与网络效率。该数据集由DataForge实验室创建,旨在记录2026年8月26日至9月5日期间,五大免API密钥手续费估算服务商的预测建议与区块实际确认所需费率,填补了预测历史不可追溯的研究空白。其核心科学问题在于量化预测误差及支付充足性,为时间序列预测与区块链经济学提供基准数据。该数据集以超过10万条记录、精细的字段设计,推动了费用估算领域的实证研究,并成为评估钱包策略与网络拥堵响应的参考标准。
当前挑战
领域内首要挑战是费用估算的动态复杂性:比特币网络状态瞬息万变,估算器需权衡延迟与成本,而现有评估多基于事后实际费率,忽略了预测的历史情境。本数据集构建中,面临预测数据易逝性的核心困难——提供方不保存历史建议,部分文档接口失效,迫使实时采集。此外,约93%的低费率交易依赖未确认父交易,导致传统最低费率度量严重失真,需精细定义‘独立交易’的10分位数。采样不完整、低活跃期噪音及内存池状态波动,进一步加剧了比较的复杂性。最终,跨月份的数据池化会掩盖制度性差异,要求按网络动态分阶段解读,方能规避误导性结论。
常用场景
经典使用场景
该数据集为比特币交易手续费预估领域提供了一组难得的实证基准,其核心价值在于记录了五大手续费预估器在真实区块链环境中的实时建议及对应区块的实际清除费率。研究者可据此评估预测模型的准确性、稳健性与时效性,尤其适用于时间序列预测任务,例如对比不同预估器在多变网络负载下的表现,或深入剖析交易确认成功率与费用支付比率之间的权衡关系。
解决学术问题
该数据集解决了因预估器不提供历史建议而导致的学术研究数据匮乏问题,使研究者能够首次系统性验证手续费预估算法的有效性。它提供了区分预估器是否'足够'(能否成功上链)与'经济'(是否过度支付)的双重指标,从而揭示了单一指标评估的误导性,推动了更严谨的评估方法论发展,并对区块链动态费用市场的理解提供了实证支持。
实际应用
在钱包应用、交易所及区块浏览器的实际运营中,该数据集可助力优化手续费预估策略,降低用户交易成本并提升确认体验。通过分析不同预估器在各类市场状况下的历史表现,开发者能选择或混合最优策略,实现费用与时间的平衡。此外,其数据还能用于构建实时监控仪表盘,辅助用户和机构在拥堵时做出明智的费用决策。
数据集最近研究
最新研究方向
该数据集聚焦于比特币交易手续费预估器的实证评估,通过记录五家无需API密钥的预估器在不同确认目标下的建议费率与实际区块所需费率的对照,揭示了预估器在真实市场条件下的有效性与成本权衡。其独到之处在于,数据集不仅捕捉了区块链上可公开获取的实际费率结果,更珍贵地留存了预估器提供的、易逝的实时建议——这些建议若不即时记录便无从追溯。当前研究前沿关注于手续费市场的动态特征,例如内存池拥堵程度对预估准确性的显著影响,以及独立交易与依赖父交易的手续费代付机制的差异。该数据集提供的精细粒度数据(预测时间、目标区块数、实际通过率、超付比率等)为开发更鲁棒的动态手续费预测模型提供了基准,并为理解比特币网络的经济激励机制与用户体验优化提供了关键洞察。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务