遇见数据集

ethereum-attestation-pool

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集记录了以太坊信标链上在交易池中看到但最终未被包含在区块中的证明(attestations)。数据来自单一共识客户端的视角,提供一个下界估计。数据集包含一个表e18_attestation_pool,每行对应一个slot(时段),包含三个字段:attesters_seen_in_pool(在池中等待的attester slots数量)、attesters_included(被包含在区块中的数量)以及attesters_net_never_included(前者减去后者,即从未被包含的净数量)。差值可为负值,表示网络承载了比该客户端看到的更多的attestations。数据规模在10,000到100,000行之间,覆盖2026-08-28至2026-09-03的固定7天样本窗口,以parquet格式分区存储(按年/月目录)。该数据集适用于时间序列预测任务,可用于分析attestation纳入延迟、池中积压情况等。注意:数据仅反映一个节点的视角,计数的是attester slots而非特定验证器,且attestation可见窗口约10分钟,window_closed字段标识哪些slot的包含窗口被完整观测。

This dataset records attestations that were seen in the mempool of the Ethereum beacon chain but ultimately not included in blocks. The data comes from the perspective of a single consensus client, providing a lower bound estimate. The dataset contains a table e18_attestation_pool, with each row corresponding to a slot, including three fields: attesters_seen_in_pool (number of attester slots waiting in the pool), attesters_included (number included in the block), and attesters_net_never_included (the former minus the latter, i.e., the net number never included). The difference can be negative, indicating that the network carried more attestations than observed by this client. The data size ranges from 10,000 to 100,000 rows, covering a fixed 7-day sample window from 2026-08-28 to 2026-09-03, stored in parquet format with partition by year/month directories. The dataset is suitable for time series forecasting tasks and can be used to analyze attestation inclusion delays, pool backlogs, etc. Note: The data only reflects one nodes perspective, counts attester slots rather than specific validators, and the attestation visibility window is approximately 10 minutes. The window_closed field indicates slots whose inclusion window was fully observed.

创建时间:
2026-08-28
原始信息汇总

数据集概述

数据集名称:Ethereum attestation pool
许可证:ODC-BY
大小类别:10K<n<100K
任务类别:时间序列预测

核心内容

该数据集记录了以太坊信标链共识层中,出现在见证池但从未被包含进区块的见证(attestations)。核心价值在于:链上只能看到验证者的见证缺失,却无法判断是“从未生成”、“生成但未传播”还是“已传播但未被纳入”。本数据集仅在见证仍处于待处理状态时捕捉这些差异。

数据说明

表名 每行含义
e18_attestation_pool 一个时隙(slot):池中观察到的验证者见证时隙数、实际纳入区块的见证数,以及二者的差值

关键字段

  • attesters_seen_in_pool:该时隙在池中被观察到的见证数
  • attesters_included:实际进入区块的见证数
  • attesters_net_never_included:前两者之差(可为负数,代表网络承载量超过本观测点所见)
  • n_polls_seen:轮询次数,低值代表置信度低
  • window_closed:标记该时隙的纳入窗口是否被完整观测

统计数据

在1,319个完整观测纳入窗口的时隙中:

  • 聚合差距为 -2.0%(受尾部数据影响)
  • 中位数为 -0.07%
  • p10为 -2.77%
  • p90为 -0.01%

典型时隙与链上数据几乎完全一致,少数时隙贡献了绝大部分差异。尚无时隙显示池中见证数超过链上纳入数。

使用注意事项

  • 单一视角:数据来自单个共识客户端,不代表全网状态,应视为下限估计
  • 统计对象:记录的是见证时隙数而非验证者个体,无法追踪特定验证者
  • 时间窗口:见证约保留10分钟,两次观测之间到达并纳入的见证不可见
  • 窗口标记:需过滤window_closed=true的行再下结论;集合窗口末尾的时隙会被提前最终化
  • 样本窗口:每个数据集均含固定7天样本窗口(2026-08-28至2026-09-03),不滚动更新;完整历史数据需另行请求

存储格式

  • 分区格式:Parquet,按集合窗口存放于 dataset/YYYY/MM/ 路径下
  • 完整运行清单:e0_run_manifest 表列出所有集合窗口及其轮询数和失败数,以完整形式发布

引用与联系

  • 许可证:ODC-BY,使用需注明来源 "DataForge (dataforge-labs)"
  • 疑问或申请完整历史数据可通过讨论区联系
搜集汇总
数据集介绍
ethereum-attestation-pool 数据集图片
构建方式
该数据集由单一共识客户端观测所得,聚焦于以太坊信标链上未被纳入区块的见证消息(attestations)。其构建方式在于持续捕获网络中待处理(pool)的见证信息,并将每个时隙(slot)内观察到的见证者槽位数(attesters_seen_in_pool)、已纳入区块的见证者槽位数(attesters_included)及二者净差(attesters_net_never_included)作为一行记录。数据以Parquet格式分区存储,按采集窗口(每7天固定)归档,时间跨度自2026-08-28至2026-09-03。同时,数据集以清单(manifest)记录每个采集轮次的轮询与失败计数,确保原始性与完整性。
特点
数据集的价值在于其稀缺性视角——它揭示了链上不可见的客观事实:见证是否被生产、传播却未纳入,仅存在于待处理池中。其显著特点包括:基于单一观察点,作为网络见证传播的下界参考;统计见证者槽位而非单一验证者,提供群体而非个体粒度的数据;见证在约十分钟内可见,低轮询次数(n_polls_seen)标注低置信度;窗口是否完整观测通过window_closed标志明确指示,过滤后方可得出稳健结论。此外,数据呈时间序列形态,适用于预测任务,且中位数与极值分布揭示典型时隙与尾部差异的微妙不对称性。
使用方法
使用该数据集时,研究者应通过HuggingFace Hub的snapshot_download函数下载Parquet文件,并利用pandas进行读取与拼接。分析过程中需重点关注window_closed为真的行,确保纳入窗口被完全观测;优先采用中位数而非总和作为聚合指标,以规避尾部极值干扰,更准确反映典型时隙的网络行为。该数据集可支持时隙级见证纳入延迟或网络传播效率的时间序列预测,亦可用于基准测试或异常检测研究。由于样本固定不滚动,无需重复下载;若需完整历史数据,可联系数据集提供者获取,其原始性保障了分析的可信度。
背景与挑战
背景概述
以太坊信标链的共识机制依赖于验证者的及时证明,而证明从产生到上链之间存在一个在网络中传播的‘等待池’阶段。这一阶段中,证明可能因网络延迟或传播失败而未能被包含在区块中,导致区块提议者遗漏证明,进而影响链的最终确定性。然而,链上数据仅能显示缺失的证明,无法区分其是未产生、产生未传播还是传播未包含。为填补这一观察盲区,DataForge实验室于2026年创建了ethereum-attestation-pool数据集,记录了单一共识客户端视角下,等待池中观察到的证明槽位数量与最终上链数量的差异。该数据集以时间序列形式提供,核心研究问题在于量化证明在上链前的丢失规模,并为验证者有效性分析提供补充视角。其稀缺性在于,只有通过监测等待池才能捕获这一中间状态,为以太坊共识健康度研究提供了独特的数据基础,对区块链监控与分析领域具有开创性意义。
当前挑战
该数据集面临的挑战源于其单点观测的固有限制与构建过程的复杂性。领域层面,链上数据无法揭示证明缺失的根本原因,而该数据集旨在解决这一盲区,但单一共识客户端仅能观察部分网络,导致数据被视为下界,且可能遗漏其他节点持有的证明。构建过程中,证明在等待池中仅存约十分钟,两次轮询间隔内可能被包含而不可见,造成数据不完整;同时,负值差异(网络携带多于观测)属正常现象,需避免截断以保留非对称性。此外,窗口末尾的槽位因提前终结而标记为window_closed=false,影响包含性计数的完整性。数据集中未观察到正偏差,但若出现大量正值则需怀疑采集环节。这些挑战要求使用者谨慎过滤数据(如仅采用window_closed行),并结合中位数而非总和进行分析,方能得出可靠结论。
常用场景
经典使用场景
在以太坊共识层的研究中,验证者证明的时效性与网络传播动态一直是核心议题。该数据集聚焦于一个独特的观测窗口——证明在进入区块前的待处理状态,通过记录每个时隙中被观测到的待处理证明数量、最终被包含的数量及两者差额,提供了链上数据所无法直接呈现的中间态信息。其经典用法在于对比链上可见的最终确认与链下瞬时状态,以量化证明丢失的具体阶段,从而为共识机制的微观行为研究提供宝贵的数据支撑。
实际应用
在实际应用层面,该数据集为以太坊基础设施监控与运维提供了关键参考。通过实时跟踪证明池的滞留情况,节点运营商可以快速识别网络中的异常传播问题,例如连接障碍或异步故障,从而改善其拓扑连接与消息中继策略。此外,对证明最终未被包含的持续观测,有助于质押池和管理工具优化验证者的提交时机与本地调度,进而降低无效证明带来的隐形成本,提升整体参与率与共识效率。
衍生相关工作
该数据集的独特视角激发了诸多衍生研究,如利用其时间序列特征构建传播延迟预测模型,或开发异常检测算法以识别网络级的分区事件。同时,它可与其他链上数据集结合,用于验证证明聚合策略的有效性,或是评估分叉选择规则的鲁棒性。其发布的固定抽样窗口设计也树立了数据质量评估的范例,鼓励后续工作者在类似分布式观测场景中采用更严谨的采样与确定性分析方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务