遇见数据集

l2-preconfirmation-reliability

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

该数据集名为“L2 排序器预确认可靠性”,用于记录L2排序器(sequencer)在交易最终在L1上确认前所做出的包含承诺是否被遵守。数据集包含两种类型的行:心跳(heartbeat),记录unsafe head领先safe head的延迟;以及违规(violation),记录承诺被打破的事件。每个样本包含检查数量(n_checked)、失败数量(n_failed)、行类型(row_type)等字段。其中lag_blocks字段仅在safe_tag_plausible为真时才有意义。数据以Parquet格式存储,按收集窗口(年/月)分区,并提供固定7天的样本窗口供评估。数据规模约为100K到1M条记录,适用于时间序列预测、可靠性分析等任务。请注意:由于采样间隔(每几秒一次),部分违规可能无法被捕获;该数据集仅包含9条OP-stack链,不能推广到其他架构;安全头延迟在不同链间差异巨大,建议与自身历史比较而非跨链比较。

The dataset is named L2 sequencer pre-confirmation reliability, used to record whether the inclusion promises made by the L2 sequencer before the transaction is finally confirmed on L1 are kept. It contains two types of rows: heartbeat, which records the delay of unsafe head ahead of safe head; and violation, which records events where promises are broken. Each sample includes fields such as n_checked, n_failed, row_type, etc. The lag_blocks field is meaningful only when safe_tag_plausible is true. Data is stored in Parquet format, partitioned by collection window (year/month), and provides a fixed 7-day sample window for evaluation. The data scale is approximately 100K to 1M records, suitable for tasks such as time series forecasting and reliability analysis. Note: Due to the sampling interval (every few seconds), some violations may not be captured; the dataset only contains 9 OP-stack chains and cannot be generalized to other architectures; safe head lag varies significantly across chains, and it is recommended to compare with own history rather than cross-chain comparison.

创建时间:
2026-08-31
原始信息汇总

数据集概述:L2 排序器预确认可靠性

本数据集记录了 Layer-2(L2)区块链网络中,排序器(Sequencer)对其交易预确认承诺的实际兑现情况,核心在于捕捉并验证那些“承诺但未履行”的少数违约事件,其价值主要体现在违约记录的稀缺性以及零违约记录的可信度上。

1. 数据集核心内容与结构

  • 数据集名称: dataforge-labs/l2-preconfirmation-reliability
  • 主要内容: 记录了 L2 排序器在交易于 L1 最终确认之前,所做出的包含承诺是否真的兑现。由于被替换的区块原始版本不会被保留,因此只有主动记录原始信息的主体才能观察到违约行为。
  • 数据表:
    • e14_l2_preconf: 主要数据表,每行代表一个“心跳”(Heartbeat)记录或一个“违约”(Violation)事件。
      • 心跳: 记录不安全头区块(unsafe head)领先于安全头区块(safe head)的距离。
      • 违约: 记录实际发生的承诺未兑现事件。
    • row_type 字段: 用于区分数据行是“心跳”还是“违约”。
    • 关键字段:
      • n_checked: 实际已验证的承诺数量。
      • n_failed: 未能完成检查的数量。
      • lag_blocks: 安全头区块落后于不安全头区块的数量。
      • safe_tag_plausible: 一个布尔标志,指出 lag_blocks 字段是否有效。
  • 数据格式与获取: 数据以 Parquet 格式存储,按收集时间窗口分片,目录结构为 dataset/YYYY/MM/。提供了 Python 代码示例用于通过 huggingface_hub 库下载和加载数据。

2. 数据覆盖范围与重要说明

  • 数据窗口: 数据具有一个固定的 7 天采样窗口,起始于数据集自身收集的首日,覆盖时间跨度为 2026-08-26 至 2026-09-01。该窗口不会更新。
  • 数据规模: 数据行数在 100,000 到 1,000,000 之间(100K<n<1M)。
  • 覆盖链: 数据覆盖 9 条 OP-Stack 架构的链,由9个独立的排序器运营商运行。因此,数据可用于比较这些链之间的表现,但因架构单一,不能将其结论泛化至其他不同架构的 Rollup。
  • 不完全监测: 由于不安全头区块每几秒采样一次,两个采样点之间被提出并被替换的区块无法被捕捉到。这意味着数据会低估违约数量,绝不会高估。

3. 使用时的关键注意事项

  • lag_blocks 字段的有效性: 当 safe_tag_plausiblefalse 时,lag_blocks 字段没有意义。这是因为个别链的公共端点间歇性提供过时的安全标签,导致数据出现异常。建议按此标志位进行过滤,而不是按链名称排除。
  • 安全头区块差距巨大: 各链在正常运行状态下的安全头区块滞后量差异巨大(从几十个区块到几千个,甚至出现数千万的极端值)。因此,应比较链自身的历史数据,而不是在不同链之间进行绝对数值比较。
  • lag_blocks 的数据价值: 端点自身的不一致性被认为是公共基础设施运行的客观事实,因此该字段被保留,以便用户了解数据源的真实状态。

4. 数据全集与元数据

  • 运行清单: 名为 e0_run_manifest 的表列出了每个收集窗口的轮询次数和失败次数。该表以完整形式发布,不包含在固定的7天窗口内。窗口之间的数据空缺是真实存在的,无法事后填补,数据中也没有任何插值。
  • 完整历史数据: 完整的收集历史数据为私有数据,可通过数据集的“讨论”标签页申请获取。

5. 许可与引用

  • 许可证: 采用 ODC-BY (Open Data Commons Attribution License) 许可。
  • 引用要求: 允许自由使用数据,但需注明出处:“DataForge (dataforge-labs)”。
搜集汇总
数据集介绍
l2-preconfirmation-reliability 数据集图片
构建方式
该数据集由DataForge实验室构建,旨在系统性地监测Layer-2(L2)排序器(sequencer)在交易预确认(preconfirmation)阶段所做出的包含承诺是否被如实履行。数据采集通过高频轮询各L2链的公开端点,实时捕获不安全头(unsafe head)与安全头(safe head)之间的区块高度差,并记录每次心跳(heartbeat)或违规(violation)事件。每条记录包含验证的承诺数量(n_checked)与失败检查数(n_failed),确保零违规数据的可信度。数据以Parquet格式按周分区存储,每个分区对应固定的7天采样窗口,覆盖2026年8月26日至9月1日,完整历史数据按需提供。
特点
该数据集的核心特点在于其稀缺的违规记录与详尽的覆盖信息相结合,提供了对L2排序器可靠性的细粒度洞察。覆盖九条OP-stack链,每条链由独立运营商运行,支持跨链比较与自身历史趋势分析。数据集特别标注了安全标签的可疑性(safe_tag_plausible),以区分瞬时故障与长期行为,并保留了对不安全端点的观测记录,反映了公共基础设施运行的真实状况。此外,数据采集间隔为数秒,可能遗漏极短时间的违规,但不会过度计数,确保了统计的保守性。
使用方法
使用者可通过HuggingFace的snapshot_download函数获取数据集,并利用Pandas读取Parquet文件进行时间序列分析。建议首先过滤safe_tag_plausible为假的记录,以避免受不安全端点数据影响。对于链间比较,应关注各链自身的历史表现而非绝对水平,因为不同链的安全头延迟差异巨大。数据集附带e0_run_manifest清单,详细记录了每个采样窗口的轮询与失败次数,便于评估数据完整性。完整历史数据及疑问可通过数据集讨论区联系DataForge团队获取。
背景与挑战
背景概述
随着以太坊Layer-2扩容方案的兴起,Rollup作为主流架构,其排序器(sequencer)在交易纳入与状态最终性之间扮演着关键角色。排序器常向用户提供交易包含的预确认承诺,然而这些承诺在Layer-1结算前可能因区块替换而失效。为系统评估此可靠性,DataForge实验室于2026年创建了该数据集,聚焦于OP-stack架构下的九条独立链,通过高频采样和协议验证,记录不安全头区块与安全头区块的滞后及承诺违规情况。其核心研究问题在于量化预确认承诺的可信度,并区分真实无违规与因检测不完整导致的假阴性。该数据集填补了Layer-2基础设施行为实证数据的空白,为跨链比较与运行稳健性研究提供了基线,对Rollup设计优化和风险评估具有重要参考价值。
当前挑战
该领域面临的挑战首先在于,预确认承诺的验证依赖对原始广播区块的记录,而替换后的区块不在任何归档中,导致违约事件仅对主动记录的观察者可检测,容易出现系统性漏报。数据构建中,由于不安全头区块采样间隔为数秒,快速提议并替换的区块可能被遗漏,产生不可恢复的计数偏差;同时,公共端点可能间歇性提供过时的安全标签,引入数十亿区块的虚假延迟,需通过标志位过滤而非简单排除。此外,不同链的安全头滞后基线差异巨大,跨链绝对值比较无意义,必须依赖自身历史相对评估。尚未解决的还包括覆盖缺口无法事后填补,以及九条链均属同构架构,无法泛化至其他Rollup设计。
常用场景
经典使用场景
在区块链与去中心化金融的学术探索中,预确认可靠性数据的获取向来是难点。该数据集聚焦于Layer-2排序器承诺的履行情况,记录了不安全区块头与安全区块头之间的滞后,以及承诺违背的罕见事件。其经典使用场景在于时间序列分析与异常检测,研究者可借此剖析排序器行为的动态演变,识别潜在的不稳定因素。数据涵盖了九个OP-stack链的独立运营者,为跨链比较提供了独特视角,但亦需警惕架构同质性带来的局限性。采样间隔导致的漏计现象,促使学者在构建模型时考虑数据观测的不完整性,从而更审慎地刻画去中心化系统的真实运行状态。
实际应用
在实际应用层面,该数据集的价值尤为突出。对于Layer-2网络的用户与开发者而言,它是评估排序器可信度的客观依据,可用于监控服务的健康状态,及时捕捉异常滞后或承诺违约,从而规避交易风险。对于基础设施提供商,它有助于优化节点配置,识别并纠正安全标签服务的间歇性故障。数据集的7天窗口版本与完整历史,使得审计与合规检查成为可能,为跨链桥接协议和去中心化应用的决策提供数据支持。其ODC-BY许可协议促进了广泛采用,任何以太坊生态的项目都可借此检视所依赖排序器的历史可靠性,进而提升系统的透明性与用户信心。
衍生相关工作
此数据集的孕育,催生了若干值得关注的衍生研究方向。基于其独特的多链心跳数据,研究人员可以开发预测排序器违约的机器学习模型,将时间序列预测与异常检测技术应用于去中心化金融的风险预警。此外,数据中记录的标记滞后现象,启发了关于公共RPC端点数据一致性协议的设计与改进,推动了更健壮的数据服务层研究。进一步地,对跨链安全标签差异的分析,可引导更优的跨层通信机制设计,减少因数据源不可靠导致的桥接事件。这些衍生工作不仅提升了该数据集的学术影响力,也回馈于区块链基础设施的稳固与发展,形成了数据与创新相互促进的良性循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务