遇见数据集

GaloisInc/fvspec-fv

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

FVSpec是一个形式化验证规范基准,包含9,415个Lean 4形式化挑战,这些挑战源自2,772个独特的Python基于属性的测试(PBTs)。每个样本都包含一个`Impl.lean`(可计算定义)和一个`Spec.lean`(包含`sorry`占位符的定理语句,供模型填充)。数据集基于RealPBT构建,旨在评估形式化验证和代码生成模型的性能。

FVSpec is a formal verification specification benchmark containing 9,415 Lean 4 formal verification challenges derived from 2,772 unique Python-based Property-Based Tests (PBTs). Each sample includes an `Impl.lean` file for computational definitions and a `Spec.lean` file with theorem statements containing `sorry` placeholders for models to fill in. The dataset is built upon RealPBT and is designed to evaluate the performance of formal verification and code generation models.

提供机构:
GaloisInc
搜集汇总
数据集介绍
GaloisInc/fvspec-fv 数据集图片
构建方式
fvspec-fv数据集的构建根植于对真实世界Python属性基础测试(PBT)的形式化转化过程。研究团队从fvspec-pbt数据集中精选了2772个独特的Python PBT,并借助先进的Claude Sonnet系列模型,为每个测试用例自动生成了对应的Lean 4形式化规约与实现。每一原始PBT可能经由多次独立的形式化流程处理,从而产出多个侧重点各异的样本,这些样本在定理数量、结构忠实度与依赖捕获上呈现出差异化的表现。值得注意的是,所有生成样本均经过严格的编译验证,确保了在指定Lean工具链下通过lake build的成功构建,这一举措为数据集的质量与可用性提供了坚实的保障。
特点
该数据集的核心特征在于其多维度的质量标注与丰富的元信息结构。每个样本不仅包含成对的Lean 4实现代码与带有占位符的定理规约,还通过结构忠实度子指标系统衡量了形式化规约对原始Python PBT的对应程度,涵盖参数覆盖、类型对应、策略覆盖与断言捕获等关键维度。数据集创新性地引入了帕累托最优性与规范性的复合质量评分,使得研究人员能够精准选取代表性样本。此外,数据集为每个样本提供了基于Claude Haiku 4.5模型的二分类难度评估、详尽的结构复杂性指标、以及完整的溯源信息,这些丰富的标注共同构成了一个立体化的形式化验证基准。
使用方法
数据集的使用主要围绕自动化定理证明的评估任务展开。使用者可通过HuggingFace的datasets库直接加载训练集分割,并利用is_canonical与pareto_dominated字段进行灵活的子集筛选,例如提取每个PBT对应的规范形式化样本或所有非支配样本。推荐的使用方法是让模型尝试填充spec字段中的sorr占位符,完成定理的证明,并通过参考评估框架inspect_ai驱动的评估管道对模型表现进行量化评分,评分标准涵盖二进制证明成功率与基于剩余sorr数量的部分分数。为构建均衡的评估基准,建议依据difficulty_binary字段进行分层采样,以确保简单样本与困难样本在测试集中保持适当比例。
背景与挑战
背景概述
fvspec-fv是一个于2026年发布的基准数据集,由GaloisInc团队在《Real-World PBTs as Lean Specs》论文中提出,承载着推动形式化验证与程序综合领域发展的核心使命。该数据集从2,772个源自真实世界的Python属性基测试中衍生出9,415个Lean 4形式化挑战,每个样本均包含可计算的Lean实现与待证明的定理规范。通过以真实软件库中的测试用例为桥梁,fvspec-fv将形式化方法的研究焦点从人工构造的数学证明转移至实践中易错的程序行为,为自动化定理证明和代码生成模型提供了前所未有的评估场景,显著提升了相关领域对机器学习模型在严谨形式化推理能力上的评判标准。
当前挑战
fvspec-fv旨在解决的领域问题核心在于:传统形式化验证基准多聚焦于数学定理证明,缺乏对实际软件行为建模的难度和多样性,使得模型难以泛化至应用级代码的验证挑战。该数据集在构建过程中同样面临显著挑战:首先,将Python属性基测试自动翻译为Lean 4规范需要精确捕获参数类型、断言逻辑及策略约束之间的语义对应,稍有不慎便会产生结构失真;其次,维护所有样本在轻量级依赖环境下的可编译性要求对大量形式化变体进行系统性验证与筛选,这在高通量流水线中尤为复杂;此外,不同管道运行生成的多重形式化版本在定理覆盖度与结构忠实度之间形成帕累托前沿,如何设计评估指标以权衡这些质量维度构成了方法论上的关键难题。
常用场景
经典使用场景
在形式化验证与定理证明领域,fvspec-fv数据集被设计为一组源自真实世界Python属性测试的Lean 4形式化挑战。其核心使用场景在于评估大语言模型自动完成定理证明的能力,每个样本包含一个带有'sorry'占位符的规格说明与对应的可计算实现。研究者可通过让模型填充这些待证明的定理来检验其形式推理能力,数据集提供的编译保证与难度分级使这一评估过程更加系统化和可复现。
实际应用
在软件工程实践中,fvspec-fv能够作为评估和提升AI辅助形式化验证工具性能的试验平台,帮助开发者选择最适合其项目需求的定理证明模型。其轻量级的依赖设计(无需Mathlib)降低了部署门槛,使团队能够快速在持续集成流水线中集成自动证明功能。此外,该数据集还可用于训练为程序合成和后端验证服务的专用语言模型,推动将形式化方法更广泛地嵌入日常软件开发流程。
衍生相关工作
围绕fvspec-fv已经衍生出若干关键研究工作,包括配套的评估框架(基于inspect_ai和lean-lsp-mcp)以及用于难度分级的自动标注流水线。该数据集的构建方法论催生了对属性测试形式化忠实度的系统性研究,而基线实验中对前沿模型(如Claude Sonnet、GPT-5.4)的评测则为理解大语言模型在形式推理任务上的能力边界提供了重要参考。这些工作共同构成了连接软件测试与定理证明的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务