ProverQA
收藏资源简介:
ProverQA是一个由大型语言模型和符号证明器共同生成的 first-order logic (FOL) 推理数据集,包含1500个实例,分为简单、中等和困难三个难度级别。该数据集通过结合大型语言模型的生成能力和符号证明器的精确性,创建了可扩展、多样化、高质量的数据集,特点是每个问题都包含可访问的、逻辑上一致的中间推理步骤。数据集旨在解决逻辑推理能力评估的问题,特别是针对链式思维(CoT)场景。
ProverQA is a first-order logic (FOL) reasoning dataset jointly generated by large language models and symbolic theorem provers, containing 1500 instances categorized into three difficulty levels: easy, medium, and hard. By integrating the generative strengths of large language models and the rigorous precision of symbolic theorem provers, this dataset features scalability, diversity and high-quality data, with each problem including accessible and logically consistent intermediate reasoning steps. The dataset is designed to address the evaluation of logical reasoning capabilities, particularly in chain-of-thought (CoT) scenarios.
ProverGen 数据集概述
数据集简介
ProverGen 是一个用于逻辑推理评估的合成数据集,它结合了大语言模型和符号证明器,旨在评估大型语言模型在逻辑推理方面的性能。
数据集结构
数据集的生成分为三个关键步骤:
- 逻辑骨架生成(Logic Skeleton Generation)
- 逻辑骨架翻译(Logic Skeleton Translation)
- 一阶逻辑问题生成(FOL Problem Generation)
安装说明
- 环境搭建:使用conda创建虚拟环境并激活,克隆ProverGen仓库,安装所需依赖。
- Prover9安装:从官网下载并按照指南安装,可能需要针对Linux和MacOS进行特定的错误修复。
数据生成
- 逻辑骨架生成:通过
logic_skeleton_generator.py脚本生成逻辑骨架,支持自定义生成数量、难度、答案分布等参数。 - 逻辑骨架翻译:使用
logic_skeleton_translator.py脚本将逻辑表达式转换为自然语言,可通过指定LLM模型进行翻译。 - 一阶逻辑问题生成:通过
fol_problem_generator.py脚本生成最终的问题,支持数据增强技术如问题分步生成或句子改写。
评估方法
使用evaluation.py脚本评估LLM在ProverGen数据集上的性能,支持直接模式和CoT模式,并提供指标计算。
模型性能
论文中额外评估了OpenAI-O1和DeepSeek-R1两个推理模型在零样本设置下的性能。
引用信息
如若数据集对您的研究有所帮助,请引用以下论文:
@inproceedings{ qi2025large, title={Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation}, author={Chengwen Qi and Ren Ma and Bowen Li and He Du and Binyuan Hui and Jinwang Wu and Yuanjun Laili and Conghui He}, booktitle={The Thirteenth International Conference on Learning Representations}, year={2025}, url={https://openreview.net/forum?id=C25SgeXWjE} }

- 1Large Language Models Meet Symbolic Provers for Logical Reasoning Evaluation北京航空航天大学, 上海人工智能实验室, 复旦大学, 中关村实验室, 北京智能制造系统技术国家重点实验室 · 2025年



