ErdosBench
收藏数据链接:
官方服务:
资源简介:
ErdosBench是一个用于评估AI系统是否能够像有用的数学研究助手一样工作的研究数学基准,包含14个公开的Erdős风格问题,用于进行烟雾测试。
ErdosBench is a mathematical research benchmark designed to evaluate whether AI systems can function as effective mathematical research assistants. It includes 14 publicly available Erdős-style problems for smoke testing.
创建时间:
2026-06-09
原始信息汇总
数据集概述:ErdosBench Public Smoke Test
ErdosBench 是一个面向研究数学领域的基准测试,旨在评估 AI 系统在扮演数学研究助手方面的能力。具体任务包括:发现障碍、应用已知定理、检查证明漏洞、进行有限实验以及避免对 Erdős 风格候选问题夸大新颖性。
数据集规模与内容
- 本仓库为公开的烟雾测试版本,仅包含 14 个公开问题陈述,编号为:
AI-ERDOS-001至AI-ERDOS-012、AI-ERDOS-195和AI-ERDOS-208。 - 完整的 226 个问题语料库、开发/私有/保留集、答案密钥、验证器内部逻辑及私有基准测试项目文件不包含在此仓库中。
仓库布局
data/smoke_problems.jsonl:14 个公开烟雾测试问题陈述的数据文件。schemas/smoke_result.schema.json:提交烟雾测试结果时必须遵循的 JSON 格式规范。scripts/make_prompt.py:用于生成盲评估提示的脚本。scripts/validate_results.py:用于验证结果 JSONL 文件覆盖范围和基本格式的脚本。docs/ErdosBench.tex和docs/ErdosBench.pdf:相关白皮书文档。
运行盲烟雾测试
- 使用
data/smoke_problems.jsonl、schemas/smoke_result.schema.json及scripts/目录下的脚本生成提示。在模型生成自己的结果前,不应阅读白皮书文档。 - 生成提示命令:
python3 scripts/make_prompt.py --out /tmp/erdosbench_smoke_prompt.md - 将提示提供给模型或研究代理,保存其 JSONL 格式的输出。
- 验证结果命令:
python3 scripts/validate_results.py path/to/results.jsonl - 验证器仅检查是否包含全部 14 个预期问题编号,以及每行是否包含所需字段,不评判数学正确性。
结果格式
每行 results.jsonl 应包含以下字段:
run_idproblem_idnumbertitleattempt_authorverdictconfidenceresult_summaryevidenceremaining_gapsjudging_notes
允许的裁决(verdict)类型:
solvedpartial_progresscounterexample_foundlikely_falseliterature_triage_onlyno_progress
发布边界
本仓库是公开烟雾测试仓库,并非私有 ErdosBench 评估集。公开烟雾测试问题可用于可复现性、调试和社区讨论,但不应被视为保密保留项或私有排行榜证据。
搜集汇总
数据集介绍

构建方式
ErdosBench 是专为评估人工智能系统在数学研究辅助能力而设计的基准测试,其构建依托于合成生成的 Erdős 风格候选问题。该基准的核心素材源于 ulam.ai 研究笔记中公开的 14 道问题陈述,涵盖 AI-ERDOS-001 至 AI-ERDOS-012、AI-ERDOS-195 及 AI-ERDOS-208 等编号。这些题目被整理为 data/smoke_problems.jsonl 文件,并辅以 schemas/smoke_result.schema.json 定义的 JSON 结果格式规范,以及用于生成盲测提示和验证结果的脚本,构成了公开烟雾测试的基础框架。
特点
ErdosBench 的最大特色在于其聚焦于数学研究助手角色的能力评估,旨在检验系统是否能够完成障碍发现、定理应用、证明漏洞检查、有限实验执行以及避免过度宣称新颖性等核心任务。基准仅包含 14 道公开烟雾测试题目,不涉及完整的 226 题源语料库、开发/私有/保留集划分或内部验证器,因此避免了数据泄露风险。其验证器仅检查结构合规性,不评判数学正确性,使得测试结果更关注模型输出格式的规范性。
使用方法
使用 ErdosBench 进行盲测时,需严格遵循流程:首先运行 scripts/make_prompt.py 脚本,基于 data/smoke_problems.jsonl 生成评估提示,再将此提示提供给待评估的模型或研究代理。模型生成结果需保存为 JSONL 格式文件,每条记录须包含 run_id、problem_id、verdict 等必填字段,其中 verdict 可选 solved、no_progress 等六种状态。最后通过 scripts/validate_results.py 验证结果文件是否覆盖全部 14 道题目且格式正确,但验证器不判断解题正确性,仅确保结构合规性。
背景与挑战
背景概述
ErdosBench是一项由ulam.ai研究团队于2026年创建的数学研究基准,旨在系统评估人工智能系统是否能够扮演称职的数学研究助手角色。该基准受埃尔德什·帕尔(Paul Erdős)经典数学问题的启发,聚焦于检验AI在发现反例、运用已知定理、检查证明漏洞、执行有限实验以及避免过度声称新颖性等方面的能力。相较于传统数学基准,ErdosBench更强调研究过程中的实用性与严谨性,其包含的226个问题源语料库覆盖了多个数学分支,为衡量AI的数学推理与协作能力提供了全新视角。该基准的公开发布版本包含14个公开烟雾测试问题,已吸引研究者关注,有望成为评估AI数学助手能力的重要参照。
当前挑战
ErdosBench所应对的核心领域挑战在于,现有数学基准多侧重于封闭式解题或符号推理,缺乏对AI在真实研究环境中进行探索性推理、验证与批判性思考能力的评估。具体而言,AI需克服以下难题:1)精准识别数学证明中的潜在漏洞,避免产生误导性结论;2)在有限信息条件下快速定位文献依据或反例,而非依赖记忆性回答;3)区分创新性发现与已有结果的简单复述。在基准构建过程中,挑战同样显著:设计者需确保问题兼具难度与可验证性,避免歧义;同时,标注员需协同数学家制定严谨的评判标准,而226个问题的私有集维护与防泄露任务也对数据管理提出了高要求。
常用场景
经典使用场景
ErdosBench作为一项面向科研数学领域的基准测试,其经典使用场景聚焦于评估人工智能系统在数学研究辅助任务中的表现。具体而言,该数据集通过提供一系列仿照埃尔德什风格构造的候选问题,要求AI系统执行寻找反例、应用已知定理、检查证明漏洞、运行有限实验以及避免对新成果过度声称等操作。研究者通常利用其中公开的14道烟雾测试题目,以盲测方式检验模型能否像称职的数学研究助手一样,对问题给出‘已解决’、‘部分进展’、‘发现反例’等分级判断,并附上证据与剩余缺口分析。这一场景强调了从简单问答向深度推理与严谨验证的转变,是检验AI在形式化数学探索中实际能力的试金石。
衍生相关工作
ErdosBench的提出催生了一系列相关学术方向的拓展与深化。围绕其核心思想——即以结构化、有挑战性的数学问题集合来评测AI的科研能力——衍生出诸如领域专用反例生成器的训练、基于大语言模型的数学推理框架优化,以及结合形式化验证工具的混合评估体系等工作。一些后续研究借鉴了ErdosBench中‘剩余缺口’与‘证据组织’的评价维度,发展了更细粒度的数学论证质量分级标准;另一些工作则尝试将这种合成问题构造技术迁移至组合数学、图论等分支,构建针对特定数学子领域的专业化评测集。这些衍生工作共同推动了人工智能数学能力评估从简单的答案匹配,向深度、严谨的科研行为模拟方向演进,持续丰富了该领域的方法论生态。
数据集最近研究
最新研究方向
在人工智能与数学推理交叉的前沿领域,ErdosBench作为一项开创性的研究数学基准测试,聚焦于评估AI系统在数学研究中的实用助理性,即能否像人类研究者一样发现反例、应用定理、检查证明漏洞、执行有限实验并避免对经典问题过度宣称新颖性。该基准基于合成厄多斯风格问题构建,旨在推动AI从模式识别向真正的数学推理能力跃迁,其发布与2026年学界对AI赋能基础数学探索的热切期待相呼应,对衡量AI在理论数学中的贡献边界、规范研究评测标准具有深远意义。
以上内容由遇见数据集搜集并总结生成



