遇见数据集

SZLHOLDINGS/agi-forecast-source

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是AGI安全预测量表的源数据,包含Putnam 2025覆盖数据:12个问题中已有10个具有Lean 4结构,其中4个(A1、A5、B4、B6)已通过Lean形式化验证并标记为GREEN状态。数据集还包含基线跟踪数据(5个基线问题加134个Putnam问题),以及运行时评分、Pac-Bayes边界计算和量表校准记录。这些数据用于支持AGI预测可视化平台和静态站点,并正在lutar-lean项目中进行全面形式化。数据集涉及形式化验证、Lean证明和AI安全治理,旨在通过可验证的数学方法评估AGI安全风险。

Source data for the AGI safety forecast gauges. Contains Putnam 2025 coverage data: 10/12 problems have Lean 4 structure landed, with 4/12 GREEN Lean-discharged (A1, A5, B4, B6). Includes baseline tracking (5 baseline + 134 Putnam tracked), runtime score via judge-consensus match, Pac-Bayes bound calculations, and gauge calibration records. Data feeds the agi-forecast-viewer space and the agi-forecast-platform static site, with all-12 formalization in progress in lutar-lean. Focuses on formal verification, Lean proofs, and AI safety governance for assessing AGI risks through verifiable mathematical methods.

提供机构:
SZLHOLDINGS
原始信息汇总

数据集概述:AGI Forecast Source — Safety Gauge Data

  • 数据集名称: AGI Forecast Source — Safety Gauge Data
  • 维护组织: SZLHOLDINGS
  • 数据集标识: agi-forecast-source
  • 任务类别: Other (其他)
  • 语言: 英语 (English)
  • 数据集规模: 小于1K (n<1K)
  • 许可证: Apache-2.0
  • 标签: formal-verification, lean4, mathlib, dsse, governance, agentic-ai, 及其他11个标签。
  • 总文件大小: 92.2 kB
  • 近月下载量: 105

核心内容与目的

该数据集是AGI安全预测仪表盘(Safety Gauge)的源数据,其核心数据包含了 2025年普特南数学竞赛(Putnam 2025)的覆盖数据。该数据集的每一个数字都关联到具体的CI日志、Lean证明或Zenodo DOI,遵循“无营销语言”原则。

关键数据指标(State,截至2026-05-30)

指标 数值
Lean声明 (Lean declarations) 626
Lean公理 (Lean axioms) 15 (14个唯一)
Lean待办项 (Lean sorries) 189个总数(138个基线 + 51个普特南)
锚定公式 (Anchor formulas) 40个已指定
内核 (Kernel green) Mathlib 4.13.0 d7317655
HuggingFace Spaces 27个 (属于SZLHOLDINGS组织)
HuggingFace Datasets 31个 (属于SZLHOLDINGS组织)
Zenodo DOI 6个发布版 + 1个概念别名 (主DOI: 10.5281/zenodo.20434276)
RAE-1协议 (RAE-1 protocol) 已合并
Putnam 2025覆盖率 10/12 个问题已确立结构;4/12 为GREEN状态(已通过Lean完成证明: A1, A5, B4, B6);2个为TRACKED状态(A2, B1);6个为阶段性建议状态(未证明)。

数据来源与交叉引用

  • 论文 (Thesis): Ouroboros Thesis v18 · DOI 10.5281/zenodo.20434276
  • Lean 关联仓库 (Lean companion): lutar-lean · DOI 10.5281/zenodo.20424992
  • 收据 (Receipts): MCP server · szlholdings-mcp-receipts-server.hf.space
  • 测试结果 (Test results): SZLHOLDINGS/test-results
  • 目录 (Catalog): SZLHOLDINGS on HuggingFace
  • 源代码 (Source): agi-forecast-source on GitHub
  • 作者: Stephen Paul Lutar Jr. · ORCID 0009-0001-0110-4173
  • 生态系统阶段 (Ecosystem stage): generated-mirror
搜集汇总
数据集介绍
SZLHOLDINGS/agi-forecast-source 数据集图片
构建方式
AGI Forecast Source — Safety Gauge Data 数据集由 SZLHOLDINGS 团队构建,专注于为通用人工智能(AGI)安全评估提供可验证的量化指标。其构建依托于 Lean 4 形式化验证工具与 mathlib 数学库,通过将 Putnam 2025 数学竞赛题目转化为 Lean 语言的结构化证明,形成涵盖问题描述、证明进度与验证状态的标准化数据记录。数据集采用 Doctrine v7 准则,确保每条数据均可追溯至持续集成日志、Lean 证明或 Zenodo DOI,从而杜绝模糊营销语言,实现完全可复现的透明度。
使用方法
研究人员可通过 Hugging Face Spaces 上的 agi-forecast-viewer 可视化界面或 agi-forecast-platform 静态站点直接检索与浏览数据集内容。每个数据条目均链接至 lutar-lean 代码仓库的具体提交、持续集成流水线结果或 Zenodo 发布的正式记录,支持用户从原始证明细节到聚合状态的全链路核查。此外,MCP 服务器提供了实时访问接口,方便将其集成至自动化评估管线或智能体系统中,用于验证 AGI 安全仪表盘的底层数据源。
背景与挑战
背景概述
AGI Forecast Source — Safety Gauge Data 数据集由 Stephen Paul Lutar Jr. 于 2025 年创建,依托于 SZLHOLDINGS 机构,旨在通过形式化验证与安全度量标准评估通用人工智能(AGI)的安全进展。该数据集的核心研究问题围绕如何量化 AGI 能力的安全边界,特别是结合 Lean 4 定理证明器对 Putnam 数学竞赛题目进行形式化验证,以构建可审计的安全指标。数据集当前已覆盖 10/12 道 Putnam 2025 题目结构,其中 4 道通过 Lean 完全消解,并提供了 626 个 Lean 声明与 189 个待证明漏洞追踪。其影响力体现在为 AGI 安全预测提供了可复现、可验证的基准,推动了形式化方法在 AI 治理中的应用。
当前挑战
该数据集面临的核心挑战包括:其一,在领域问题上,需要解决 AGI 安全评测中缺乏严谨、可审计度量标准的问题,传统方法依赖于主观判断或黑盒评估,而形式化验证要求将数学问题与安全指标严格绑定,这在复杂推理任务中极具难度。其二,在构建过程中,Lean 形式化验证面临大量待证明漏洞(189 个“sorries”),其中 51 个来自 Putnam 题目,需协调社区力量逐步消解;同时,数据集的 provenance 与可再现性依赖于跨系统集成(如 Zenodo、GitHub、HuggingFace Spaces),确保每个数据点均可追溯至 CI 日志或 DOI,这对数据治理架构提出了高要求。
常用场景
经典使用场景
AGI Forecast Source — Safety Gauge Data 数据集的核心用途在于为通用人工智能(AGI)安全预测提供可验证的量化基准。该数据集整合了 Putnam 2025 数学竞赛问题的形式化验证进度,其中 10/12 的问题已建立 Lean 4 定理证明器结构,4/12 的问题通过机器证明完全消解。研究人员可据此评估前沿推理系统在高等数学形式化方面的能力边界,并校准 AGI 安全仪表盘上的风险指标。
解决学术问题
该数据集旨在解决 AGI 安全评估中缺乏可审计、可复现量化指标的核心难题。通过将数学竞赛问题转化为 Lean 形式化证明的状态矩阵,它提供了客观衡量推理系统数学能力的标尺。学术上,它支持对形式化验证覆盖率、公理依赖缺口(A1–A18)以及证明漏洞(sorries)进行细粒度分析,从而量化当前 AGI 系统在严谨数学推理上的局限,推动安全仪表盘理论与实证检验的结合。
实际应用
实际应用中,该数据集驱动了多个公开仪表盘与决策支持系统,例如 agi-forecast-viewer 交互式可视化和 agi-forecast-platform 静态站点。这些界面将 Lean 证明状态、公理缺口与安全评级实时呈现给政策制定者、研究机构与审计方。此外,数据通过 MCP 网关与 RAE-1 协议对接,支持自动化安全仪表盘的持续校准,为 AGI 部署前的风险预警提供可操作的工程化工具。
数据集最近研究
最新研究方向
基于形式化验证的AGI安全预测指标数据集——AGI Forecast Source正引领人工智能治理与数学定理机器证明的交叉前沿。该数据集通过Lean 4证明助手对Putnam 2025数学竞赛问题开展结构化形式化验证,目前已实现10/12题的结构落地与4/12题的完整Lean证明(A1、A5、B4、B6),标志着智能体推理可验证性研究取得里程碑式突破。其创新的DSSE-PAEv1溯源协议与RAE-1评估框架,将每个指标解析至CI日志或Zenodo DOI,构建起去营销化的透明研究范式。该工作融合了形式化数学、机器证明置信度校准与AI安全治理,为通用人工智能(AGI)的发展提供可审计的安全基准,深刻影响着AI对齐研究与数学形式化基础设施的建设方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务