遇见数据集

ai-discovery-data

收藏
github2026-08-15 更新2026-08-17 收录
官方服务:

资源简介:

该数据集旨在跟踪多个领域随时间变化的发现率,并观察近期是否有加速趋势。它包含一系列定义一致、具有可用时间轴和可重建公共数据的子数据集,每个子数据集都附有完整的说明和交互式图表。

This dataset is designed to track temporal changes in discovery rates across multiple domains, and examine whether an accelerating trend has emerged in recent periods. It comprises a series of sub-datasets with consistent definitions, accessible timelines and reconstructable public data, each accompanied by complete documentation and interactive charts.

创建时间:
2026-08-11
原始信息汇总

ai-discovery-data 数据集概览

数据集目的

该数据集旨在追踪多个领域中随时间变化的发现速率,以检验近期是否存在加速趋势。该集合支撑了《LLMs Contribution to Discovery》一文。凡具备一致定义、可用时间轴以及公开可重建数据的时间序列均被纳入;有关AI使用的证据是有用背景信息,但并非必需条件。

数据组织与访问

  • 数据集地址:https://github.com/tecunningham/ai-discovery-data
  • 浏览方式:可通过 https://tecunningham.github.io/ai-discovery-data/ 交互式浏览,每个系列页面内嵌交互式图表,悬停可查看底层记录详情,部分图表支持点击跳转至原始参考来源。
  • 数据构建:页面由 tools/build_docs.py 基于同一份CSV和文档生成。
  • 附加索引:提供配套的累积索引(CUMULATIVE.md),以统一的阶梯函数格式重绘所有系列,展示截至目前的进展。

系列内容

数据集划分为三大类,共包含 29个系列

一、Vulnerabilities(漏洞)

9个系列,涵盖软件漏洞披露与利用情况:

系列名称 覆盖时间 是否加速
curl 漏洞披露 2000–2026(截至2026-06-24) 📈 加速(36次披露,年化约75次,对比2025年9次)
Firefox 漏洞披露 2016–2026(截至2026-08-04) 📈 加速(截至该日342个CVE,对比2025全年210个)
所有软件:已知被利用漏洞(CISA KEV目录) 2021–2026(截至2026-08-10) ➡️ 无加速(年化约293次,对比2025年245次)
Microsoft 安全更新CVE 2016–2026(截至2026-08-11) 📈 加速(截至该日1,927个CVE,2025年1,243个,年化约为2025年的2.5倍)
所有软件:漏洞披露(NVD) 2016–2026(截至2026-08-10) 📈 加速(年化约82,000个CVE,约为2025年49,972个的1.6倍)
OpenSSL 漏洞披露 2002–2026(截至2026-08-05) 📈 加速(截至该日39个CVE,2025全年仅6个)
OSS-Fuzz 漏洞发现 2020–2026(截至2026-08-10) 📉 下降(从2020年1,041条降至2025年244条)
OSV中代表的开源CVE 2016–2026(截至2026-08-10) 📈 加速(年化约35,100个,为2025年15,146个的2.3倍)

二、Open problems(开放问题)

10个系列,追踪多个著名数学问题列表的解答速度:

系列名称 要点 是否加速
Erdős 问题目录 13个月度快照(2025-08-31至2026-08-10);推算解法年份1940–2026 ❓ 尚无定论(2026年推算55个解法,对比2025年33个)
Top 10 Erdős 问题 列表提出于2026-04-16;有日期解法1975–2026 ❓ 尚无定论(2026年仅1个解法,样本过小)
FrontierMath 开放问题 基准于2026-02-26发布;记录解法2026-03-23至08-12共6个 ⏳ 为时尚早
Ben Green 的100个开放问题 2018–2026;有日期解法2019–2025 ➡️ 无加速(2026年0个,对比2025年3个)
Hilbert 问题 列表提出于1900;有日期解法1900–1998 ➡️ 无加速(2026年及1998年以来均为0个)
Landau 问题 列表提出于1912;1912–2026无任何有日期解法 ➡️ 无加速
Millennium Prize 问题 列表提出于2000;仅有1个日期解法(2003) ➡️ 无加速
Smale 问题 列表提出于1998;有日期解法2002–2026 ❓ 尚无定论(仅5个事件)
Thurston 的24个问题 列表提出于1982;有日期解法1993–2013(22个) ➡️ 无加速(2026年及2013年以来均为0个)
The Open Problems Project 列表始于2001;有日期解法2000–2024(17个) ➡️ 无加速(2026年及2024年以来均为0个)

三、Mathematical bounds and records(数学界与纪录)

3个系列,关注数学界与纪录的更新情况:

系列名称 要点 是否加速
AlphaEvolve 问题集清单 共65个问题,31个拥有活跃数值纪录;构建于2026-07-26 ⚪ 基线
AlphaEvolve 相关有限构造纪录 1949–2026,5组问题共22个纪录步骤 ❓ 尚无定论(2026年1个,对比2025年9个)
ANTEDB 解析数论指数 覆盖58个指数切片;文献时段1920–2024;提取自2026-07-26的数据库 ➡️ 无加速(2025或2026年0次变化,对比2024年2次)

关键发现

  • 网络安全领域:多数漏洞披露系列呈现明显加速趋势,尤其是Microsoft、NVD、OpenSSL和OSV系列,2026年数据均达到历史高位。
  • 数学开放问题领域:除Erdős问题目录外,大多数经典问题列表(Hilbert、Landau、Millennium、Thurston等)在2026年均无新增解法,未观察到加速迹象。
  • 数学纪录领域:三个系列均未显示出显著的近期加速,其中AlphaEvolve相关系列因数据点过少而无法判断趋势。
搜集汇总
数据集介绍
ai-discovery-data 数据集图片
构建方式
该数据集旨在系统追踪多个领域内的发现速率随时间的变化,以检验近期是否存在加速现象。其构建遵循严格标准:每个序列须具备一致的定义、可用的时间轴以及公开且可重建的数据源。数据来源于权威公共数据库,如CISA已知被利用漏洞目录、美国国家漏洞数据库(NVD)、微软安全更新指南等,覆盖网络安全漏洞披露、数学开放问题解决进度及数学界纪录更新等多元主题。
使用方法
使用者可直接访问在线的交互式浏览器页面,每一条序列都配有详细的文档说明和可交互的图表,悬停于数据点即可查看原始记录,部分图表还能点击跳转至原始参考文献。同时,仓库提供了整理好的CSV数据文件和构建文档的脚本工具,方便研究者进行二次分析与自定义可视化。此外,一个配套的累积索引将所有序列以统一的格式重绘,便于进行整体趋势的比较与综合研究。
背景与挑战
背景概述
随着人工智能技术的迅猛发展,其在大规模发现任务中的应用日益广泛,引发了学界对AI是否加速科学发现进程的深刻思考。在此背景下,2025年由Tom Cunningham等人创建的ai-discovery-data数据集应运而生,旨在系统性地追踪多个领域内随时间推移的发现速率,以实证检验近年来是否存在加速现象。该数据集整合了跨领域的时间序列数据,涵盖软件漏洞披露(如curl、Firefox、Microsoft等)、数学开放问题解决(如Erdős问题、千禧年难题)以及数学边界与记录(如AlphaEvolve相关进展)等多个维度,为量化分析AI对发现过程的贡献提供了坚实的数据基础。其核心研究问题在于:AI技术的介入是否显著提升了各个领域的发现速率,进而重塑科学研究的范式。凭借其严谨的构建方法论和广泛的数据覆盖,该数据集已迅速成为研究AI与科学发现关系的重要资源,为后续的因果推断与政策制定提供了关键支撑。
当前挑战
该数据集在构建与维护过程中面临诸多挑战。首先,在领域问题层面,如何跨域统一发现速率的定义与度量标准便是一大难题——不同领域(如漏洞披露与数学问题解决)的发现性质与时间尺度差异显著,要求数据进行归一化与可比性处理,确保序列具备一致的定义、可用的时间轴以及公开可重建的来源,方能支撑有效的跨域比较与因果推断。其次,在数据构建层面,收集涵盖数十年跨度的可靠时间序列数据十分棘手,上游数据源存在缺失(例如Microsoft 2016年部分月份文档缺失)、口径不一(如CVE数量在不同数据库中的差异)、以及AI使用证据标注的主观性等问题,均需通过谨慎的敏感性分析与多维验证予以缓解。此外,部分序列(如Landau问题)长期无新进展,导致样本量过小,难以做出统计显著的加速判断。持续维护数据的新鲜度与可重建性同样是长期挑战,要求构建者定期更新快照、追踪最新的决议与披露,并保留完整的数据溯源,以维持数据集的科学可信度。
常用场景
经典使用场景
ai-discovery-data数据集的核心应用在于系统性地追踪跨多个领域(涵盖软件漏洞披露、数学未解难题及数学界限与记录)的发现速率随时间的变化趋势。研究者借助该数据集,通过一致定义的指标与可重建的公共数据序列,直观识别各领域是否出现近期加速现象,特别关注人工智能技术介入后对发现过程的潜在影响。其典型场景包括:绘制CVE披露季度曲线、统计著名数学问题(如Erdős、Hilbert、Smale等)历年解决数量,以及记录有限构造与打包问题中的记录更新步长。这些分析工具支持交互式可视化,便于学者量化AI带来的科研效率变革。
解决学术问题
该数据集有效回应了学术界关于当代科研是否因AI而加速的核心争论。它通过构建标准化时间序列,解决了以往研究依赖零散案例、缺乏统一量化基准的问题,使跨域比较成为可能。例如,数据揭示部分软件漏洞(如curl、Firefox、Microsoft CVEs)近年的加速披露,而数学开放问题(如Landau问题)的解决率并未显著提升,从而为'AI驱动科学加速'假说提供了实证依据。同时,它采用可重建的源数据与灵敏度计数,增强了结论的可靠性与可复现性,为科学计量学与AI影响评估贡献了方法论范式。
实际应用
在现实应用中,该数据集为网络安全策略制定与科研资源配置提供决策支持。网络安全机构可依据漏洞披露加速趋势调整应急响应优先级,企业安全团队能识别AI辅助漏洞挖掘的贡献模式,优化防御投入。科研资助方与政策制定者则能洞察数学领域开放问题的解决动态,评估基础研究瓶颈。此外,数据集的设计模式也可被复制到其他学术领域,作为监测学科进展的通用工具,其交互式页面与API接口降低了使用门槛,便于公共服务平台集成。
数据集最近研究
最新研究方向
该数据集聚焦于量化人工智能在科学发现与漏洞挖掘中的加速效应,通过追踪各领域发现速率的时间演变,揭示大语言模型与自动化工具对研究进程的深层影响。最新研究前沿围绕AI辅助漏洞披露的显著增长,如curl、Firefox及Microsoft安全更新的CVE数量在2026年呈现超越历史的跃升,且报告者中AI标记的比例上升,凸显AI在网络安全攻防中的催化作用。同时,数学开放问题(如Erdős、FrontierMath)的解决动态亦被纳入观测,以评估AI在纯理论创新中的参与度,从而为衡量AI对科研生产力的实际贡献提供跨学科证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务