遇见数据集

pentest-dataset

收藏
github2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

面向Agentic AI/渗透测试AI的本地数据集:完整的CVE集合(NVD完整转储)、Exploit-DB的漏洞利用/PoC以及GitHub的writeup仓库——通过SQLite+FTS5索引,使agent能够快速查询。

Local dataset for Agentic AI / Penetration Testing AI: Complete CVE collection (full NVD dump), exploit scripts/PoCs from Exploit-DB, and writeup repositories on GitHub, all indexed via SQLite + FTS5 to enable fast querying by AI agents.

创建时间:
2026-08-06
原始信息汇总

数据集概述

pentest-dataset 是一个面向 Agentic AI 和渗透测试 AI 的本地化数据集,整合了完整的 CVE 数据(NVD 全量转储)、Exploit-DB 漏洞利用及 PoC 资源,以及 GitHub 上的漏洞 writeup 仓库,并通过 SQLite + FTS5 全文索引实现高效查询。

数据规模与内容

数据类型 来源 规模
CVE 漏洞数据 NVD 全量转储 约 373k 条
漏洞利用(Exploit/PoC) Exploit-DB(GitLab CSV) 约 46k 条
Writeup 渗透报告 GitHub 仓库浅克隆 约 48k 条
富化评分数据(CVE/CVSS v4/CPE) HuggingFace 的 CIRCL 数据集 15 个分片(每片 ≤13MB)
补丁差异数据(patch diff + commit URL) HuggingFace 的 CIRCL 数据集 随补丁记录存储

数据结构

数据集采用分目录管理,主要数据以 Parquet 格式存储于 data/ 目录:

  • cves/train/data.parquet:NVD CVE 数据
  • exploits/train/data.parquet:Exploit-DB 数据,完整 PoC 文件保存在 data/raw/exploitdb/files/(flat 格式,文件名 = exploitdb_id.ext
  • patches/train/data.parquet:补丁差异(patch diff)及提交 URL
  • scores/train/data_part{0..14}.parquet:CIRCL 富化评分数据
  • writeups/train/data.parquet:GitHub writeup 仓库数据

本地构建时还会生成 dataset.db(SQLite 数据库)、hf/cves/ 等附加目录。

查询方式

数据集支持两种查询接口:

1. 命令行工具(NDJSON 输出,适合 agent 解析)

  • 按 CVE 编号查询并关联漏洞利用:python3 tools/query.py --cve CVE-2024-3400 --with-exploits
  • 全文搜索(FTS5)加严重程度、时间、CVSS 等过滤条件
  • 按产品、CWE、平台搜索漏洞利用或 writeup
  • 查询 HuggingFace 富化数据(覆盖 NVD 转储之外的新 CVE)
  • --stats 查看数据集统计信息

2. SQLite 直接连接(适合 RAG / embedding 流水线)

数据库包含 cvescves_fts(FTS5 全文索引)、exploitswriteups 以及 hf_vuln_scoreshf_vuln_patches 等富化表,JSON 数组类型的列存储于 cves.refscves.ref_tagsexploits.cves 等字段。

构建管道

数据集支持完整重建,通过多个脚本完成:

  1. fetch_nvd.py:下载并提取 NVD 全量数据(支持按年份增量更新,幂等操作)
  2. fetch_exploitdb.py:获取 Exploit-DB 元数据、PoC 和 Markdown
  3. fetch_github_writeups.py:浅克隆 GitHub writeup 仓库
  4. fetch_hf.py:获取 HuggingFace 的 CIRCL 富化数据(漏洞评分、CWE/补丁)
  5. build_index.py:构建 SQLite 数据库(保留 hf_* 表)
  6. export_parquet.py:将 SQLite 导出为 zstd 压缩的 Parquet 格式
  7. push_hf_multi.py:推送 Parquet 到 HuggingFace Hub

法律与伦理说明

数据集明确声明仅用于合法授权的安全测试场景,包括漏洞赏金、CTF 竞赛、私人实验室以及已获许可的研究活动。Exploit-DB 中的漏洞利用和 PoC 仅限在授权环境中使用。

搜集汇总
数据集介绍
pentest-dataset 数据集图片
构建方式
该数据集是针对智能体渗透测试应用而精心构建的本地化综合漏洞情报库。其构建流程遵循模块化设计,通过一系列专有脚本从权威源获取数据:利用fetch_nvd.py下载并解压NVD全量数据,覆盖约37.3万条CVE记录;借助fetch_exploitdb.py抓取Exploit-DB的GitLab CSV元数据及46k个PoC文件;通过fetch_github_writeups.py浅克隆GitHub上的writeup仓库,汇集约4.8万篇技术分析;同时整合HuggingFace上CIRCL的增强数据,包括漏洞评分与补丁差异。所有数据经build_index.py统一索引至SQLite数据库,并启用FTS5全文检索,最终导出为Parquet格式以支持高效存储与分发。
使用方法
该数据集为智能体提供了灵活的交互查询接口。通过命令行工具query.py,用户可按CVE编号、漏洞描述关键词、严重性等级、CVSS评分阈值及时间范围等条件组合检索,输出为JSON Lines格式,天然适配智能体解析。还支持针对writeup和exploit的专项搜索,以及直接查询HuggingFace增强表以获取最新漏洞信息。对于RAG或嵌入流水线,提供了SQLite直连示例,可编程执行全文匹配查询。所有接口设计以机器可读性和查询效率为先,使智能体能够快速定位目标漏洞的相关情报,辅助决策与行动计划生成。
背景与挑战
背景概述
随着人工智能在网络安全领域的深入应用,构建面向渗透测试的智能体(Agentic AI)已成为研究前沿。pentest-dataset数据集由安全研究团队于2024年创建,旨在为这类智能体提供全面的漏洞情报支持。该数据集整合了美国国家漏洞数据库(NVD)的完整CVE记录、Exploit-DB的漏洞利用代码及GitHub上的攻击手法分析报告,并通过SQLite与全文检索(FTS5)技术构建了高效查询接口。其核心研究问题是如何使AI智能体快速、精准地获取漏洞信息,进而辅助自动化渗透测试。该数据集的出现填补了高质量、结构化渗透测试数据的空白,为智能安全测试领域的研究提供了重要基础。
当前挑战
构建该数据集面临诸多挑战。领域层面,漏洞数据来源多样、格式异构,且CVE、Exploit-DB及GitHub报告间的关联错综复杂,需要精确的实体对齐与数据融合技术。此外,漏洞信息时效性强,新漏洞层出不穷,数据集的持续更新与同步成为难点。构建层面,大规模数据抓取与解析需处理网络波动、反爬机制及数据完整性问题;构建高效FTS5索引以平衡查询速度与存储开销亦是挑战。同时,数据清洗与去重、漏洞利用代码的安全存储与授权管理,以及跨平台数据格式的兼容性均需审慎处理,确保数据集在合法合规前提下实现高效、可靠的服务。
常用场景
经典使用场景
穿透测试数据集(pentest-dataset)作为网络安全领域的一项综合性资源,整合了NVD的完整CVE数据、Exploit-DB的漏洞利用代码及GitHub上的渗透测试技术文章。其设计初衷在于为自主式人工智能(Agentic AI)驱动的渗透测试系统提供结构化、可高效查询的数据基础。该数据集最经典的使用场景涵盖:给定特定CVE编号,快速检索相关漏洞利用代码及补丁信息;通过全文检索与多条件过滤(如时间、严重度、CWE类型),辅助安全分析师挖掘特定版本软件的高危漏洞;以及作为漏洞情报语料,用于微调或训练面向网络安全的知识增强生成(RAG)模型。
解决学术问题
此数据集有效解决了网络安全学术研究中长期存在的漏洞数据分散、非结构化且难以自动处理的问题。它通过统一的SQLite+FTS5索引,将超过37万条CVE记录、4.6万条漏洞利用代码和4.8万篇分析报告整合为可机器读取的ORM格式,显著降低了数据获取与预处理的门槛。这一贡献为自动化漏洞检测、漏洞关联分析、风险评估模型训练等研究提供了大规模、高质量的数据支撑,推动了安全领域人工智能应用的发展,尤其是提升了智能Agent对漏洞情报的实时响应与推理能力。
实际应用
在实际应用中,该数据集可直接赋能企业级安全运营中心(SOC)的威胁预警和应急响应流程。安全团队可利用其查询接口,快速定位关键基础设施中软件漏洞的可用利用代码,以评估真实攻击面。同时,该数据集支持安全测试人员构建自动化渗透测试Agent,在合法的渗透测试授权范围内,对目标系统进行漏洞扫描与利用路径规划。此外,基于该数据集生成的补丁信息与漏洞评分,还能辅助安全产品(如SIEM、EDR)增强检测规则,提升对最新攻击手段的防御效能。
数据集最近研究
最新研究方向
该pentest-dataset数据集聚焦于构建面向智能体AI的渗透测试知识库,整合了NVD完整CVE库、Exploit-DB漏洞利用代码及GitHub上的安全研究writeup,通过SQLite+FTS5实现高效检索,为自动化漏洞分析与渗透测试提供结构化数据支撑。最新研究方向包括:利用大规模CVE和exploit数据训练AI模型以辅助漏洞挖掘与攻击路径预测;结合HuggingFace平台上的CIRCL数据集进行漏洞评分与补丁信息增强,提升对未知威胁的响应能力;以及通过全文搜索和结构化查询接口,支持安全智能体快速获取漏洞详情、关联利用代码和修复建议,推动安全测试从人工向智能自动化演进。该数据集的发布顺应了AI驱动安全的研究热潮,为构建自主渗透测试系统、漏洞预警机制及安全知识图谱提供了高质量训练语料,对提升企业安全防护水平、加速漏洞响应流程具有重要的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务