Pentesting-rag-dataset-2025
收藏资源简介:
这是一个用于检索增强生成(RAG)管道和个人网络安全学习的结构化知识库数据集。数据集包含网络安全相关的多个主题,如Web安全、网络渗透测试、后渗透技术等。数据集仅用于教育目的和授权的安全研究,禁止用于非法目的。
This is a structured knowledge base dataset intended for retrieval-augmented generation (RAG) pipelines and personal cybersecurity learning. The dataset covers multiple cybersecurity-related topics, including Web security, network penetration testing, post-exploitation techniques, and so on. This dataset is solely for educational purposes and authorized security research, and any illegal use is prohibited.
Pentesting-rag-dataset-2025 数据集概述
数据集基本信息
- 数据集名称:Pentesting-rag-dataset-2025
- 主要用途:为检索增强生成(RAG)管道提供结构化的网络安全知识库,用于个人学习、CTF准备以及在授权环境中的安全研究。
- 生成来源:由Anthropic公司的AI助手Claude生成。
- 知识时效性:数据集知识内容有意限定至2025年,不包含2026年的最新CVE、零日漏洞或利用技术。
数据集结构与内容
数据集根目录为 rag_pentesting_dataset/,包含以下子目录和文件:
文档索引
README_INDEX.md:设置指南(包含LangChain、Ollama配置说明)。
分类文档
-
Web安全 (
web/)owasp_top10_2025.md:OWASP Top 10 2025(所有类别)。xss_complete.md:XSS载荷、WAF绕过、BeEF相关内容。
-
网络 (
network/)network_pentesting.md:Nmap、SMB、Active Directory、权限维持相关内容。
-
工具 (
tools/)metasploit_postex.md:Metasploit、反向Shell、权限提升相关内容。
-
方法论 (
methodology/)pentest_methodology.md:渗透测试执行标准(PTES)、MITRE ATT&CK v16、漏洞赏金相关内容。
-
CTF (
ctf/)ctf_techniques.md:Web、密码学、取证、二进制漏洞利用、开源情报(OSINT)技术。
-
AI安全 (
ai_security/)ai_llm_security_2025.md:OWASP LLM Top 10 2025、云安全、容器安全相关内容。
-
速查表 (
cheatsheets/)master_cheatsheet.md:快速参考、单行命令、端口对照表、哈希类型、工具、认证相关信息。
涵盖主题范围
| 类别 | 主题 |
|---|---|
| Web安全 | OWASP Top 10 2025, SQL注入, XSS, SSRF, XXE, LFI, SSTI, JWT |
| 网络 | Nmap, SMB, Active Directory, Kerberoasting, 权限维持 |
| 后渗透 | Metasploit, 反向Shell, Linux/Windows权限提升 |
| 方法论 | PTES, MITRE ATT&CK v16, CVSS v3.1, 报告编写 |
| CTF | Web, 密码学, 取证, 二进制漏洞利用, OSINT |
| AI安全 | OWASP LLM Top 10 2025, 提示词注入, 云安全 |
| 速查表 | 端口, 单行命令, 哈希类型, 工具, 认证 |
快速RAG设置
数据集提供了使用Ollama(本地、私有)和OpenAI进行RAG管道设置的代码示例,核心步骤包括文档加载、文本分块、向量化存储与检索。
使用目的与限制
适用用途 (✅)
- 用于检索增强生成(RAG),以增强LLM在安全知识方面的回答。
- 个人学习和研究道德黑客概念。
- 在授权环境中进行CTF准备和安全研究。
- 构建网络安全教育工具。
禁止用途 (❌)
- 禁止用于微调语言模型以用于攻击目的(在大多数司法管辖区属非法,并违反Anthropic使用政策)。
- 禁止用于未经授权的渗透测试(例如,攻击未经明确书面许可的系统)。
- 禁止任何形式的恶意使用。
法律与道德使用要求
使用本数据集进行实践时,必须始终事先获得明确的书面授权。建议仅在专用实验环境中进行练习,例如:
- TryHackMe (https://tryhackme.com)
- HackTheBox (https://hackthebox.com)
- VulnHub (https://vulnhub.com)
- DVWA (https://dvwa.co.uk)
对于最新的威胁情报,应咨询授权来源,例如:
- NVD (https://nvd.nist.gov)
- MITRE CVE (https://cve.mitre.org)
- CISA Advisories (https://www.cisa.gov/known-exploited-vulnerabilities-catalog)





