遇见数据集

HackerOne Disclosed Reports

收藏
github2026-08-30 更新2026-09-01 收录
官方服务:

资源简介:

包含12,447条公开HackerOne披露的可搜索、可复现的索引,分为32种攻击类别,具有正文可用性、CSV/JSON导出和研究控制台。

创建时间:
2026-08-30
原始信息汇总

数据集概述

HackerOne Disclosed Reports 是一个可搜索、可复现的 HackerOne 公开漏洞披露报告索引数据集,旨在将 HackerOne Hacktivity 的公开数据转化为适合研究使用的语料库。该数据集通过分区枚举、确定性去重、攻击类标签等方式,提供了完整的公开披露报告内容、公开时间线以及规范的 HackerOne 来源信息,便于安全研究人员进行漏洞模式研究、构建安全数据集或按弱点分类浏览披露。

数据规模与快照

指标 数量
公开披露报告总数 12,447
包含完整披露正文的报告数 9,742
攻击类(Attack Classes)数量 32
项目(Programs)数量 340
研究人员(Researchers)数量 4,940
仅含参考编号的遗留 ID 数 2,698

数据快照日期为 2026年8月30日,报告数量会随 HackerOne 的发布、撤回或更新而变化。

数据集内容与格式

  • data/reports.json:完整的规范化报告索引,每条记录包含报告元数据、主要攻击类、可选次要标签及分类置信度。
  • data/reports.csv:适用于笔记本和数据库的扁平化导出。
  • data/manifest.json:包含计数、来源、分类统计和源摘要信息。
  • data/body-available-report-ids.txt:具有非空公开披露正文的报告 ID 列表。
  • data/legacy-reference-only-ids.txt:在当前快照中不可用、经交叉核对的 ID 列表。
  • reports/ 目录:为每份公开披露提供一份 Markdown 格式记录,其中 9,742 份包含完整的披露正文和公开时间线。
  • attack-classes/ 目录:提供按攻击类整理的索引。

方法论

  1. 突破 10,000 条结果窗口限制:Hacktivity 单次分页查询上限为 10,000 条,该数据集通过联合不重叠的披露日期分区和严重性分区,再按报告 ID 进行规范化与去重,最终获得包含 12,447 条报告的完整快照。
  2. 攻击分类:每条当前报告分配一个主要攻击类,并可能附加次要标签。分类依据依次为结构化弱点或 CWE 元数据(高置信度)、报告标题中的证据(中置信度),以及无法判断时归为 Other / Unclassified(低置信度)。标签仅用于发现和分组,不代表可利用性或实际影响。

使用方式

  • 克隆仓库后可直接通过命令行查询数据,无需额外应用配置,例如使用 jq 统计具有正文的报告数量。
  • 可通过研究控制台(https://kushalkhemka.github.io/hackerone-disclosed-reports/)进行可视化搜索、过滤和阅读格式化披露内容。
  • 数据文件支持直接下载用于分析。

许可与来源

该项目为独立项目,与 HackerOne 无关联或背书关系。仓库所有者声明公开披露语料库已获授权复制。HackerOne 页面仍是后续编辑和附件下载的规范来源。原始代码和文档采用 MIT 许可证,该许可证不涵盖第三方报告文本,报告作者和项目保留各自权利。

搜集汇总
数据集介绍
HackerOne Disclosed Reports 数据集图片
构建方式
该数据集通过分区枚举与确定性去重策略,突破了Hacktivity平台单次查询10,000条结果的限制,整合了12,447份公开披露报告。构建过程融合了非重叠的披露日期分区与独立严重性分区,并对每条记录按报告ID进行归一化处理,确保数据的完整性与一致性。所有报告均经过攻击类别标注流程,优先依据结构化弱点或CWE元数据,其次依据报告标题中的证据,最后归入“其他/未分类”类别,并附带置信度评级。此外,数据集保留了9,742份完整披露正文,以Markdown格式存储,同时剔除了认证材料、内部时间线事件及临时签名URL等敏感信息,确保研究语料的纯净性与可复现性。
使用方法
数据集提供了即取即用的灵活使用路径。研究者可通过Git克隆命令快速获取快照,直接使用jq等工具查询JSON格式的完整索引,例如筛选含有正文的报告数量。可视化研究控制台支持搜索、过滤与格式化披露阅读,适合交互式探索。对于编程分析,可下载扁平化CSV文件导入数据库或Notebook,或直接遍历reports/目录下的Markdown记录以获取涵盖完整披露文本的训练语料。此外,数据集的manifests文件记录了来源摘要与统计信息,便于版本追踪。开发人员还可通过npm脚本重建语料库,但需遵循既有生成流程,确保数据验证与合规性。
背景与挑战
背景概述
HackerOne作为全球领先的漏洞赏金平台,汇聚了众多安全研究者的发现,其公开披露的报告蕴含了丰富的漏洞情报。然而,平台检索界面的分页限制(10,000条结果上限)成为研究者获取完整数据的屏障。该数据集由Kushalkhemka于2026年创建,旨在打破这一壁垒,通过分区枚举与确定性去重技术,构建了一个包含12,447份公开报告的完整语料库,并附有9,742份详尽的披露正文。此项目为漏洞模式研究、安全数据集构建及防御策略制定提供了坚实的数据基础,对网络安全领域的研究范式产生了深远影响。
当前挑战
该数据集面临的挑战多维且复杂。首要挑战在于突破HackerOne平台查询窗口的限制,采用分区枚举策略以确保数据的完整性和准确性,同时需处理报告的实时变动。其次,攻击分类的自动化需在缺乏结构化元数据时,依赖报告标题的启发式推断,其准确性直接影响研究的可靠性。此外,构建过程中需妥善处理权限与隐私问题,如排除认证材料、内部时间线事件及临时签名URL,同时确保数据来源的合法性与交叉验证,以维护学术研究的严谨性和伦理标准。
常用场景
经典使用场景
HackerOne Disclosed Reports数据集的核心用途在于为网络安全研究提供系统化的漏洞披露语料库。研究者可借此开展漏洞模式挖掘、攻击类别分布分析及时间序列演进研究,亦可作为基准测试集验证自动化漏洞检测与分类算法的有效性。该语料库涵盖12,447份公开报告,包含9,742份完整披露文本,支持对弱点标签(如CWE)的细粒度检索,便于从宏观统计到微观叙事的多层次分析。
解决学术问题
该数据集破解了安全领域长期存在的数据碎片化与非标准化难题。通过分区枚举策略突破Hacktivity平台10,000条结果的分页限制,构建了超越搜索窗口的完整快照;结合确定性去重与攻击类别标注,为学术研究提供了高置信度、结构清晰的漏洞样本。其规范化的元数据与完整的披露正文,使研究者得以进行可复现的实证研究,如漏洞生命周期分析、众测平台效率评估,以及攻击模式与软件弱点间的关联建模,推动了实证软件工程与安全度量学的发展。
实际应用
在实际应用中,该数据集可直接赋能企业安全团队与漏洞悬赏平台。安全团队可利用其Markdown格式的披露正文进行内部知识库建设,或训练基于大语言模型的漏洞报告摘要与分类工具,提升漏洞分诊效率。平台运营方则能依据攻击类别分布优化赏金策略,识别高危漏洞热点领域。此外,该语料库支持自动化脚本直接消费JSON/CSV接口,便于集成至安全运营流水线,实现实时的漏洞情报关联分析与风险预警。
数据集最近研究
最新研究方向
该数据集聚焦于网络安全漏洞披露的规模化与结构化研究,通过突破Hacktivity平台10,000条结果的分页限制,构建了包含12,447份公开报告、9,742份完整披露正文的语料库。其前沿方向在于利用攻击类别标注与时间线信息,支持漏洞模式的深度学习、安全知识图谱构建及自动化漏洞分类模型的训练。伴随着全球漏洞赏金生态的蓬勃发展与AI辅助安全分析的兴起,该数据集为研究者提供了高保真、可复现的研究基础,推动了从被动漏洞收集向主动安全智能分析的范式转变,对威胁情报共享与软件供应链安全具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务