HackerSignal
收藏资源简介:
HackerSignal是一个大规模、多源的数据集,通过共享的CVE标识符空间将黑客社区讨论、漏洞利用数据库、漏洞公告和修复提交联系起来。数据集包含7,447,646条文档,覆盖64个公共论坛/来源,时间跨度为1988年至2026年。数据分为8个来源层,包括黑客社区论坛帖子、发布的漏洞利用代码和公告、NVD CVE描述、安全问答内容、供应商公告、公开的漏洞赏金报告、漏洞修复提交消息以及活跃利用指标。数据集支持三个基准任务:CVE链接检索(CVE-R)、漏洞利用类型分类(ETC)和时间泛化(TG)。每个记录包含统一ID、来源数据集、来源层、文本、时间戳、论坛ID、作者哈希和发布模式等字段。数据集遵循特定的发布治理规则,包括可重新分发的文本、研究用文本和仅元数据/指针。使用限制包括仅用于防御性网络安全研究,禁止用于自动漏洞利用代码生成或恶意软件训练等用途。数据集存在已知问题,如HuggingFace数据集查看器行数显示不完整、内容扫描器警告等,并存在英语语言偏向、历史论坛数据偏向2015-2017年等局限性。
HackerSignal is a large-scale, multi-source dataset that links hacker community discussions, exploit databases, vulnerability announcements, and fix commits through a shared CVE identifier space. The dataset contains 7,447,646 documents, covering 64 public forums/sources, spanning from 1988 to 2026. The data is divided into 8 source layers, including hacker community forum posts, published exploit code and announcements, NVD CVE descriptions, security Q&A content, vendor announcements, public bug bounty reports, vulnerability fix commit messages, and active exploit indicators. The dataset supports three benchmark tasks: CVE link retrieval (CVE-R), exploit type classification (ETC), and temporal generalization (TG). Each record contains fields such as a unified ID, source dataset, source layer, text, timestamp, forum ID, author hash, and publication mode. The dataset follows specific release governance rules, including redistributable text, research-only text, and metadata/pointers only. Usage restrictions include use only for defensive cybersecurity research, prohibiting uses such as automated exploit code generation or malware training. The dataset has known issues, such as incomplete row display in the HuggingFace dataset viewer, content scanner warnings, etc., and has limitations such as English language bias and historical forum data bias towards 2015-2017.
HackerSignal 数据集详情
数据集概览
| 属性 | 数值 |
|---|---|
| 文档数量 | 7,447,646(精确去重后) |
| 数据来源 | 64 个公开论坛/来源标识符 |
| 来源层级 | 8 层 |
| 时间跨度 | 1988 年 - 2026 年 |
| CVE 关联行数 | 360,004 |
| 基准任务 | 3 个 |
语言与许可
- 语言:英语、中文、俄语
- 许可证:CC BY 4.0
数据集规模
- 大小范围:1M ~ 10M 条记录
- 完整数据集:单个数据集分割(
full),包含 7,447,646 条示例 - 样本数据集:10,000 条分层抽样子集
数据来源层级
| 层级 | 描述 | 行数 |
|---|---|---|
hacker_community |
黑客/安全社区的论坛帖子 | 6,974,128 |
exploit_archive |
已发布的利用代码和安全公告 | 197,393 |
vulnerability_reference |
NVD 的 CVE 描述和结构化公告 | 150,916 |
exploit_qa_reference |
安全问答和教程内容 | 68,791 |
advisory_reference |
供应商和第三方安全公告 | 30,361 |
bug_bounty_disclosure |
公开的漏洞赏金报告 | 13,720 |
fix_commit_reference |
漏洞修复提交信息 | 11,104 |
exploitation_reference |
活跃利用指标(CISA KEV) | 1,233 |
任务类别
- 文本分类(text-classification)
- 文本检索(text-retrieval)
基准任务
任务 1:CVE 链接检索 (CVE-R)
跨来源时序分布外实体定位:给定利用/公告证据文本,从包含 340K 条描述的语料库中检索正确的 NVD CVE 条目。
| 分割 | 行数 |
|---|---|
| 训练集 | 56,692 |
| 验证集 | 2,584 |
| 测试集 | 1,990 |
| 语料库 | 340,536 |
任务 2:利用类型分类 (ETC)
8 类时序分布外分类:将利用帖子按类型分为注入、XSS、内存损坏、DoS、文件包含、认证/访问绕过、RCE 和信息泄露。
| 分割 | 行数 |
|---|---|
| 训练集 | 64,413 |
| 验证集 | 4,735 |
| 测试集 | 1,735 |
任务 3:时间泛化 (TG)
与任务 1 相同的检索公式,但具有严格的 CVE 不重叠约束:训练集和测试集的 CVE 集合互不相交。
| 分割 | 行数 |
|---|---|
| 训练集 | 56,833 |
| 验证集 | 2,535 |
| 测试集 | 1,898 |
| 语料库 | 340,536 |
数据特征
主要语料库每条记录包含以下字段:
| 字段名 | 类型 | 描述 |
|---|---|---|
unified_id |
字符串 | SHA-256 派生的发布标识符 |
source_dataset |
字符串 | 输入源文件或数据集名称 |
source_file |
字符串 | 源文件名 |
source_format |
字符串 | 源文件格式 |
source_layer |
字符串 | 标准化层级 |
source_record_id |
字符串 | 源记录标识符 |
forum_id |
字符串 | 来源标识符 |
timestamp |
字符串 | ISO 8601 格式的 UTC 发布时间 |
author_hash |
字符串 | SHA-256 假名化作者 |
text |
字符串 | UTF-8 帖子/公告文本(最长 8000 字符) |
text_raw |
字符串 | 原始文本 |
text_length |
整数 | 处理文本长度 |
text_raw_length |
整数 | 原始文本长度 |
text_sha256 |
字符串 | 处理文本的 SHA-256 哈希 |
text_raw_sha256 |
字符串 | 原始文本的 SHA-256 哈希 |
thread_url |
字符串 | 帖子 URL |
thread_title |
字符串 | 帖子标题 |
section |
字符串 | 板块信息 |
post_index |
整数 | 帖子索引 |
post_id |
字符串 | 帖子标识符 |
thread_id |
字符串 | 帖子标识符 |
scraped_at |
字符串 | 爬取时间 |
reply_count |
整数 | 回复数 |
view_count |
整数 | 查看数 |
tags |
字符串序列 | 标签 |
cve_refs |
字符串序列 | CVE 引用 |
dataset_generated_at |
字符串 | 数据集生成时间 |
release_mode |
字符串 | 发布模式 |
released_artifact |
字符串 | 发布产物 |
redaction_reason |
字符串 | 编辑原因 |
数据集配置
该数据集提供多种配置:
- default:完整数据集(
unified_hacker_communities_neurips_public.jsonl),包含全部记录 - sample:10K 分层样本(
hackersignal_sample_10k.jsonl) - task1_cve_linkage:CVE 链接检索基准任务(包含训练、验证、测试和语料库分割)
- task2_exploit_type:利用类型分类基准任务(包含训练、验证、测试分割)
- task3_temporal_generalization:时间泛化基准任务(包含训练、验证、测试和语料库分割)
发布管理
记录根据来源遵循特定的发布模式:
redistributable_text(5 个来源):完整文本在公共领域或 CC 许可下包含research_text_with_terms(9 个来源):包含文本并注明来源,禁止商业使用metadata_or_pointer_only(13 个来源):仅包含元数据、时间戳、CVE 引用、文本哈希和长度;原始文本不提供




