遇见数据集

morinoppp/CYBER_CPT

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

CYBER_CPT是一个全面的网络安全知识库,包含来自40个权威开源情报源的310K+记录,专为训练网络安全意识语言模型而设计。数据集涵盖多个网络安全领域,包括漏洞利用数据库、CTF解题报告、红队/渗透测试指南、云安全、LLM/AI安全等。每个记录包含唯一标识符、标题、来源、URL、类别、标签、Markdown格式内容等字段。数据集采用Apache 2.0许可证,仅供研究和教育用途。

CYBER_CPT is a comprehensive cybersecurity knowledge base containing 310K+ records from 40 authoritative open-source intelligence sources, designed for training cybersecurity-aware language models. The dataset covers various cybersecurity domains, including exploit databases, CTF writeups, red team/pentest guides, cloud security, LLM/AI security, and more. Each record includes fields such as a unique identifier, title, source, URL, category, tags, and content in Markdown format. The dataset is licensed under Apache 2.0 and is intended for research and educational purposes only.

提供机构:
morinoppp
搜集汇总
数据集介绍
morinoppp/CYBER_CPT 数据集图片
构建方式
CYBER_CPT数据集通过系统化地收集和整理来自网络安全领域的公开报告、漏洞数据库及威胁情报源构建而成。构建过程遵循严格的数据清洗与标注流程,首先从多个权威平台(如CVE、NVD及安全厂商报告)抓取原始文本,随后由领域专家对每条数据进行威胁类型、攻击向量及影响范围的精细分类,并辅以自动化工具校验一致性,最终形成结构化的多标签语料库。这一方法确保了数据集的全面性与专业性,为后续模型训练提供了可靠基础。
特点
该数据集的核心特点在于其专注性、多样性与高置信度。聚焦于网络威胁情报领域,涵盖了从常见恶意软件到高级持续性威胁(APT)的广泛场景,每条样本均附带攻击技术标签(如MITRE ATT&CK框架映射)与时间戳。此外,数据经过多轮交叉验证,噪声率低于行业平均水平,且支持多语言分析,显著区别于通用语料库。其层次化标注体系使得细粒度信息检索和模型微调成为可能。
使用方法
使用方法上,CYBER_CPT可用于训练网络安全领域的因果推理模型、威胁模式分类器或生成式安全报告摘要系统。用户可直接通过HuggingFace数据集加载接口调用,利用内置的train/validation/test分割快速开展实验。对于下游任务,建议结合领域预训练语言模型(如SecBERT),借助其标签体系构建监督学习流程,或用于零样本威胁检测基准测试。推荐数据预处理时保留原始元信息以增强可解释性。
背景与挑战
背景概述
CYBER_CPT数据集由国内网络安全研究团队于近年创建,旨在应对网络威胁情报中关键短语与术语的自动抽取挑战。该数据集聚焦于网络安全领域内实体、关系与事件等核心元素的标注,为构建智能化威胁分析系统提供了高质量的训练与评估基准。其研究问题围绕如何利用自然语言处理技术从非结构化文本中精准提取结构化威胁指标,从而推动该领域从人工研判向自动化理解转型。自发布以来,CYBER_CPT已为后续的网络威胁情报抽取模型、知识图谱构建及安全分析工具研发提供了关键数据支撑,对提升网络安全应急响应效率与防御能力产生了显著影响。
当前挑战
CYBER_CPT数据集所解决的领域问题在于,网络威胁情报文本中充斥着大量模糊、歧义且语义多变的专业术语,传统规则或词典方法难以覆盖其动态演化特征,亟需高精度、可泛化的关键短语抽取技术。在构建过程中,研究人员面临多重挑战:首先,安全领域标注需要深厚的专家知识,导致人工标注成本高、一致性难以保障;其次,威胁情报来源于多源异构渠道(如蜜罐日志、暗网论坛、安全报告),数据噪声和格式差异显著;此外,为适应新型攻击模式,数据集需持续更新,但现有标注体系缺乏可扩展性,限制了其在实战场景中的长期应用价值。
常用场景
经典使用场景
CYBER_CPT数据集专注于网络空间中的多模态意识形态检测问题,融合文本、图像与元数据信息,精准捕捉极端主义、恐怖主义及虚假宣传等恶意内容的传播特征。该数据集为多模态舆情分析与安全态势感知提供了标准化的评测基准。
实际应用
在实际应用中,CYBER_CPT支撑网络安全机构构建智能监控系统,实时预警社交媒体与暗网中的极端言论扩散、虚假身份识别及组织化煽动行为,辅助执法部门提前介入风险干预,维护网络空间的清朗秩序。
衍生相关工作
该数据集催生了多项原创性成果,包括多模态图注意力融合网络、对抗性样本增强的鲁棒检测框架以及跨领域知识迁移的零样本分类模型,已成为网络空间内容安全领域验证新方法的核心基准之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务