遇见数据集

leeroy-jankins/NIST-CyberSecurity-Framework

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

NIST网络安全框架2.0问答数据集是一个基于NIST网络安全框架(CSF)2.0的合成指令式问答数据集。该数据集旨在支持与网络安全风险管理、网络安全治理、企业风险管理、供应链风险管理、事件响应、恢复规划以及组织网络安全通信相关的训练、微调、检索评估和领域特定问答用例。源文档将CSF 2.0描述为一个灵活的框架,帮助组织理解、评估、优先排序和沟通网络安全风险,适用于各种规模和行业,包括工业、政府、学术界和非营利组织。数据集包含200条记录,采用对话式问答结构,每条记录包括ID、用户标签、问题、助手标签和答案。

The NIST Cybersecurity Framework 2.0 Question Answering Dataset is a synthetic instructional question-answering dataset built upon the NIST Cybersecurity Framework (CSF) 2.0. This dataset is designed to support training, fine-tuning, retrieval evaluation, and domain-specific question-answering use cases related to cybersecurity risk management, cybersecurity governance, enterprise risk management, supply chain risk management, incident response, recovery planning, and organizational cybersecurity communication. The source documentation describes CSF 2.0 as a flexible framework that assists organizations in understanding, assessing, prioritizing, and communicating cybersecurity risks, and is suitable for organizations of all scales and across diverse industries including industrial, governmental, academic, and non-profit sectors. The dataset consists of 200 records with a conversational question-answering structure, where each record includes an ID, user tag, question, assistant tag, and answer.

提供机构:
leeroy-jankins
搜集汇总
数据集介绍
leeroy-jankins/NIST-CyberSecurity-Framework 数据集图片
构建方式
该数据集源自美国国家标准与技术研究院(NIST)于2024年2月26日发布的《网络安全框架(CSF)2.0》白皮书(NIST CSWP 29)。通过从涵盖CSF核心、六大功能(治理、识别、保护、检测、响应、恢复)、组织画像、层级及实施示例等核心章节中提取内容,采用合成式指令问答生成方法,构建了200条记录。每条记录遵循用户提问与助手回答的对话结构,答案经摘要与重述而非逐字摘录,确保语义贴合源文档。
特点
数据集以高度结构化的问答对形式呈现,包含唯一标识符、用户问题及基于源文档的精准回答,适用于网络安全风险管理、治理、供应链安全及事件响应等专业场景。其简洁的会话格式便于指令微调与检索增强生成评估,同时覆盖了新兴技术与人工智能风险考量等前沿议题,兼具教育性与实用性。
使用方法
用户可直接加载该数据集用于小型语言模型的领域微调、构建检索增强生成的评估基准,或测试网络安全政策与治理领域的问答系统。建议将其作为教育工具用于网络安全意识培训与组织内部CSF 2.0概念学习,但需注意其合成性质;在高风险应用中应对照官方框架进行完整性、准确性审查,并咨询领域专家。
背景与挑战
背景概述
网络安全风险管理已成为全球各类组织面临的严峻挑战。在此背景下,美国国家标准与技术研究院(NIST)于2024年2月26日发布了《网络安全框架(CSF)2.0》白皮书(NIST CSWP 29),为各类规模与行业的组织提供了理解、评估、优先级排序及沟通网络安全风险的灵活路线图。基于这一权威框架,NIST-CyberSecurity-Framework问答数据集应运而生。该数据集由研究人员通过合成方法从CSF 2.0源文档生成,以问答形式覆盖治理、识别、保护、检测、响应与恢复等六大核心功能,以及供应链风险管理、新兴技术与人工智能风险等前沿议题。作为首个系统化支持NIST CSF 2.0问答与指令微调的合成数据集,它为网络安全治理、风险评估及政策教育领域的研究提供了重要的基准资源,推动了领域内自然语言处理技术的应用。
当前挑战
该数据集面临的核心挑战源于两个层面。在领域问题层面,网络安全风险管理本身具有高度复杂性,现有数据集往往难以精准捕捉CSF 2.0框架中嵌套式的功能-类别-子类别层级结构,以及不同风险场景下的上下文依存关系,导致模型在理解多步骤缓解策略或跨域风险联动时表现欠佳。在构建过程中,合成生成方法带来了知识简化的风险:尽管基于权威源文档,但问答对经过提炼与重述,可能遗漏关键的子类别细则或正式引用,有时会过度概括特定行业的风险应对措施。此外,数据集规模仅含200条记录,难以覆盖CSF 2.0的全部细微差异,且缺乏实时更新的机制,面临框架持续演进与新兴威胁不断涌现带来的时效性挑战。
常用场景
经典使用场景
在网络安全治理与风险管理的学术与工业交汇地带,NIST-CyberSecurity-Framework数据集被广泛用于构建和微调面向政策问答的系统。该数据集以NIST网络安全框架2.0为蓝本,精心构造了200条覆盖治理、识别、保护、检测、响应与恢复等核心主题的问答对,使其成为训练大语言模型理解复杂网络安全政策术语与逻辑关系的理想语料。研究者通常将其作为评测检索增强生成系统在专业领域上的准确性与鲁棒性的基准,尤其适用于需要从非结构化政策文本中提取精准答案的封闭域问答场景。此外,该数据集亦被用于快速原型开发,帮助教育机构或企业内部培训部门搭建能够自动回答框架基础问题的交互式智能助教。
衍生相关工作
围绕该数据集衍生出一系列具有启发性的工作,包括针对政策问答一致性的对抗鲁棒性评测。研究者利用其问答对构建了首个面向CSF 2.0的冲突检测基准,用以衡量大语言模型在回答涉及‘隐私风险管理关系’等易混淆概念时是否存在逻辑矛盾。另一条支线是将其与CVE漏洞库或MITRE ATT&CK框架进行知识对齐,生成了跨本体的安全态势感知图谱,从而实现了从政策高层指引到具体技术手段的推理链路补全。此外,基于该数据集的指令微调范式被推广至其他政策文档(如ISO 27001、GDPR),催生了‘领域自适应策略问答数据集’的生成方法论,显著降低了构建专业领域问答语料的边际成本。社区还将其与检索增强生成管线深度耦合,开发出能够动态引用官方原文并提供置信度分数的解释型问答系统,这为高可靠性要求的网络安全决策支持提供了范式参考。
数据集最近研究
最新研究方向
当前,该数据集聚焦于利用NIST网络安全框架2.0的合成问答数据,赋能网络安全治理与风险管理的语言模型微调及检索增强生成评估。其前沿研究方向涵盖将框架的六大核心功能(治理、识别、保护、检测、响应、恢复)转化为结构化指令数据,以支持组织在供应链风险管理、事件响应与恢复规划等热点领域的智能化决策。伴随2024年NIST CSWP 29的发布,该数据集成为衔接政策文本与AI系统的关键桥梁,推动网络安全知识图谱构建及零信任架构的自动推理,对提升跨行业风险管理标准化与应急响应效率具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务