rmf-ato-core
收藏官方服务:
资源简介:
一个经过策划、具有溯源追踪的数据集,包含当前版本的NIST RMF/ATO出版物以及AI治理文档。
A curated and traceable dataset containing the current versions of NIST RMF/ATO publications and AI governance documents.
创建时间:
2026-08-09
原始信息汇总
数据集概述:rmf-ato-core
rmf-ato-core 是一个经过策划、具备溯源记录的NIST RMF/ATO出版物及AI治理文档数据集构建管道。其核心理念是构建一个小型、当前、结构正确且完全可追溯的数据集,而非海量抓取式语料库。
关键特性
manifest.json为唯一权威:数据集中的每一行数据都严格对应清单中的一条记录,确保内容范围可控。- 控制ID严格限定:控制ID仅来源于OSCAL结构化数据,且必须匹配SP 800-53 Rev 5的20个真实控制族。PDF提取的行不携带控制ID,从根本上杜绝了伪造ID(如
HA-25)的出现。 - 纯文本来源:不包含任何预置提示词、合成问答或预计算嵌入,仅提供原始文本。
- 拒绝内容有据可查:被拒绝的内容均有记录,不会被静默丢弃。
当前构建规模
| 指标 | 数值 |
|---|---|
| 发布行数 | 5,623 |
| Parquet文件大小 | 2.1 MB(单一 train 分割) |
| 文档数量 | 19个已检索,2个等待手动放置 |
| 被拒绝行数 | 921(每条均记录规则与原因) |
| 未通过控制族白名单的ID | 0 |
核心统计数字:
- RMF任务:47个
- AI RMF子类别:72个
- 控制族:20个
- 基线(LOW / MODERATE / HIGH / PRIVACY):149 / 287 / 370 / 96
管道结构与流程
管道阶段:
01 verify -> 02 fetch -> 03 parse OSCAL -> 04 parse PDF -> 05 chunk -> 06 validate -> 07 export -> 08 upload
- 每个阶段均为独立可运行的幂等脚本(存放于
scripts/下),核心函数封装在src/rmf_ato_core/中。 - 多个阶段设有人工审核检查点(详见
BUILD_SPEC.md)。 - 第08阶段(Hugging Face上传)需明确批准后方可运行。
快速开始
bash python -m venv .venv && source .venv/bin/activate pip install -e ".[dev]" pytest -q make verify # 阶段1:清单与URL验证报告
目录结构
| 路径 | 说明 |
|---|---|
manifest.json |
数据源权威:文档、修订版本、URL及解析注释 |
src/rmf_ato_core/schema.py |
行数据结构(Row)、块类型枚举、控制族白名单 |
src/rmf_ato_core/manifest.py |
清单加载/校验及阶段1检查 |
scripts/0*.py |
每个管道阶段的命令行工具 |
data/provenance.json |
每个工件的sha256及检索时间(已提交) |
data/raw, data/interim, data/processed |
构建中间产物(被gitignore) |
dataset_card/README.md |
Hugging Face数据集卡片 |
BUILD_SPEC.md |
本仓库实现的完整规范 |
需手动放置的文档
两个数据源无法脚本化抓取,需在解析前手动放入 data/raw/manual/ 目录:
CNSSI-1253.pdf— 来源:https://www.cnss.gov/CNSS/issuances/Instructions.cfmDoDI-8510.01.pdf— 来源:https://www.esd.whs.mil/DD/DoD-Issuances/
两者均为公开发布文件,其sha256会像其他工件一样记录在provenance中。
许可信息
- 数据集编译版本以 CC0-1.0 许可发布(见
LICENSE)。 - 原始文档为美国政府作品,依据 17 U.S.C. § 105 属于公共领域。
搜集汇总
数据集介绍

构建方式
在网络安全合规领域,NIST RMF/ATO出版物的时效性与可追溯性至关重要。该数据集摒弃了传统的全量抓取模式,转而构建了一套精炼、动态且完全可溯源的流水线。其核心在于以manifest.json为唯一权威,严格枚举文档、修订版与URL,确保每一数据行皆可追溯至单一来源。控制ID仅源自OSCAL结构化数据,并强制校验其必须匹配SP 800-53 Rev 5的20个真实家族,从机制上杜绝了虚构ID的混入。整个流水线包含八个独立可运行的幂等阶段,从验证、抓取到解析、分块,最终导出,中间设有多个手工审查节点,并完整记录被拒绝的条目及其原因。
使用方法
使用者可通过简单的命令行操作快速上手。首先,运行'pip install -e ".[dev]"'安装依赖,接着执行'pytest -q'验证环境,然后使用'make verify'进行第一阶段的清单与URL验证。若需完整重建数据集,运行'make all'即可在约一分钟内生成最终产物。数据集以单train分割的Parquet文件形式提供,可直接加载用于NIST RMF/ATO相关的文本分析、合规性研究或AI治理模型的训练。值得注意的是,对于两个手动文档,需预先放置在指定路径,流水线会自动记录其校验和,确保整个过程的完整性。
背景与挑战
背景概述
网络安全合规领域,NIST RMF(风险管理框架)与ATO(授权运营)文件的系统化管理对组织安全治理至关重要。rmf-ato-core数据集由ezesecops团队构建,旨在创建一个精炼、可溯源且结构严谨的NIST RMF/ATO出版物及AI治理文档集合。与传统大规模抓取语料库不同,该数据集强调“小而精”,通过manifest.json作为唯一权威清单,确保每条数据可追溯到原始文档,且控制ID仅来源于OSCAL结构化数据,严格匹配SP 800-53 Rev 5的20个控制族,杜绝了伪造ID的可能。数据集包含5,623行数据,覆盖47项RMF任务、72项AI RMF子类别及四个基准(LOW/MODERATE/HIGH/PRIVACY),为合规自动化、AI治理研究及安全评估提供了可靠、透明的数据基础,推动了该领域从人工审查向数据驱动决策的转变。
当前挑战
该数据集构建面临多重挑战。首先,领域问题方面,NIST RMF文档体系庞大且更新频繁,不同来源的PDF与OSCAL格式并存,如何从异构文档中提取统一、准确的结构化数据,并确保控制ID与20个控制族严格匹配,是核心难点。其次,构建过程中,需设计可复现的流水线(08个阶段),每个阶段需独立运行且幂等,边缘案例需人工审查,如CNSSI-1253与DoDI-8510.01等手动文件需手动放置,且来源URL需定期验证。此外,数据质量验证严格,921行被拒绝并记录原因,但拒绝规则需平衡漏检与误杀,避免影响数据集完整性。同时,数据集需保持“小而精”的定位,拒绝注入预置提示或合成内容,确保源头纯净,这增加了数据筛选的复杂度。最后,许可证合规要求对政府公开文件进行CC0声明,并确保所有来源可追溯,提升了数据治理的难度。
常用场景
经典使用场景
rmf-ato-core数据集作为NIST风险管理框架(RMF)与授权运营(ATO)领域的高质量语料库,其经典使用场景聚焦于合规性驱动的自然语言处理任务。研究者可借助该数据集构建信息抽取模型,自动识别政策文本中的控制项标识、任务类别及子类别,并训练文本分类器对安全控制系列(如AC、IA、SC等)进行精准归类。同时,该数据集的结构化特性使其成为开发自动化合规检查工具的理想基石,支持语义搜索、文档摘要与知识图谱构建等前沿探索,推动安全政策文本的深度语义理解。
解决学术问题
该数据集精准解決了当前网络安全政策分析领域中语料稀缺且结构紊乱的学术难题。传统上,研究者面临NIST文档版本冗杂、控制项标识非标准化及伪造标识泛滥等困境,导致模型训练基础薄弱。rmf-ato-core通过严格的OSCAL结构化数据溯源,确保每个控制ID与20个真实SP 800-53 Rev 5系列匹配,从而根除虚构标识的滋生。其拒绝机制与逐条日志记录保障了数据的可复现性与完整性,为训练高鲁棒性的合规性语言模型提供了可信数据源,显著推进了安全文本挖掘与自动化审计的研究进程。
实际应用
在实际应用中,rmf-ato-core数据集成为政府机构与企业安全团队实施RMF流程的智能助手。基于该数据集,可开发ATO文档自动生成工具,从海量控制要求中提取适用性条款,辅助安全评估人员快速定位差距。同时,它支持构建合规问答系统,使审计人员以自然语言交互方式获取特定控制项的实施指南。此外,数据集内的AI治理文档与RMF子类别对应关系,为人工智能系统风险评估提供了标准化参考,助力企业构建符合NIST AI RMF的治理框架,提升安全合规的自动化与智能化水平。
数据集最近研究
最新研究方向
在网络安全合规与人工智能治理的交汇前沿,rmf-ato-core数据集致力于构建一个精炼、可追溯且结构严谨的NIST RMF/ATO出版物语料库,其最新研究方向聚焦于通过OSCAL结构化数据与严格的白名单校验机制,确保控制标识符的真实性与完整性,从根本上杜绝伪造ID的产生。该数据集以‘小而精’为设计哲学,摒弃大规模爬取,转而强调数据的现势性、结构正确性与完全可溯源,其构建流程的每一环节均嵌入了人工审查检查点,并记录了全部拒绝条目及其原因,彰显了对数据质量的不懈追求。该工作不仅为NIST风险管理框架的自动化评估提供了高可信度的数据基石,更在人工智能治理文档的整合与分析方面开辟了新的研究路径,其影响辐射至联邦信息系统的安全评估、合规审计以及人工智能系统的可信赖性研究,为领域内建立数据驱动的合规验证与治理策略提供了范式参考。
以上内容由遇见数据集搜集并总结生成



