遇见数据集

leeroy-jankins/NIST-Managing-AI-Misuse-Risk

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含从美国国家标准与技术研究院(NIST)于2025年1月发布的第二份公开草案《NIST AI 800-1 2pd:双用途基础模型的滥用风险管理》中衍生的问答记录。源文档为双用途基础模型的滥用风险管理提供自愿性指导,重点关注这些模型可能被故意滥用以危害公共安全或国家安全的威胁,包括涉及化学、生物、放射或核威胁、网络攻击、有害合成内容、儿童性虐待材料和非自愿亲密图像等滥用行为。数据集设计用于文档基础的问答、监督微调、检索增强生成评估、AI安全培训和AI治理分析。每个记录包含自然语言的用户问题和基于源指导的助理回答,旨在支持开发和评估能够利用权威联邦指导回答关于双用途基础模型滥用风险管理系统。

This dataset contains question-and-answer records derived from NIST AI 800-1 2pd, Managing Misuse Risk for Dual-Use Foundation Models, a second public draft issued by the U.S. AI Safety Institute at the National Institute of Standards and Technology in January 2025. The source document provides voluntary guidance for improving the safety, security, and trustworthiness of dual-use foundation models, focusing on the risk that such models may be deliberately misused to cause harm to public safety or national security, including misuse involving chemical, biological, radiological, or nuclear threats, offensive cyber operations, harmful synthetic content, child sexual abuse material, and non-consensual intimate imagery. The dataset is designed for document-grounded question answering, supervised fine-tuning, retrieval-augmented generation evaluation, AI safety training, and AI governance analysis. Each record contains a natural-language user question and a corresponding assistant answer grounded in the source guidance.

提供机构:
leeroy-jankins
搜集汇总
数据集介绍
构建方式
本数据集基于美国国家标准与技术研究院(NIST)于2025年1月发布的第二版公开草案《管理双重用途基础模型的滥用风险》(NIST AI 800-1 2pd)构建而成。通过对源文档内容进行系统性梳理与精读,研究团队将其中关于滥用风险管理的关键概念、框架目标、角色职责及评估方法等实质性信息,转化为自然语言形式的问答对。每个问答对的设计不仅关注事实检索,更注重考察对文档深层含义的理解与应用性推理,答案在忠实于原文的基础上,采用解释性文风而非简单摘录,以适配AI治理、安全合规与政策分析等多重应用场景。
特点
该数据集以100条高质量问答记录构成,覆盖了从滥用风险管理的核心目标、边际滥用风险概念、供应链各方责任,到七大风险管理目标、威胁建模、红队测试、保障措施及事后监测等完整主题。每条记录包含索引、用户角色、自然语言问题、助手角色及基于文档的解释性答案,结构统一且语义清晰。数据集特别强调概念的准确性,如严格区分滥用风险、意外风险与能力风险,并聚焦于公共安全与国家安全的故意滥用场景,避免提供操作性滥用细节,从而确保在安全性与教育性之间取得平衡。
使用方法
该数据集适用于文档问答、有监督微调、检索增强生成评估及AI安全训练。研究者可直接利用其中的问答对进行指令微调,以构建能够回答双重用途模型滥用风险管理问题的大语言模型助手。在评估方面,可结合检索系统进行事实一致性打分,或通过红队测试检验模型对敏感话题的拒绝行为与不确定性表达。使用时需注意其基于单一草案版本,可能不反映后期修订,且不建议作为法律建议、合规认证或高风险系统部署审批的独立依据,而应作为专业治理流程的补充工具。
背景与挑战
背景概述
在人工智能安全治理领域,针对基础模型的双重用途滥用风险管理成为亟待攻克的重大课题。2025年1月,美国国家标准与技术研究院(NIST)下属的人工智能安全研究所发布了第二版公开草案《双重用途基础模型滥用风险管理》(NIST AI 800-1 2pd),为开发者、部署者及政策制定者提供了自愿性指导框架。该数据集即基于此权威文件构建,由NIST主导设计,旨在通过问答形式系统化呈现滥用风险管理的关键概念,包括核生化威胁、网络攻击、有害合成内容等敏感领域。作为首个聚焦联邦安全指南的文档驱动问答数据集,它填补了AI治理与安全训练数据之间的空白,为风险分析、红队测试、透明披露及应急响应等环节提供了结构化知识基底,对推动可信赖AI框架的落地具有里程碑式意义。
当前挑战
该领域面临的核心挑战在于双重用途基础模型固有的通用性悖论:模型能力越强,其被恶意利用的可能性与危害边界越难以预测。具体而言,数据集在构建过程中需应对三大难题:其一,源文档为第二版公开草案,存在后续修订的不确定性,要求数据设计具备版本兼容性与动态更新机制;其二,涉及核生化、网络攻击等高度敏感主题,必须在知识传达与防止提供操作性危害细节之间保持微妙平衡,避免成为恶意行为的间接助力;其三,问答对的生成需超越简单的信息检索,而是深度检验模型对七个风险管理目标(识别、规划、保护、测量、缓解、监测、披露)的跨章节推理能力,同时确保回答忠实于原文却又不沦为机械摘录。此外,评估模型的抗误用能力、不确定性表述以及区分边缘风险与残余风险等概念,对数据质量和安全保障提出了严苛要求。
常用场景
经典使用场景
在人工智能安全与治理的研究版图中,该数据集主要用于文档锚定的问答任务,特别适用于对双用途基础模型滥用风险管理领域进行深入的事实性问答。它能够支撑对模型进行有监督微调,使其精准理解并解释NIST AI 800-1官方指南中的核心概念,如边际滥用风险、威胁画像与安全边际。同时,该数据集也是评估检索增强生成系统在权威安全政策文档上表现的上佳基准,能够测试系统在复杂政策文本中定位、整合并生成可靠回答的能力。
衍生相关工作
该数据集的诞生促进了若干相关衍生工作的展开,包括构建基于NIST AI风险管理框架的系列问答数据集,以及开发针对AI安全政策文档的专用评估基准。研究者可基于其结构化问答对,进一步拓展至多轮对话场景,设计能够进行深度交互的治理咨询系统。此外,该数据集为后续对比不同来源政策文档(如欧盟AI法案、美国行政令)的异同提供了语料基础,催生了跨框架政策对齐分析的研究方向。其数据构建方法论也为其他政策指南(如NIST网络安全框架)的内容结构化改造提供了可复现的范式。
数据集最近研究
最新研究方向
该数据集聚焦于双重用途基础模型滥用风险管理的文档化问答构建,紧跟美国国家标准与技术研究院(NIST)于2025年1月发布的AI 800-1第二版公开草案,旨在为AI安全治理与风险管理领域提供高质量监督微调与检索增强生成评估资源。其研究前沿在于将联邦技术指南转化为结构化知识,重点覆盖化学、生物、放射性、核威胁、网络攻击及有害合成内容等高风险场景的七项管理目标,并与NIST AI风险管理框架对齐。当前热点关联全球AI安全治理标准化进程,尤其是美国AI安全研究所主导的联邦级指导文件落地实践,推动模型开发者、审计者及政策制定者通过代理模型评估、红队测试和安全边际等机制量化边际滥用风险。该数据集的意义在于弥合政策文本与计算模型间的语义鸿沟,为可信赖AI的安全能力基准测试提供权威知识底座,助力行业应对通用模型行为难以预测、评估泛化性有限等核心挑战,同时强化供应链中计算提供商、部署平台与第三方评估者的协同责任。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务