遇见数据集

DoD-Instruction-8170-01-Online-Information-Management-And-Electronic-Messaging

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集名为‘DoD Instruction 8170.01 Online Information Management and Electronic Messaging Dataset’,是一个基于美国国防部指令8170.01《在线信息管理与电子消息传递》的结构化自然语言问答数据集。数据集旨在支持语言模型训练、检索增强生成、政策问答、合规分析、信息提取、摘要生成以及涉及国防部在线信息和电子消息传递要求的领域适应等任务。每个记录包含一个自然语言政策问题及其详细答案,答案基于源指令撰写,提供完整解释而非简单引用。数据集包含150条记录,每条记录包含五个字段:ID(整数,唯一标识符)、User(字符串,用户角色标签)、Question(字符串,自然语言问题)、Agent(字符串,代理角色标签)、Answer(字符串,基于指令的详细答案)。问题设计避免直接引用源文档,模拟国防部人员、系统所有者、公共事务专业人员、隐私官员、记录管理员、网络安全人员、网站管理员和政策分析师可能提出的真实问题。数据集适用于问答、文本生成、摘要、文本分类、命名实体识别等多种NLP任务,并提供了建议的数据划分(训练集120条、验证集15条、测试集15条)或全量作为语料库。数据创建过程包括从公开的国防部指令中提取文本、审查章节、去除噪声、识别政策规则、生成自然语言问题并生成解释性答案。数据集采用MIT许可证发布。

The dataset named DoD Instruction 8170.01 Online Information Management and Electronic Messaging Dataset is a structured natural language question-answering dataset based on the U.S. Department of Defense Instruction 8170.01 Online Information Management and Electronic Messaging. It is designed to support tasks such as language model training, retrieval-augmented generation, policy Q&A, compliance analysis, information extraction, summarization, and domain adaptation involving DoD online information and electronic messaging requirements. Each record contains a natural language policy question and its detailed answer, written based on the source instruction, providing complete explanations rather than simple citations. The dataset consists of 150 records, each with five fields: ID (integer, unique identifier), User (string, user role label), Question (string, natural language question), Agent (string, agent role label), and Answer (string, detailed answer based on the instruction). Questions are designed to avoid direct citations from the source document, simulating real questions that might be raised by DoD personnel, system owners, public affairs professionals, privacy officers, records managers, cybersecurity personnel, webmasters, and policy analysts. The dataset is suitable for various NLP tasks including Q&A, text generation, summarization, text classification, named entity recognition, etc., and provides a recommended data split (120 training, 15 validation, 15 test) or can be used in full as a corpus. The data creation process includes extracting text from publicly available DoD instructions, reviewing sections, removing noise, identifying policy rules, generating natural language questions, and producing explanatory answers. The dataset is released under the MIT license.

创建时间:
2026-08-05
原始信息汇总

数据集概述

该数据集为 DoD Instruction 8170.01 Online Information Management and Electronic Messaging(美国国防部指令8170.01:在线信息管理与电子消息传递),是一个基于该指令内容构建的结构化自然语言问答数据集。

数据集基本信息

  • 维护者: Terry Eppler
  • 所有权: 美国国防部
  • 许可: MIT
  • 规模: 共150条记录,属于100-1K规模类别
  • 任务类型: 问答、文本生成、文档问答

数据来源

数据集源自 DoD Instruction 8170.01(在线信息管理与电子消息传递),该指令由美国国防部首席信息官办公室发布,原生效日期为2019年1月2日,变更2生效日期为2025年3月12日,已获准公开发布。

该指令规定了国防部电子消息服务的政策、职责和程序,涵盖在线信息管理、电子邮件、网站、社交媒体、外部官方存在、公共网络服务、隐私、网络安全、记录管理、无障碍访问、信息质量、网络分析、移动优化、Web API、超链接、数字签名、加密、官方与个人账户使用、网络测量与定制技术等内容。

数据集结构

每条记录包含一个政策问题与一个基于原始指令的详细答案,采用以下字段:

字段 类型 描述
ID 整数 记录的唯一顺序标识符
User 字符串 标识提问为用户消息的角色标签
Question 字符串 基于DoD指令8170.01的自然语言问题
Agent 字符串 标识回答为代理消息的角色标签
Answer 字符串 基于源指令的详细回答

答案以完整解释而非简单引用的形式编写,每条答案通常包含至少三个完整句子。问题避免直接引用源文档,设计为类似国防部人员、系统所有者、公共事务专业人员、隐私官员、记录管理员、网络安全人员等可能提出的真实问题。

支持的任务

  • 检索增强生成: 可用于构建向量、词汇或混合检索系统,检索官方DoD信息在线分发、电子消息服务、公共与私人网站、官方与个人账户、外部官方存在、网站无障碍、网络安全、加密、隐私、记录管理、信息质量投诉等政策指导。
  • 问答: 支持基于DoD指令8170.01要求、职责、程序、定义和管理机制的封闭域问答。
  • 摘要生成: 支持对一般政策要求、组织职责、网络安全程序、隐私程序、记录管理要求、公共网站标准、账户限制、信息质量原则、投诉解决程序等的摘要。
  • 文本分类: 支持按政策领域分类,包括适用性、信息中心架构、电子消息传递、公共网站、社交媒体、网络安全、可访问性、隐私、受控非密信息、记录管理等。
  • 命名实体识别与信息抽取: 可提取DoD组织与高级官员、分配的职责、政策要求、禁止活动、合规期限、报告期限、信息安全类别、隐私要求、法定与监管机构、行政命令、OMB备忘录、DoD指令等实体与关系。

数据划分

数据集以单一集合形式发布,共150条记录,建议的划分为:

划分 用途 记录数
train 模型训练、检索索引或领域适配 120
validation 提示开发、检索评估或模型选择 15
test 预留评估 15

也可将所有150条记录作为单一的corpus划分用于检索增强生成。

数据生成过程

数据集的生成流程包括:从公开可发布的源指令中提取文本、审查指令各节与附录与术语表、移除重复页眉页脚与目录痕迹、识别实质性政策规则与职责与条件与禁止与例外与期限、生成可回答的自然语言问题、编写包含足够政策背景的解释性答案、验证每条答案均有源指令支持、按指定模式格式化最终记录。

预期用途

  • 训练与评估语言模型在DoD在线信息政策方面的表现
  • 构建面向DoD电子消息传递指南的检索增强生成系统
  • 开发针对公共网站、社交媒体、隐私、网络安全、记录管理和信息质量的问答系统
  • 测试基于政策响应的生成能力
  • 创建DoD信息管理要求的嵌入表示
  • 评估模型区分要求、建议、例外和禁止的能力
  • 支持监管与政策文本分类
  • 抽取组织角色与职责
  • 识别合规条件与期限
  • 支持政府信息管理应用的领域适配
  • 研究面向公开DoD政策文档的自然语言处理
搜集汇总
数据集介绍
DoD-Instruction-8170-01-Online-Information-Management-And-Electronic-Messaging 数据集图片
构建方式
该数据集源自美国国防部指令8170.01《在线信息管理与电子消息传递》,通过系统化提取该指令的实质性条款、责任分配、操作程序及附录内容,并精心设计自然语言问答对构建而成。构建过程历经文本清洗、政策要点识别、问题生成与答案撰写等多个环节,确保每个问题均能导向具体政策规则,且答案具备充分的政策上下文,避免简单引用或定位式提问,从而支持深层次的政策理解与推理。
特点
该数据集包含150条记录,每条记录由ID、User、Question、Agent和Answer五个字段构成,结构清晰并支持转换为对话格式以适配监督微调。其核心特色在于问题设计贴近实际场景,涵盖信息管理、网络安全、隐私保护、记录管理等多个政策维度,答案则详尽阐释规则、条件与例外,并严格区分强制性要求、建议与禁止性行为,为多任务学习提供了高价值的领域语料。
使用方法
该数据集可灵活用于多种自然语言处理任务,包括闭域问答、检索增强生成、文本分类、摘要生成及信息抽取。用户可通过Hugging Face datasets库或Pandas加载CSV格式数据,并可选地转换为对话消息结构。建议按80/10/10比例划分为训练、验证和测试集,或根据需求将全部数据用作单一语料库,以支持检索系统的构建与评估。
背景与挑战
背景概述
随着数字化转型的深入,美国国防部(DoD)在线上信息管理与电子通信领域面临前所未有的复杂性与敏感性。为规范官方信息在互联网上的传播与交互,DoD于2019年颁布了第8170.01号指令,并于2025年进行修订,其内容涵盖网络安全、隐私保护、记录管理、无障碍访问、外部官方存在及个人账户使用等多元维度。由首席信息官办公室主导,该指令合并了多项旧有政策,构建了统一的治理框架。基于此指令构建的自然语言问答数据集,由Terry Eppler等人维护,旨在支持语言模型训练、检索增强生成及政策合规分析等研究,为政府机构与研究人员提供了结构化的高质量语料,推动了政策文本理解与智能问答系统的发展。
当前挑战
该数据集在解决领域问题与构建过程中均面临诸多挑战。领域层面,如何准确理解并区分指令中的强制性要求、建议性指南、例外情形与禁止性条款,以及如何将抽象的治理原则转化为可操作的自然语言问答,成为关键技术难题。构建过程中,需从冗长的官方文书中提取关键政策规则,去除版式噪声,并避免问题仅指向文档位置。此外,确保答案严格忠实于源文件而不引入任何外部法律权威,同时生成语境丰富、足以独立支撑解释的回应,亦非易事。数据规模有限(150条),如何在少量标注下维持政策的覆盖度与回答的可推广性,也是一项重要探索。
常用场景
经典使用场景
该数据集以美国国防部指令8170.01为蓝本,构建了面向在线信息管理与电子消息传递的问答对,为自然语言处理研究提供了高度结构化的政策文本语料。其经典应用场景聚焦于闭域问答系统与检索增强生成(RAG)的构建与评估,尤其在军事政务、信息安全与合规性审查领域。研究人员可借助该数据集训练语言模型精准解析政策条款,识别强制性要求、条件限制及豁免情形,进而开展面向特定规范的高精度信息检索。此外,该数据的问答设计刻意脱离原文位置关联,促使模型依赖语义理解进行推理,这为测试模型在复杂行政文本上的泛化能力提供了理想基准。
解决学术问题
该数据集着力破解了政策文本自动化解析中长期存在的语义鸿沟问题,即传统模型难以区分政策陈述中的义务性、推荐性与禁止性行为。通过提供涵盖适用范围、组织职责、安全控制、隐私保护及记录管理等维度的深度问答,它支撑了细粒度语义理解、信息抽取与文本分类等研究,推动模型从表面匹配转向深层次的政策推理。其意义在于为政府公共政策领域的人工智能应用确立了可复用的评估范式,使研究者能定性与定量地考察模型在合规判定、责任归因与时限识别等任务中的表现,进而提升政策执行监督的智能水平。
衍生相关工作
伴随该数据集的发布,一系列相关研究与应用探索应运而生,形成了以政策合规为核心的衍生工作群落。基于其问答结构,研究者已构建面向政务领域的指令微调模型,强化对官方文档中责任链条与禁止性条款的记忆与推理能力。同时,数据集的语料特征催生了面向分层政策标签体系(如适用性、网络架构、记录管理等)的文本分类器研发,以及利用命名实体识别技术抽取组织角色、期限要求等要素的尝试。检索系统设计层面,衍生出混合检索策略、向量化表征优化等新方法,旨在提升从冗余政策库中精准召回相关条款的效率。整体而言,该数据集正作为种子语料,孕育着更为庞大、精细的政务人工智能研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务