DoD-Instruction-8170-01-Online-Information-Management-And-Electronic-Messaging
收藏资源简介:
该数据集名为‘DoD Instruction 8170.01 Online Information Management and Electronic Messaging Dataset’,是一个基于美国国防部指令8170.01《在线信息管理与电子消息传递》的结构化自然语言问答数据集。数据集旨在支持语言模型训练、检索增强生成、政策问答、合规分析、信息提取、摘要生成以及涉及国防部在线信息和电子消息传递要求的领域适应等任务。每个记录包含一个自然语言政策问题及其详细答案,答案基于源指令撰写,提供完整解释而非简单引用。数据集包含150条记录,每条记录包含五个字段:ID(整数,唯一标识符)、User(字符串,用户角色标签)、Question(字符串,自然语言问题)、Agent(字符串,代理角色标签)、Answer(字符串,基于指令的详细答案)。问题设计避免直接引用源文档,模拟国防部人员、系统所有者、公共事务专业人员、隐私官员、记录管理员、网络安全人员、网站管理员和政策分析师可能提出的真实问题。数据集适用于问答、文本生成、摘要、文本分类、命名实体识别等多种NLP任务,并提供了建议的数据划分(训练集120条、验证集15条、测试集15条)或全量作为语料库。数据创建过程包括从公开的国防部指令中提取文本、审查章节、去除噪声、识别政策规则、生成自然语言问题并生成解释性答案。数据集采用MIT许可证发布。
The dataset named DoD Instruction 8170.01 Online Information Management and Electronic Messaging Dataset is a structured natural language question-answering dataset based on the U.S. Department of Defense Instruction 8170.01 Online Information Management and Electronic Messaging. It is designed to support tasks such as language model training, retrieval-augmented generation, policy Q&A, compliance analysis, information extraction, summarization, and domain adaptation involving DoD online information and electronic messaging requirements. Each record contains a natural language policy question and its detailed answer, written based on the source instruction, providing complete explanations rather than simple citations. The dataset consists of 150 records, each with five fields: ID (integer, unique identifier), User (string, user role label), Question (string, natural language question), Agent (string, agent role label), and Answer (string, detailed answer based on the instruction). Questions are designed to avoid direct citations from the source document, simulating real questions that might be raised by DoD personnel, system owners, public affairs professionals, privacy officers, records managers, cybersecurity personnel, webmasters, and policy analysts. The dataset is suitable for various NLP tasks including Q&A, text generation, summarization, text classification, named entity recognition, etc., and provides a recommended data split (120 training, 15 validation, 15 test) or can be used in full as a corpus. The data creation process includes extracting text from publicly available DoD instructions, reviewing sections, removing noise, identifying policy rules, generating natural language questions, and producing explanatory answers. The dataset is released under the MIT license.
数据集概述
该数据集为 DoD Instruction 8170.01 Online Information Management and Electronic Messaging(美国国防部指令8170.01:在线信息管理与电子消息传递),是一个基于该指令内容构建的结构化自然语言问答数据集。
数据集基本信息
- 维护者: Terry Eppler
- 所有权: 美国国防部
- 许可: MIT
- 规模: 共150条记录,属于100-1K规模类别
- 任务类型: 问答、文本生成、文档问答
数据来源
数据集源自 DoD Instruction 8170.01(在线信息管理与电子消息传递),该指令由美国国防部首席信息官办公室发布,原生效日期为2019年1月2日,变更2生效日期为2025年3月12日,已获准公开发布。
该指令规定了国防部电子消息服务的政策、职责和程序,涵盖在线信息管理、电子邮件、网站、社交媒体、外部官方存在、公共网络服务、隐私、网络安全、记录管理、无障碍访问、信息质量、网络分析、移动优化、Web API、超链接、数字签名、加密、官方与个人账户使用、网络测量与定制技术等内容。
数据集结构
每条记录包含一个政策问题与一个基于原始指令的详细答案,采用以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
ID |
整数 | 记录的唯一顺序标识符 |
User |
字符串 | 标识提问为用户消息的角色标签 |
Question |
字符串 | 基于DoD指令8170.01的自然语言问题 |
Agent |
字符串 | 标识回答为代理消息的角色标签 |
Answer |
字符串 | 基于源指令的详细回答 |
答案以完整解释而非简单引用的形式编写,每条答案通常包含至少三个完整句子。问题避免直接引用源文档,设计为类似国防部人员、系统所有者、公共事务专业人员、隐私官员、记录管理员、网络安全人员等可能提出的真实问题。
支持的任务
- 检索增强生成: 可用于构建向量、词汇或混合检索系统,检索官方DoD信息在线分发、电子消息服务、公共与私人网站、官方与个人账户、外部官方存在、网站无障碍、网络安全、加密、隐私、记录管理、信息质量投诉等政策指导。
- 问答: 支持基于DoD指令8170.01要求、职责、程序、定义和管理机制的封闭域问答。
- 摘要生成: 支持对一般政策要求、组织职责、网络安全程序、隐私程序、记录管理要求、公共网站标准、账户限制、信息质量原则、投诉解决程序等的摘要。
- 文本分类: 支持按政策领域分类,包括适用性、信息中心架构、电子消息传递、公共网站、社交媒体、网络安全、可访问性、隐私、受控非密信息、记录管理等。
- 命名实体识别与信息抽取: 可提取DoD组织与高级官员、分配的职责、政策要求、禁止活动、合规期限、报告期限、信息安全类别、隐私要求、法定与监管机构、行政命令、OMB备忘录、DoD指令等实体与关系。
数据划分
数据集以单一集合形式发布,共150条记录,建议的划分为:
| 划分 | 用途 | 记录数 |
|---|---|---|
train |
模型训练、检索索引或领域适配 | 120 |
validation |
提示开发、检索评估或模型选择 | 15 |
test |
预留评估 | 15 |
也可将所有150条记录作为单一的corpus划分用于检索增强生成。
数据生成过程
数据集的生成流程包括:从公开可发布的源指令中提取文本、审查指令各节与附录与术语表、移除重复页眉页脚与目录痕迹、识别实质性政策规则与职责与条件与禁止与例外与期限、生成可回答的自然语言问题、编写包含足够政策背景的解释性答案、验证每条答案均有源指令支持、按指定模式格式化最终记录。
预期用途
- 训练与评估语言模型在DoD在线信息政策方面的表现
- 构建面向DoD电子消息传递指南的检索增强生成系统
- 开发针对公共网站、社交媒体、隐私、网络安全、记录管理和信息质量的问答系统
- 测试基于政策响应的生成能力
- 创建DoD信息管理要求的嵌入表示
- 评估模型区分要求、建议、例外和禁止的能力
- 支持监管与政策文本分类
- 抽取组织角色与职责
- 识别合规条件与期限
- 支持政府信息管理应用的领域适配
- 研究面向公开DoD政策文档的自然语言处理




