遇见数据集

DOD-Directive-type-Memorandum-22-001-Records-Management-Standards

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集包含基于美国国防部指令型备忘录22-001(“国防部信息技术系统与服务记录管理能力标准”,2022年3月3日生效,2024年2月22日修订)的文档问答记录。备忘录为信息技术系统和服务制定了全部门强制性的记录和信息管理要求,涵盖采购、开发、配置、信息治理、保留、自动化、互操作性和处置决策。数据集支持监督微调、指令微调、检索增强生成、文档问答、联邦记录管理教育、信息治理培训、IT采购规划、记录管理能力评估、保留与处置分析、工作流与元数据治理以及政策基础评估等任务。每个记录包含一个实质性问题和基于备忘录的详细答案,问题需涉及程序性、治理、技术、操作或角色分析,而非简单定位。数据集规模在100至1000条记录之间,语言为英文,许可证为公共领域。

This dataset contains document question-answering records based on the U.S. Department of Defense Directive-Type Memorandum 22-001 ("DoD Information Technology System and Service Records Management Capability Standards," effective March 3, 2022, revised February 22, 2024). The memorandum establishes department-wide mandatory records and information management requirements for IT systems and services, covering acquisition, development, configuration, information governance, retention, automation, interoperability, and disposition decisions. The dataset supports tasks such as supervised fine-tuning, instruction fine-tuning, retrieval-augmented generation, document question-answering, federal records management education, information governance training, IT acquisition planning, records management capability assessment, retention and disposition analysis, workflow and metadata governance, and policy-based evaluation. Each record contains a substantive question and a detailed answer based on the memorandum. Questions must involve procedural, governance, technical, operational, or role-based analysis, rather than simple location. The dataset size ranges from 100 to 1000 records, the language is English, and the license is public domain.

创建时间:
2026-08-03
原始信息汇总

DoD Records Management Standards for IT Systems and Services 数据集

数据集概述

该数据集基于美国国防部指令型备忘录22-001(DoD Directive-type Memorandum 22-001),标题为“DoD Standards for Records Management Capabilities in Programs Including Information Technology”,日期为2022年3月3日,并整合了2024年2月22日生效的第2次修订内容。数据集包含基于文档的问答记录,旨在支持文档落地的问题回答、文本生成等任务。

基本信息

  • 语言: 英语
  • 许可证: 公共领域(Public Domain)
  • 维护者: Terry Eppler
  • 所有者: 美国联邦政府
  • 数据集规模: 100-1K条记录
  • 任务类别: 问答、文本生成、文档问答

内容范围

数据集围绕备忘录中确立的国防部范围内IT系统和服务强制记录与信息管理要求,涵盖以下主题:

  • 记录管理、信息管理、信息治理
  • 记录保留与处置(如六个月删除策略、七年删除策略)
  • 安全港恢复期(30天内可恢复删除信息)
  • 基于职位的保留策略(符合NARA通用记录表6.1)
  • 记录控制项、元数据、工作流自动化
  • 角色与职责(终端用户、记录保管人、记录经理、IT客户、IT提供者等)
  • 互操作性、审计日志、保留冻结、记录转移等

适用对象

备忘录适用于美国国防部以下组织机构:

  • 国防部长办公室
  • 各军种部
  • 参谋长联席会议主席办公室及联合参谋部
  • 各作战司令部
  • 国防部监察长办公室
  • 国防机构及国防部外勤活动等

潜在应用场景

该数据集可用于:

  • 监督微调与指令微调
  • 检索增强生成(RAG)
  • 文档落地问答
  • 联邦记录管理教育
  • 信息治理培训
  • IT采购规划
  • 记录管理能力评估
  • 保留与处置分析
  • 工作流与元数据治理
  • 政策落地评估
搜集汇总
数据集介绍
DOD-Directive-type-Memorandum-22-001-Records-Management-Standards 数据集图片
构建方式
本数据集源于美国国防部指令型备忘录22-001,即《信息技术项目中的记录管理能力标准》,并整合了至2024年2月22日生效的变更2内容。数据集以该备忘录为唯一知识源,通过精细解析政策文本,设计出基于文档的问答对。每条记录包含一个需要程序性、治理性、技术性、操作性或角色性分析的问题,以及完全依据备忘录条款的详细回答,摒弃了简单的原文定位式问题,旨在促进深度理解与推理。
特点
该数据集具备高度的领域专业性与结构化特征,覆盖记录管理全谱系,涵盖安全港恢复期、默认处置策略、基于职位的保留、互操作性要求及各类角色职责等核心政策要素。其特点在于融合了政策原文与合成问答数据,支持监督微调、指令微调、检索增强生成及文档问答等多种任务,便于开展联邦记录管理教育、信息治理培训、IT采办规划与政策落地评估,为跨域知识应用提供了坚实的数据基础。
使用方法
数据集可被用于训练和评估自然语言处理模型,特别是在政策文档理解与问答场景中。研究者可利用该数据对大型语言模型进行监督微调或指令微调,提升模型在记录管理领域的应答能力。同时,该数据也能作为检索增强生成系统的知识库,增强对国防部记录管理政策的应答准确性与可解释性。此外,数据还适用于构建信息治理与合规性评估的基准测试,辅助机构在IT系统设计、采办与运营中有效落实记录管理标准。
背景与挑战
背景概述
该数据集由美国联邦政府维护,主要研究者为Terry Eppler,基于2022年3月3日发布的国防部指令型备忘录22-001及其2024年2月22日的第2次修订版构建。数据集聚焦于信息技术系统和服务中的记录管理标准,旨在为监督微调、检索增强生成及文档问答等自然语言处理任务提供领域特定的语料支持。其核心研究问题涉及如何通过AI技术促进联邦记录管理政策的理解与实施,包括默认处置策略、安全港恢复期、基于职位的保留等关键条款。该数据集对于推动信息治理、合规性评估及政策落地具有重要价值,为研究人员和从业者提供了结构化的政策问答对,助力自动化记录管理流程的优化。
当前挑战
数据集面临的挑战包括:领域层面,记录管理政策复杂且涉及多角色操作、互操作性和默认处置策略,要求模型深入理解程序性及治理性知识,而非简单信息检索;构建过程中,需确保问题覆盖备忘录全范围,且答案严格基于原始文本,避免主观假设,同时处理政策更新(如2024年修订)带来的内容一致性,并平衡技术术语与可读性,以保证数据集对多种下游任务(如问答、生成)的适应性和稳健性。
常用场景
经典使用场景
该数据集基于美国国防部指令型备忘录22-001,构建了文档锚定的问答对,专为监督微调、指令微调及检索增强生成等自然语言处理任务量身定制。其核心应用场景聚焦于策略导向的文档问答,要求模型深入理解备忘录中关于记录管理能力、默认处置策略、安全港恢复期及角色职责等复杂规定,并据此生成程序性、治理性或技术性的精确回答,从而有效测试与提升模型在专业政策文本上的推理与生成能力。
实际应用
在实践层面,该数据集可直接服务于联邦政府及国防机构的记录管理培训与能力评估,助力IT系统采购与配置决策。其应用涵盖构建智能问答助手,辅助记录管理人员快速检索法规条款、明确处置流程;支持开发记录管理自动化工具,用于默认处置策略的配置、安全港期内的恢复操作及审计日志的生成;同时,可嵌入政务信息治理平台,实现政策遵循性的实时检测与风险预警,显著提升记录管理的效率与合规性,减少人为疏漏。
衍生相关工作
该数据集的发布催生了一系列衍生工作,包括开发针对国防领域术语的领域预训练语言模型,优化文档问答中的长文本理解与跨段落检索策略;构建基于该问答对的策略遵循性评估基准,用于比较不同生成模型与检索器的性能;此外,其启发了对合成数据在敏感政策文档中的适用性研究,以及将问答对转换为指令微调数据以增强模型在信息治理任务上的泛化能力,为后续在政府文档自动化处理、合规性分析等方向的研究奠定了基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务