遇见数据集

sam-solicitation-documents

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Sam Solicitation Documents 是一个面向联邦招标通知附件的文本检索数据集,包含来自 SAM.gov 的各类文件,如工作说明书、绩效工作说明书、理由、修正案、工资决定等与联邦合同机会相关的文书。所有文档均由美国联邦机构发布,属于美国政府作品,且未经任何修改,与机构原始发布的字节完全一致,并提供 SHA-256 校验和以确保完整性。该数据集旨在解决机构网站文件可能被移动、重新编号或删除的问题,尤其是 SAM.gov 附件在通知归档后消失的情况,从而保留文件的可引用性并支持批量处理。数据集包含约 1,000 到 1,000,000 个 PDF 文档,按 <source>/<doc_id>.pdf 的目录结构组织,并提供 metadata.parquet 文件记录每个文档的元数据,包括来源、机构、标题、发布日期、原始 URL、链接页面、字节大小、页数和 SHA-256 哈希值。数据通过 SAM.gov Opportunities API 和附件 URL 使用 govdocs 工具收集。该数据集适用于文本检索、信息提取、公共记录分析等任务。

Sam Solicitation Documents is a text retrieval dataset for federal solicitation notice attachments, containing various documents from SAM.gov such as statements of work, performance work statements, justifications, amendments, wage determinations, and other documents related to federal contract opportunities. All documents are published by U.S. federal agencies, are works of the U.S. government, and are provided without any modification, exactly matching the bytes originally released by the agency, with SHA-256 checksums to ensure integrity. The dataset aims to address the issue of agency website files being moved, renumbered, or deleted, especially when SAM.gov attachments disappear after notice archiving, thereby preserving the citability of files and supporting batch processing. The dataset contains approximately 1,000 to 1,000,000 PDF documents organized in a <source>/<doc_id>.pdf directory structure, with a metadata.parquet file recording metadata for each document including source, agency, title, publication date, original URL, linking page, byte size, page count, and SHA-256 hash. Data is collected via the SAM.gov Opportunities API and attachment URLs using the govdocs tool. This dataset is suitable for tasks such as text retrieval, information extraction, and public records analysis.

创建时间:
2026-09-05
原始信息汇总

数据集概述

该数据集为 Sam Solicitation Documents,收录了美国联邦政府招标公告(SAM.gov)的附件文件,包括工作说明书、绩效工作说明书、论证文件、修正案、工资决定及其他伴随联邦合同机会的文书材料。

内容与规模

  • 文件类型:PDF 格式
  • 数量规模:1K 至 1M 条记录
  • 语言:英语
  • 任务类型:文本检索(text-retrieval)
  • 来源:所有文件均由美国联邦机构发布,属于美国政府作品,未经任何修改,与原始发布的字节完全一致

数据集结构

该数据集包含两个主要部分:

  1. documents/<source>/<doc_id>.pdf - 存储原始 PDF 文档
  2. metadata.parquet - 包含每个文档的元数据,具体字段包括:
    • 来源(source)
    • 机构(agency)
    • 标题(title)
    • 发布日期(posted date)
    • 来源 URL
    • 链接来源页面
    • 字节大小
    • 页数
    • SHA-256 校验和(基于原始字节计算)

创建目的

该数据集的建立源于以下需求:

  • 联邦机构通常在自己网站上发布这些文件后,可能会对文件进行移动、重新编号或删除
  • SAM.gov 上的附件会在招标公告归档后消失
  • 保存这些文件副本可确保其可被引用,并允许用户以批量方式处理整个语料库,而非逐份下载 PDF

数据来源与采集方式

数据采集自 SAM.gov Opportunities API 及其返回的附件 URL,使用的采集工具为 govdocs

搜集汇总
数据集介绍
sam-solicitation-documents 数据集图片
构建方式
该数据集源自美国联邦政府合同机会公告网站SAM.gov,通过其公开的Opportunities API接口及附件链接,系统性地抓取了联邦招标公告所附带的各类文档。这些文档涵盖了工作说明书、绩效工作陈述、论证文件、修正案、工资决定等,是联邦合同机会的完整纸质配套材料。数据集的构建严格遵循原始性,所有文件均与联邦机构发布的原始字节完全一致,未做任何改动,并在元数据中记录了每个文件的SHA-256校验和以验证完整性。采集过程由开源工具govdocs驱动,确保了数据获取的规范性和可重复性。
特点
该数据集具有高度的真实性和权威性,所有文档均为美国政府作品,版权状态明确,适用于研究等公共用途。其特色在于规模适中且结构清晰,按来源和文档ID组织文件,配套的metadata.parquet表格提供了丰富的元数据,包括来源机构、标题、发布日期、原始URL、字节大小、页数和SHA-256校验和,极大便利了文件的追踪和验证。此外,该数据集解决了政府网站文档因改版或归档而失联的问题,使这些公开记录得以持久留存并支持批量分析,为政府采购领域的实证研究提供了宝贵素材。
使用方法
使用该数据集时,研究人员可直接通过metadata.parquet文件索引所需文档,该文件支持pandas等数据分析工具进行读取和筛选。每条记录关联的PDF文件存于documents目录下,根据文档ID即可定位。由于所有文档为公开的美国政府作品,用户可以自由地进行复制、分发和二次使用,不受版权限制。数据集特别适用于文本检索任务,例如构建基于政府合同的问答系统、分析招标文档的共性结构,或进行采购趋势的量化研究,亦可用于训练和评估信息检索模型。
背景与挑战
背景概述
sam-solicitation-documents数据集诞生于美国联邦采购信息数字化治理的浪潮之中,由研究者利用govdocs工具从SAM.gov的Opportunities API系统采集,其核心使命在于永久留存随招标通告发布的各类附件文档。这些文档涵盖工作说明书、绩效工作说明、合理性论证、修正案及工资决定等关键采购文件,通常散落于各机构网站,易因链接迁移或通告归档而失传。该数据集以字节级原样保存了美国政府作品,并以结构化的元数据(如机构、日期、校验和)支撑批量检索与分析,为政府采购监管、文档溯源及文本挖掘研究提供了稀缺的、可引用的公共语料基础,在透明度与合规性领域具有独特价值。
当前挑战
该数据集的构建直面多重挑战:从领域问题看,联邦采购文件分布零散且生命周期短暂,机构站点频繁重构导致陈旧URL失效,归档缺失威胁公共记录的可溯源性,阻碍了跨部门采购行为的透明化监督与系统性分析;从构建过程看,大规模抓取SAM.gov附件面临接口速率限制与反爬策略,需设计鲁棒的递归解析机制以捕捉嵌套链接,同时需确保PDF字节完整性与SHA-256校验一致,应对多格式文件的编码兼容性,且元数据提取需处理机构名称变体及日期格式混乱,稍有不慎便引入噪音,削弱语料库的科研可信度。
常用场景
经典使用场景
该数据集汇集了美国联邦政府发布的招标公告附件,涵盖工作说明书、绩效工作陈述、合理性与必要性论证、修正案及工资决定等关键文书。在公共管理、法学与信息科学领域,研究者常将其作为分析政府采购流程透明度的第一手材料,亦用于构建合同文本解析模型,探索政策表述与实施细节之间的内在关联。
实际应用
在实际应用中,该语料库可支撑自动化合同审查工具的开发,用于快速抽取关键条款、提示潜在风险,辅助中小企业理解招标要求。同时,它为新闻调查与政策评估提供便捷的数据来源,使媒体能高效挖掘招标异常,并支持咨询机构进行市场动态观察和供应商行为分析。
衍生相关工作
基于此语料,衍生工作已涉及合同文本的分类与主题建模,用以刻画不同机构的采购偏好。亦有研究者利用自然语言处理技术构建招标需求问答系统,或与支出数据关联,追踪资金流向,从而派生出一系列关于政府绩效审计和腐败风险预警的开创性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务