遇见数据集

NYC Public Data Directory (1993)

收藏
github2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

1993年纽约市公共数据目录的机器可读版本,包含37个城市机构和269个数据库(应用)记录,从原始扫描件解析为JSON和CSV格式。该目录是纽约市首个计算机化数据库清单,记录了城市机构持有的电子数据、负责机构及联系方式,是当今开放数据目录的直接前身。

The machine-readable edition of the 1993 New York City Public Data Directory contains records for 37 municipal agencies and 269 database (application) entries. This resource was parsed from the original scanned documents into JSON and CSV formats. As the first computerized database inventory of New York City, it documents the electronic data held by municipal agencies, the responsible agencies overseeing the data, and their contact information, serving as the direct precursor to modern open data directories.

创建时间:
2026-07-15
原始信息汇总

数据集概述

该数据集是 1993年纽约市公共数据目录 的机器可读版本,由BetaNYC从原始扫描件中解析并结构化,旨在重现纽约市首份官方计算机化数据库清单。

核心内容

  • 包含从原始扫描件中解析出的 37个城市机构269个数据库(应用程序)记录
  • 记录涵盖:机构名称、地址、公共联络人、电话号码、使命陈述,以及每个数据库的名称、激活年份、功能描述、内容类型、状态、访问方法等。
  • 数据以 JSONCSV 格式提供,分为“逐字版”(保留OCR原始错误)和“清理版”(修复已知OCR替换错误)两个版本。

数据文件

  • data/public-data-directory-1993.json:完整的逐字结构化记录。
  • data/public-data-directory-1993-applications.csv:所有269条应用程序记录的逐字扁平表。
  • data/public-data-directory-1993-clean.json:拼写规范化的JSON版本。
  • data/public-data-directory-1993-applications-clean.csv:拼写规范化的应用程序表。
  • data/agencies-1993.csv:每个机构一行,含持久化slug、标准化名称、联络信息及应用数量。
  • data/agency-name-registry.csv:机构名称历史登记表,包含机构名称在不同时间点的观察记录。

数据来源与语境

  • 目录原始版本由 纽约市公共信息与通信委员会(COPIC)1993年4月 发布,是纽约市《宪章》第1062条的要求,部分资金来自纽约时报基金会资助。
  • 该目录早于2012年《开放数据法》及NYC开放数据门户近二十年,是手动打字机印刷的目录,记录了当时市政府持有哪些电子数据、由哪个机构管理以及联系谁。
  • 原始扫描件(169页PDF)及OCR文本层也包含在数据集中,用于验证。

技术细节与限制

  • 数据通过OCR从扫描件的文本层提取,保留原始错误;常见OCR错误包括 q 代替 gZ/X 代替 IK/H 代替 M 等类型机字符替换。
  • 每个记录包含 pdf_page 字段,可直接对应扫描件的页码进行人工核查。
  • 三个机构(纽约市警察局、住房保护与开发局、人力资源管理局)因提交了“未来版本”占位符而记录数为零,这是原始文档的实际情况。
  • 清理版仅对约17,000个词条中的约600个进行了确定性、词典校验的修复,未使用语言模型推测任何值。

数据处理流程

  1. 使用pypdf从PDF提取OCR文本层。
  2. 解析文本,分割为机构档案和应用程序记录,并对OCR损坏的字段标签进行模糊匹配。
  3. 生成逐字版的JSON和CSV。
  4. 通过确定性规则和词典校验生成清理版。
  5. 构建机构名称登记表。

许可与归属

  • 脚本代码采用 MIT许可证(© BetaNYC)。
  • 提取的数据以 CC0 1.0 献入公有领域。
  • 源文档(1993年公共数据目录)为纽约市的公共记录,不受版权保护。
搜集汇总
数据集介绍
NYC Public Data Directory (1993) 数据集图片
构建方式
1993年纽约市首版《公共数据目录》由公共信息与传播委员会依据市宪章第1062条编制,经纽约时报基金会资助完成。数字化处理过程中,BetaNYC采用pypdf库从原始扫描PDF中提取OCR文本层,并通过确定性解析脚本将37个机构的269个数据库记录拆分为结构化JSON与CSV格式。针对OCR识别中常见的字符混淆(如q与g、Z与I等),项目创建了拼写修正版,仅在有确凿词典证据时替换约600个令牌,未涉及任何大语言模型推断,保证数据溯源可验证。
特点
该目录作为纽约市开放数据运动的直接前身,记录了90年代初期以大型机、COBOL系统为核心的市政计算生态,每个数据库均附有具体联系人电话。数据集包含机构档案与个人档案双层结构,每项记录保留原始OCR错误以维持引用级真实性,同时提供清洁版本供分析。更有趣的是,警察局、住房保护与开发局等三个机构仅预留空白占位符,真实反映了历史文档的原本限制。
使用方法
数据以JSON和CSV双格式发布,用户可直接加载`data/`目录下的文件进行查询分析。所有记录均标注了PDF页面号,便于与原始文档交叉核验。如欲复现提取流程,依次运行`parse_directory.py`和`normalize_text.py`脚本即可从PDF重建全部数据文件。机构名称注册表通过`agency_slug`键实现跨年代机构名称的持久匹配,为追踪市政机构的更名与合并提供了纵向溯源工具。
背景与挑战
背景概述
在政府数据开放运动尚未萌芽的时代,纽约市于1993年4月发布了首份《公共数据目录》(第一版),由公共信息与通信委员会(COPIC)依据1989年《纽约市宪章》修订案第1062条编纂,其设计与编制部分得益于纽约时报基金会资助。这份打字机字迹的目录破天荒地记录了市属机构持有的37个机构共计269个电子化数据库的概要信息,包括数据内容、主管机构及联系方式。作为2012年纽约市开放数据法(地方法第11号)及后来的纽约市开放数据门户的直接前身,该目录为研究者、社区团体和公众首次揭开了城市电子数据资产的神秘面纱。该数据集由公民科技组织BetaNYC通过OCR技术从原始扫描件中提取与结构化处理,提供了JSON和CSV两种机器可读格式,并创造性地区分了原始转录版本与经过拼写校正的清洁版本,为后续长达三十余年的纽约市开放数据演进研究奠定了坚实的基准参照。
当前挑战
该数据集面临的首要挑战源自原始文档的物质载体局限——169页打字机印刷品经过四十余年存放后,其OCR文本层充斥着严重的拼写替代错误(如'q'替代'g'、'Z'或'X'替代'I'、'K'或'H'替代'M'等系统性畸变),导致近17,000个标记中约600个需要确定性词典检验修复,而无法自信修复的内容只得保留原样。其次,数据构建过程遭遇了显著的结构性缺失:警察局、住房保护与发展和人力资源管理局三家关键机构仅提交了占位声明承诺'未来版本补充',最终留下零条记录的空白。此外,在解析过程中,OCR污染的字段标签需依赖模糊匹配才能避免记录丢失,而字段值本身未经人工逐页校准,使得每一处引证都必须回溯原始PDF页面确认,大幅增加了数据清洗与验证的复杂度和人力投入。
常用场景
经典使用场景
该数据集的核心用途在于重现与剖析1993年纽约市政府机构的计算机化数据库目录,这是开放数据运动萌芽期的珍贵历史切片。研究人员可利用其结构化的JSON与CSV格式,对37个机构及269个应用记录进行系统性挖掘,探究早期市政数据管理的组织形态。常见的使用场景包括回溯城市信息系统的演化轨迹,例如比对同一机构自1993年至今的数据开放程度变迁,或分析主框架时代数据库的命名惯例、功能描述与访问权限设置,从而为当代开放数据政策提供历史参照基准。
衍生相关工作
该数据集衍生了一系列开创性工作,其中最核心的是BetaNYC构建的纵向机构名称注册表(agency-name-registry)。这张权威档案超越了1993年目录本身,为每个机构分配持久化标识符(slug),并计划通过爬取City Record等后续来源逐年补充名称变更、合并与分解记录,形成跨越数十年的城市机构孪生化图谱。此外,该数据的清洗方法论催生了确定性OCR校正流程,利用词典验证及人工核对付录稿中的替换错误(如q→g),为历史文档的机器解析提供了可复现的技术路线。这些工作共同奠定了一座从纸质档案到结构化时间序列数据的桥梁。
数据集最近研究
最新研究方向
该数据集作为纽约市开放数据运动的先驱性文献,正引领着城市计算史与政府透明度交叉领域的前沿探索。在当今全球开放政府数据浪潮中,尤其是美国各城市依据地方立法推动数据公开的背景下,这一1993年的纸质目录被数字化解析为机器可读格式,为学者提供了独特的纵向研究视角。研究者可将其与2012年《地方法11号》后的纽约市开放数据门户进行历时性对比,追踪37个市属机构269个数据库从大型机时代到云原生架构的演进轨迹,揭示哪些系统在数十年间持续运行。该工作不仅填补了城市信息基础设施历史研究的空白,更为评估开放数据政策实效、问责政府数据治理提供了量化基准,其跨年代机构名称注册表更成为连接不同时期政府数据生态系统的关键桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务