mex-data-hub
收藏官方服务:
资源简介:
这是一个统一的SQLite数据库,集成了墨西哥国家统计与地理研究所(INEGI)政府普查的740万条记录,涵盖联邦、州和市级三个政府级别(CNGF、CNGE、CNGMD),时间跨度为2011年至2025年。数据集包括3655个不同来源的数据、3028个唯一地理编码(州和市),并支持全文搜索和REST API访问。
This is a unified SQLite database integrating 7.4 million records from the Mexican National Institute of Statistics and Geography (INEGI) government censuses, covering three tiers of government: federal, state, and municipal (CNGF, CNGE, CNGMD) and spanning the period from 2011 to 2025. The dataset includes 3,655 distinct data sources, 3,028 unique geographic codes for states and municipalities, and supports full-text search and REST API access.
创建时间:
2026-06-04
原始信息汇总
数据集概述:Plataforma de Datos Públicos Mexicanos
该数据集是一个整合了墨西哥国家统计与地理局(INEGI)全国政府普查数据的统一SQLite数据库,并提供REST API接口。
核心数据指标
- 记录总数:740万条(7.4M records)
- 数据来源:3355个不同的原始文件
- 覆盖层级:联邦(CNGF)、州(CNGE)、市(CNGMD)三级政府
- 时间跨度:2011年至2025年(共15年)
- 地理覆盖:3028个唯一地理编码(州和市)
数据来源与主题
- 数据来源:INEGI的全国政府普查(Censos Nacionales de Gobierno),包括:
- CNGF(联邦政府):2017–2025年,涵盖联邦政府、部门及预算
- CNGE(州政府):2021–2025年,涵盖州政府及公共管理
- CNGMD(市政府):2011–2025年,涵盖市政服务、公共安全等
- 主题覆盖:
- 组织结构(组织图、成员、负责人)
- 人力资源(人员、招聘、培训)
- 物质资源(不动产、车辆、设备)
- 预算(收入、支出、公共债务)
- 公共服务(饮用水、排水、垃圾处理、照明)
- 公共安全(警察、民事司法、民防)
- 透明度(信息获取、反腐败)
- 地籍(财产税、地图绘制、估价)
- 采购(采购、公共工程)
- 社会项目(社会发展、援助)
数据访问方式
- API REST:基于FastAPI构建,提供交互式文档(
http://localhost:8000/docs) - 核心端点:
GET /api/tablas:列出可用数据来源GET /api/consulta:组合条件查询数据GET /api/buscar?q=:全文搜索(基于FTS5索引)GET /api/exportar/{csv|json}:导出过滤后的数据
- 查询参数:支持按普查类型(censo)、政府层级(nivel)、年份(año)、主题模块(modulo)、州(entidad)、市(municipio)、地理编码(clave_geo)等筛选,并支持分页(pagina, por_pagina)。
技术特点与要求
- 运行环境:Python 3.11+,SQLite(需支持FTS5)
- 存储占用:约5GB磁盘空间
- 技术架构:
- 使用SQLite数据库,内置FTS5全文索引
- 数据ETL管道支持解析DBF、XLSX、CSV及ZIP压缩文件
- 提供CI/CD(GitHub Actions)及自动化测试(31项测试)
- 年份说明:文件名中的年份为发布年份,数据对应年份为发布年份减1(如
cngf_2017_*对应2016年数据)
许可与归属
- 代码:遵循CC BY 4.0许可证的开源项目
- 数据:© INEGI,允许公共使用,需注明出处(推荐引用格式见页面详情)
搜集汇总
数据集介绍

构建方式
mex-data-hub 数据集基于墨西哥国家统计与地理研究所(INEGI)发布的全国政府普查原始数据构建。项目通过自动化流水线处理来自联邦(CNGF)、州(CNGE)和市(CNGMD)三级政府的245个DBF格式ZIP压缩文件与156个XLSX格式文件,依次完成格式解析、数据清洗与标准化,随后统一加载至SQLite数据库。数据整合过程中保留了3,655个独立源文件的信息,并利用FTS5全文索引引擎构建了高效的检索能力,最终形成一份覆盖2011至2025年、包含7.4百万条记录的联合数据存储库。
特点
该数据集的核心特色在于其跨层级、跨时间维度的系统性整合。它涵盖了墨西哥联邦、州和市三级政府组织机构、人力资源、财政预算、公共服务(如供水、排水、安保)、透明度和地籍管理等多元主题模块,时间跨度长达15年。数据集中包含了3,028个独特的地理区域代码,支持细粒度的地方性分析。所有数据均以自包含的SQLite数据库形式发布,不依赖外部网络服务,便于离线使用与长期保存。此外,项目提供了完整的OpenAPI文档与RESTful接口,极大提升了数据访问的便利性与可编程性。
使用方法
用户可通过两种主要途径使用该数据集。其一是直接利用内置的FastAPI REST服务,启动服务器后即可通过Swagger交互式文档(http://localhost:8000/docs)调用多个端点,例如使用GET /api/tablas获取数据源目录,使用GET /api/consulta结合censo、entidad、año等参数进行多条件筛选查询,或使用GET /api/buscar?q=关键词执行全文搜索,并支持将结果导出为CSV或JSON格式。其二是通过运行项目提供的Python脚本(如ingesta.py和cargar_sqlite.py),从原始INEGI文件或中间JSONL格式重新构建整个数据库,适用于需要自定义数据处理流程的高级用户。
背景与挑战
背景概述
mex-data-hub是一个面向墨西哥公共治理领域的数据集成平台,由研究员Arlex Marin及其团队开发,旨在解决该国三级政府(联邦、州、市)行政数据分散、格式异构与访问困难的问题。该项目整合了墨西哥国家统计与地理研究所(INEGI)自2011年至2025年发布的全国政府普查数据,涵盖超过740万条记录,来自3655个不同来源,并统一存储于支持全文搜索的SQLite数据库中。通过构建RESTful API,平台为研究人员、政策制定者及公民提供了便捷的数据查询与导出能力,显著提升了墨西哥公共数据的可发现性与复用价值。该数据集自发布以来,已成为研究墨西哥政府结构、财政预算、公共服务及透明度议题的重要基础设施,对推动基于证据的政策分析与政府问责具有深远影响。
当前挑战
mex-data-hub面临的核心挑战在于数据异构性与治理复杂性。所解决的领域问题包括:如何将分散于不同格式(DBF、XLSX、CSV)、编码(CP850、UTF-8)及时间跨度(15年)的政府普查数据整合为统一、可查询的结构化资源。构建过程中的挑战表现为:1)解析245个DBF ZIP文件与156个XLSX文件时,需处理多编码、多表格布局及历史数据字段差异;2)设计管道确保7.4M条记录的高效清洗、去重与加载,同时兼容INEGI的元数据命名规范;3)在SQLite中构建FTS5全文索引以支持多语言模糊搜索,并优化合计约5GB数据库的查询性能。这些挑战要求团队在保持数据完整性的前提下,开发可复现且扩展性强的ETL流程,为未来新增数据源的接入奠定基础。
常用场景
经典使用场景
mex-data-hub数据集整合了墨西哥国家地理与统计研究所(INEGI)发布的国家政府普查数据,涵盖联邦、州和市三级政府,时间跨度从2011年至2025年,共包含740万条记录。该数据集最为经典的使用场景在于对墨西哥各级政府机构的结构、职能、财政和公共服务进行系统性分析。研究者可借助其内置的全文搜索引擎和丰富的地理编码信息,按年份、行政级别、地理区域或主题模块精确筛选数据,从而洞察各级政府在不同时期的运行特征与演变趋势。例如,可用于比较各州在公共安全、水资源管理或透明度等关键领域的异同,或是分析特定政策在联邦与地方层面的实施效果。
解决学术问题
该数据集显著解决了长期以来困扰公共管理研究者的一个核心难题:缺乏统一、可机读且跨年度、跨层级的政府运行数据。过去,分散于不同普查项目中的信息不仅格式各异,且难以实现细粒度的时间序列与空间比较分析。mex-data-hub通过构建统一的SQLite数据库和REST API,将原本孤立的数据源整合为可交互的标准化数据集,使得学者能够高效开展关于政府效率、腐败治理、公共财政透明度以及分权体制下政策协调性等重大议题的实证研究。其学术意义在于为墨西哥公共行政领域的研究提供了可靠的数据基座,推动了从定性描述向量化检验的范式转型。
衍生相关工作
mex-data-hub的出现已催生出诸多衍生研究与实践工作。在学术领域,基于该数据集的论文开始聚焦于墨西哥市镇层面公共服务供给的时空差异性分析,以及联邦与州政府间财政转移支付效应的量化评估。在技术层面,开发者基于其API构建了可视化仪表盘和公共支出追踪工具,使得非专业用户也能直观理解复杂政府数据。此外,该数据集的标准化管道设计为其他拉美国家处理同类政府普查数据提供了可复用的方法论范例,推动了区域间公共数据比较研究的发展。其开放许可和详尽的元数据文档也鼓励了更多社区贡献,形成了围绕墨西哥治理透明化的数据生态雏形。
以上内容由遇见数据集搜集并总结生成



