chile-hub
收藏数据链接:
官方服务:
资源简介:
chile-hub是一个智利公共数据集合,经过整理、标准化和验证,涵盖地理、人口、经济、健康、教育和选举区数据,可直接用于分析,支持Polars、DuckDB、SQLite和Excel等多种格式,旨在降低技术成本,提供可靠的数据源。
chile-hub is a curated Chilean public data collection that has been standardized and validated. It covers geospatial, demographic, economic, health, educational and electoral district data, and is ready for direct analytical use. It supports multiple formats including Polars, DuckDB, SQLite and Excel, aiming to reduce technical costs and provide a reliable data source.
创建时间:
2026-05-31
原始信息汇总
🇨🇱 chile-hub 数据集详情
概述
chile-hub 是一个Python库,旨在提供经过整理和验证的智利公共数据集,用户通过一行代码即可加载使用。项目通过自动化管道从官方来源提取数据,进行标准化、验证,并发布为多种格式(Parquet、DuckDB、SQLite、JSON、Excel),确保数据质量、可追溯性和易于交叉分析。
核心特性
- 一键加载: 通过
pip install chile-hub安装,使用ChileHub().load_polars("comunas")即可加载DataFrame。 - 数据已整理验证: 所有数据集都经过完整性、参照完整性(如346个公社)和代码格式的自动验证,数据损坏会阻止发布。
- 可交叉关联: 所有数据集通过统一的智利领土代码(CUT,如
codigo_comuna)关联,且保证为定长VARCHAR类型,避免前导零丢失问题。 - 多格式支持: 提供Parquet(高性能分析)、DuckDB(本地SQL查询)、SQLite(嵌入式应用)、JSON(管道)和Excel(电子表格)格式。
- 全透明溯源: 每个数据工件包含原始来源、提取日期、模式(在线/备用)、SHA256哈希、许可证和再分发状态。
- CI/CD自动化: 使用GitHub Actions进行确定性管道:提取 → 构建 → 验证 → 测试 → 发布,可本地复现。
包含的15个数据层
| # | 数据层名称 | 记录数 | 来源 | 许可证 | 更新频率 |
|---|---|---|---|---|---|
| 1 | regiones (大区) | 16 | BCN ArcGIS | CC BY | — |
| 2 | provincias (省份) | 56 | BCN ArcGIS | CC BY | — |
| 3 | comunas (公社/基础行政区划) | 346 | BCN ArcGIS | CC BY | — |
| 4 | comunas_enriquecidas (增强公社数据) | 346 | BCN + INE | CC BY | — |
| 5 | indicadores (经济指标: UF, 美元, 欧元, UTM, IPC历史序列) | 历史序列 | BCCh / mindicador.cl | 免费(需注明出处) | 每日 |
| 6 | censo_comunal (2024年人口普查-公社级) | 346 | INE | CC BY 4.0 | 十年一次 |
| 7 | censo_hogares_viviendas (住房与家庭普查) | 346 | INE | CC BY 4.0 | 十年一次 |
| 8 | establecimientos_salud (医疗机构目录) | ~5,600 | MINSAL / datos.gob.cl | CC0 | 每月 |
| 9 | distritos_electorales (选区/参议院选区) | 346 | BCN / Ley 20.840 | CC0 | — |
| 10 | establecimientos_educacionales (教育机构目录) | ~12,900 | MINEDUC | CC BY 3.0 CL | 每年 |
| 11 | finanzas_municipales (市政财政指标) | 备用整理数据 | SINIM / SUBDERE | 需审查条款 | 每年 |
| 12 | resultados_educacionales (教育成果指标) | 备用整理数据 | MINEDUC | CC BY 3.0 CL | 每年 |
| 13 | indicadores_urbanos_siedu (城市指标 SIEDU) | 部分覆盖 | INE / SIEDU | INE开放数据 | 每年 |
| 14 | perfil_territorial_comunal (公社综合概况) | 346 | chile-hub衍生 | 开放来源 | 衍生数据 |
| 15 | empresas (企业注册与社会, RES) | ~1,570,000 | Min. Economía / datos.gob.cl | CC-BY 3.0 CL | 每月 |
主要数据层的Schema示例 (部分)
- comunas:
codigo_comuna(VARCHAR(5)),nombre_comuna,nombre_comuna_clean,codigo_provincia(VARCHAR(3)),codigo_region(VARCHAR(2)),nombre_region,latitud_cabecera,longitud_cabecera,poblacion_estimada. - censo_comunal:
codigo_comuna,nombre_comuna,poblacion_censada,hombres,mujeres,razon_hombre_mujer, 5个年龄组 (poblacion_0_14...poblacion_65_mas). - indicadores:
fecha(DATE),codigo_indicador(VARCHAR),valor(DOUBLE). - empresas:
rut,razon_social,codigo_sociedad,capital,fecha_actuacion,comuna_tributaria,region_tributaria.
安装与使用
- 安装:
pip install chile-hub(基础版, 含Polars, PyArrow, requests);pip install chile-hub[pipeline](完整版, 含DuckDB, Pandas等用于运行管道). - Python API:
ChileHub()初始化;hub.load_polars("数据集名称")加载为Polars DataFrame;hub.list_datasets()列出可用数据集;hub.summary(),hub.health(),hub.provenance()获取摘要、健康状态和溯源信息. - 缓存管理:
chile-hub cache update/status/clear更新、查看状态或清理本地数据缓存. - 版本锁定: 生产环境推荐固定版本,如
chile-hub==1.2.0.
管道架构
管道为线性、确定性和严格流程:
- 提取: 从官方来源(BCN, INE, MINSAL, MINEDUC, BCCh等)提取数据到
data/staging/。 - 构建: 运行
build_dev_db.py,输出发布格式到data/normalized/。 - 验证: 运行
verify_pipeline.py,检查完整性、代码格式、业务规则(如公社数量必须为346)。 - 测试: 运行
pytest进行单元/集成测试。 - 发布: 通过烟雾测试后,发布数据工件和捆绑包。
- 关键不变性: 如果公社数量 ≠ 346,或CUT代码格式丢失,管道会中止,绝不发布损坏数据。
搜集汇总
数据集介绍

构建方式
chile-hub 数据集旨在系统性地解决智利公共数据获取与整合中的技术痛点。其构建围绕一个全自动化的流水线展开,该流水线采用线性、确定且严格的架构,依次执行数据提取、构建、验证、测试与发布等阶段。在提取阶段,系统定时从包括智利国家图书馆、国家统计局、中央银行及各部委在内的权威官方来源获取原始数据,并保存为带有元数据的 CSV 文件。随后,构建阶段将这些原始数据标准化、清洗并聚合成 15 个核心图层,以 Parquet 为主要格式存储于规范化目录中。关键的是,验证阶段会强制执行一套严格的业务规则,例如社区编码(CUT)必须保持为固定长度的 VARCHAR 格式、社区数量必须严格等于 346 等,任何一条规则的失败都会导致构建过程终止,从而从根源上杜绝了劣质数据的发布。最终,通过持续集成/持续部署(CI/CD)管道在 GitHub Actions 上自动完成测试、烟雾测试与制品发布。
特点
chile-hub 数据集的核心优势体现在其高度一致的标准化与卓越的互联互通性。所有图层均通过统一的 5 位智利领土编码(CUT)进行关联,确保了数据在区域、省份和社区粒度上的无缝对接,彻底解决了因编码格式不一致(如整数丢失前导零)而导致的跨表连接难题。数据集包含 15 个精心策划的图层,覆盖了行政区划、人口普查、医疗机构、教育机构、经济指标、市政财政、选举区域乃至企业登记等广泛领域,构成了一个关于智利的全景式信息图谱。此外,数据以 Parquet、DuckDB、SQLite、JSON 和 Excel 等多种格式提供,兼顾了高性能分析与不同用户群体的需求。每一份制品都附带了完整的溯源信息,包括原始来源、提取日期、许可证状态与完整性哈希值,赋予了数据极高的透明度和可复现性,令用户能够精确掌握所消费数据的可靠背景。
使用方法
使用 chile-hub 数据集的过程极尽简洁。用户通过一条简单的 pip install chile-hub 命令即可完成安装。在 Python 环境中,通过 from chile_hub import ChileHub 导入核心类,实例化后便可调用 load_polars 方法,以 Polars DataFrame 的形式加载任意图层。该数据集设计的核心简化了数据探索流程:由于所有图层均共享一致的 VARCHAR 类型编码,用户无需进行繁琐的格式转换,即可执行跨表联合分析,例如将社区边界数据与人口普查数据直接连接。此外,数据集内置了智能缓存机制,首次加载时自动从 GitHub Releases 下载经验证的数据包并计算 SHA256 校验和,随后所有操作均基于本地缓存,大幅提升了重复使用的效率。对于进阶用户,chile-hub 还提供简洁的命令行接口用于缓存管理,并支持通过 DuckDB 直接对 Parquet 文件执行 SQL 查询,满足从快速原型到生产级应用及 CI/CD 集成的多样化需求。
背景与挑战
背景概述
chile-hub 数据集诞生于2025年,由智利开发者Cristóbal Ortega主导创建,旨在系统性地解决智利公共数据领域长期存在的碎片化与不可靠性问题。智利政府部门虽开放了大量地理、人口、经济与社会服务数据,但这些数据往往散落在不同机构的门户网站中,格式各异,且普遍存在链接失效、Excel表格变形、行政区划代码(CUT)在读取时丢失前导零等顽疾。该数据集的核心研究问题是:如何构建一个自动化、可验证且可复现的数据管道,将智利15个关键公共数据层(涵盖346个市镇的行政区划、人口普查、医疗机构、教育机构、经济指标与市政财务等)统一清洗、标准化并打包成生产级格式。通过提供一行Python代码即可调用的接口,chile-hub显著降低了数据分析师与研究人员在智利数据准备环节的技术成本,在智利数据科学社区中建立了广泛的影响力。
当前挑战
chile-hub面临的首要挑战是智利公共数据生态的先天不足:官方数据源分散于多个部委与服务机构,API稳定性差,Excel报表常包含合并单元格与不规范的编码格式,CUT代码在经典解析过程中极易因被误转为整数而丢失前导零,导致跨表联接过错。数据构建过程中,管道需应对不稳定源的降级策略,例如当主服务器失效时自动切换至备份回退(fallback)机制,同时确保所有15个数据层的行数精确验证(如市镇层必须恰好346条记录),任何校验失败都将中断发布流程,以杜绝损坏数据流出。此外,不同数据源的许可条款各异(CC BY、CC0、CC BY 3.0 CL等),管道需在打包时准确追溯每层数据的来源、提取时间与再分发合法性,为下游用户提供透明的版权指引。
常用场景
经典使用场景
chile-hub 数据集专为智利公共数据的便捷获取与高效分析而设计,其最经典的使用场景在于实现地理、人口、经济、教育、医疗等多源异构数据的无缝整合与交叉查询。研究人员只需通过一行 Python 代码即可加载经清洗与标准化的 'comunas'(社区)、'censo_comunal'(人口普查)和 'establecimientos_salud'(医疗机构)等核心图层,并基于统一的 'codigo_comuna'(唯一地域编码)完成精准关联。这一模式彻底取代了传统的手动下载、格式转换与数据清洗流程,使得从宏观区域到微观社区的快速画像与对比分析成为可能。
衍生相关工作
chile-hub 的出现催生了一系列高质量的衍生研究工作。一方面,其内置的 'perfil_territorial_comunal'(社区综合画像)图层作为自产衍生数据,为后续研究提供了可直接使用的社区级多维特征向量。另一方面,该数据集的工程范式——包括基于 GitHub Actions 的自动化 CI/CD 管线、严格的完整性校验(如 346 个社区必达原则)以及多样化的数据导出格式——为拉美其他国家或地区构建类似开放数据平台树立了可复制的技术样板。围绕其 API 接口与标准化 schema,学术界已涌现出基于 Polars 与 DuckDB 的高效分析工作流,推动了智利大数据生态的成熟。
数据集最近研究
最新研究方向
在智利公共数据治理领域,chile-hub通过构建端到端自动化的数据管道,将分散于国家统计研究所、中央银行、各部委等官方来源的15层核心数据集——涵盖行政区划、人口普查、经济指标、教育医疗设施与市政财政——整合为结构一致、可交叉联动的标准化知识库。前沿研究聚焦于利用该数据集消除智利公共数据长期存在的编码断裂(如CUT代码的零丢失)、格式异构与链接失效等结构性障碍,使得研究者能够以一行代码完成跨域数据融合,进而支撑基于Polars、DuckDB等现代分析工具的精细空间计量与纵向追踪分析。该工具的出现正在重塑拉美地区开放科学的数据基础设施范式,其严格的质量守护机制(346个行政区划完整性校验与SHA256完整性验证)为全球南方的公共数据赋能运动提供了可复现的工程化参考。
以上内容由遇见数据集搜集并总结生成




