遇见数据集

Data-Gouv-FR/correspondance-entre-le-libelle-dune-commune-et-son-code-commune-t-corresp-com

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Correspondance entre le libellé dune commune et son code-commune (t_corresp_com),是一个法国公开数据集,专注于市镇名称与其INSEE代码之间的对应关系。具体来说,表t_corresp_com源自DataSanté数据库,用于将市镇名称(包括不同拼写变体,如带冠词、不带冠词、带连字符等)映射到自2010年起每年有效的INSEE代码。DataSanté是AtlaSanté项目提供的数据库,旨在存储和共享来自不同数据源的信息,以支持Atlasanté(如SIRSé、CartoSanté等)生产的交互式地图。数据集中的数据是公开的,并根据数据生产者的发布情况实时更新。每张表都有数据字典描述,并提供数字备忘录以展示主要计数。该数据集适用于数据标准化、地理编码和公共卫生分析等应用。

The dataset is named Correspondance entre le libellé dune commune et son code-commune (t_corresp_com), which is a French open dataset focusing on the correspondence between commune names and their INSEE codes. Specifically, the table t_corresp_com is part of the DataSanté database, used to map commune names (including various spelling variants such as with articles, without articles, with hyphens, etc.) to INSEE codes in effect for each year since 2010. DataSanté is a database provided by the AtlaSanté project, built to store and share information from different data sources, supporting interactive maps produced by Atlasanté (e.g., SIRSé, CartoSanté, etc.). The data in DataSanté is public and updated in real-time based on releases from data producers. Each table is described in a data dictionary, and numeric memos are provided to summarize key counts. This dataset is suitable for applications such as data standardization, geocoding, and public health analysis.

提供机构:
Data-Gouv-FR
搜集汇总
数据集介绍
Data-Gouv-FR/correspondance-entre-le-libelle-dune-commune-et-son-code-commune-t-corresp-com 数据集图片
构建方式
该数据集源自法国开放数据平台data.gouv.fr,旨在建立法国市镇名称与INSEE市镇代码之间的精确映射关系。数据集构建过程中,从DataSanté数据库中提取了自2010年以来每个年份(即每个“millésime”)的市镇名称与对应INSEE代码的对应关系,并特别注意到原始文件编码从ANSI转换为UTF8,以确保数据的兼容性与国际可读性。在Hugging Face平台上,数据集被组织为一个存储库,每个原始表格资源对应一个子集/配置,每个配置仅包含一个名为“train”的分割,数据以Parquet格式存储,从而实现了高效压缩与快速读取。
特点
该数据集的核心特色在于其历史追溯能力,能够为每一个市镇名称提供自2010年起每年更新的INSEE官方代码,从而覆盖因行政合并、拆分或更名导致的变化。数据表t_corresp_com不仅包含标准市镇名称,还收录了同一市镇的不同拼写变体(如带冠词、不带冠词、带连字符等),充分体现了法语市镇名称的多样性与复杂性。作为AtlaSanté项目的一部分,该数据集依托DataSanté数据库,整合了多个来源的公开健康与地理数据,并随时间滚动更新,保障了信息的时效性与权威性。
使用方法
使用该数据集时,用户可通过Hugging Face的datasets库直接加载,具体操作需调用load_dataset函数并指定子集名称“t-corresp-com”。加载后,数据集将以标准的Hugging Face Dataset格式呈现,其中“train”分割包含所有记录,便于用户进行后续的查询、分析或整合。该数据集适用于需要将法国市镇名称与其官方代码进行匹配的场景,例如在地理信息系统中将非标准地址标准化,或在进行跨年度的区域统计研究时关联不同年份的市镇实体。由于数据集采用Parquet格式,用户亦可利用Pandas等工具直接读取以进行更复杂的数据处理。
背景与挑战
背景概述
该数据集源自法国开放数据平台 data.gouv.fr,由AtlaSanté项目团队创建,旨在服务于DataSanté数据库,用于支撑法国公共卫生领域的交互式地图绘制,如SIRSé和CartoSanté等工具。核心研究问题在于建立法国市镇名称与其INSEE代码之间的动态对应关系,以应对自2010年以来每年更新市镇编码的挑战。数据集的发布顺应了开放数据运动,为法国区域健康数据分析、人口统计研究以及公共政策评估提供了基础性的标准化参考资源,对促进法国政务数据的可互操作性和可重用性产生了重要影响。
当前挑战
数据集应对的首要领域挑战是法国市镇名称的多义性和同名异码问题,一个市镇名称因拼写差异(如带冠词、连字符等)可能对应多个INSEE代码,而一个代码又可能关联多种拼写,这严重阻碍了跨年度的数据关联与聚合。在构建过程中,团队需每年根据INSEE官方发布的市镇变更记录来更新表格,面临海量历史命名变体的清洗、归一化与版本控制难题,同时需确保从ANSI编码向UTF-8编码转换过程中法国特殊字符的完整性,以维护数据在多次迭代中的一致性。
常用场景
经典使用场景
在涉及法国行政地理信息的数据处理与整合研究中,该数据集扮演着桥梁角色,专注于将公社(commune)的名称标签与其官方INSEE编码进行精准映射。由于同一公社在不同年份或不同数据源中可能存在多种变体拼写(如带冠词、无冠词或连字符等),该数据集为每一个自2010年以来的年份提供了标准化的对应关系,从而在语义层面消除了地理标识的歧义。研究者可借助此数据集在历史数据清洗、多源地理数据库融合以及空间统计任务中建立统一的参照体系,确保分析结果的可靠性与一致性。
实际应用
在实际应用中,该数据集广泛服务于法国公共健康与地理信息系统开发。例如,在构建CartoSanté或SIRSé等交互式健康地图时,开发者需将来自不同行政记录的健康数据与公社级的空间坐标关联;通过将原始文本中的公社名称映射为统一INSEE编码,可自动完成数据对齐。此外,在人口普查数据清洗、地方财政分析、交通规划及教育资源配置等政务场景中,该数据集也为自动化处理提供了可信的参照,降低了人工校验成本,支撑了数据驱动决策的落地。
衍生相关工作
该数据集衍生的工作主要集中于地理编码标准化与健康数据融合领域。例如,基于该对照表的启发,研究者开发了自动化模糊匹配算法来处理历史文件中拼写偏差较大的公社名称,并验证了其在多源健康数据集成中的有效性。此外,有工作将其作为基准,构建了跨部门数据质量评估框架,分析不同公共数据源中公社编码的一致性。在AtlaSanté生态内,该对照表还与人口流动、医疗资源可达性等衍生表联合使用,推动了法国地方健康服务分析与政策模拟的精细化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务