遇见数据集

sister-software/mailwoman-wof-gazetteer

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Mailwoman WOF Gazetteer是一个用于地址解析的多语言行政层级地名录数据集,基于Whos On First(WOF)数据源派生。数据集包含一个统一的SQLite数据库(admin-global-priority.db,大小1.09 GB),覆盖7个优先国家(美国、中国、法国、德国、英国、日本、韩国),以及七个按语言区域(如en-US、fr-FR、ja-JP等)预建的有限状态转换器(FST)二进制文件,用于在进程内快速进行地名查找。数据集支持多语言和多脚本查询,包括CJK(中文、日文、韩文)字符,使用Unicode属性转义进行令牌归一化。该数据集适用于标记分类和文本分类任务,如地址解析,并兼容geocode.earth WOF分发模式。数据集通过JavaScript和SQLite直接使用,定期根据WOF上游变化更新,采用CC-BY-4.0许可证。

Mailwoman WOF Gazetteer is a multi-locale administrative-hierarchy gazetteer for address parsing, derived from Whos On First (WOF). It includes a unified SQLite database (admin-global-priority.db, 1.09 GB) covering 7 priority countries (US, CN, FR, DE, GB, JP, KR), and seven per-locale finite-state transducer (FST) binaries (e.g., for en-US, fr-FR, ja-JP) for fast in-process gazetteer lookup. The dataset supports multi-language and multi-script queries, including CJK characters, using Unicode property escapes for token normalization. It is designed for token-classification and text-classification tasks such as address parsing, and is compatible with the geocode.earth WOF distribution. Usage examples are provided for JavaScript and direct SQLite access, with periodic updates based on WOF upstream changes, licensed under CC-BY-4.0.

提供机构:
sister-software
搜集汇总
数据集介绍
sister-software/mailwoman-wof-gazetteer 数据集图片
构建方式
该数据集源自Who's On First地理数据体系,通过构建管道将743,963份GeoJSON文件整合为统一的SQLite数据库。构建过程采用WAL策略,经过检查点、删除、分析、真空压缩等步骤,最终产出涵盖七个优先级国家的行政层级地名录。数据库包含spr、names、concordances和place_population四张核心表,分别存储单一地点记录、多语言名称变体、跨源标识符及人口数据,同时为每个地区预编译了有限状态转换器(FST)二进制文件,用于加速进程内查询。
特点
数据集以多脚本支持为核心特色,采用Unicode属性转义进行令牌规范化,而非传统ASCII模式,因而能够精准处理中日韩(CJK)及西里尔、阿拉伯、泰文等复杂文字的地名查询。全球数据库规模超过千万级记录,其中单一地点记录达128万余条,多语言名称变体逾1023万条。七个地区的FST文件体积从3.7MB到92.5MB不等,覆盖美国、中国、法国、德国、英国、日本和韩国,实现了高效的内存内匹配与优先级排序。
使用方法
用户可通过JavaScript直接调用预编译FST文件,利用deserializeFst函数反序列化二进制数据后,使用query方法进行地名匹配,返回结果包含地点类型、名称及置信度权重。同时支持SQLite原生查询,通过spr与names表的联合检索,可按语言和名称字段筛选行政实体。该数据集专为mailwoman神经分类器设计,可作为Viterbi发射先验,也适用于独立的地名解析与地址标准化场景,更新版本会随Who's On First上游变化定期重建。
背景与挑战
背景概述
Mailwoman WOF Gazetteer 数据集由 Sister Software 团队于 2026 年构建,源自 Who's On First 地理数据项目,旨在为多语言地址解析提供高效的行政层级地名词典。该数据集整合了美国、中国、法国、德国等七个优先国家的行政区划信息,通过统一 SQLite 数据库和每语言 FST 二进制文件,实现快速进程内查找。其核心研究问题在于如何克服多脚本、跨语言地名变体的解析难题,尤其针对 CJK 字符的规范化处理。该数据集对自然语言处理中地址解析任务具有重要影响,推动了神经分类器与结构化地名词典的深度融合,为全球地址标准化提供坚实基础。
当前挑战
该数据集面临两大挑战。领域问题方面,地址解析需处理多语言、多脚本下的地名歧义性,例如日文汉字‘東京’与平假名‘とうきょう’的等价匹配,以及跨文化行政划分差异(如中美邮编与行政区划的对应关系)。构建过程中,团队需从超 174 万 GeoJSON 文件提取信息,并在 185 秒内完成 WAL 策略下的建库、检查点与真空操作,确保 1000 万以上多语言名称变体的一致性与去重。此外,FST 二进制文件的压缩与查询速度需平衡,以支持实时 Viterbi 解码,这对存储效率与算法优化提出高要求。
常用场景
经典使用场景
在自然语言处理与地理信息科学的交叉领域中,地址解析任务长期面临着多语言、多脚本及行政层级复杂性的挑战。Mailwoman WOF Gazetteer数据集应运而生,其最经典的使用场景是作为神经序列标注模型(如mailwoman神经网络分类器)的维特比发射先验。通过为每个地区提供预构建的有限状态转换机(FST)二进制文件,它能够高效地在推理阶段约束解码空间,从而显著提升地址要素识别的精度与推理速度。此外,该数据集内置的统一SQLite数据库支持跨语言地名查询,使得研究者和工程师能够在大规模多语言地址解析流水线中,实现快速、稳定的地名匹配与消歧。
衍生相关工作
该数据集的生命力在其衍生工作中得以延续与深化。其上游Who's On First项目本身就是一个持续演进的地理实体本体库,而Mailwoman WOF Gazetteer则作为桥梁,将这一庞大知识体系转化为可直接服务于神经地址解析模型的紧凑索引结构。在此基础上,研究者已开发出多种基于Transformer的地址解析模型,通过引入FST约束的集束搜索算法,在公开评测上取得了较传统CRF模型更优的F1得分。进一步地,社区还围绕该数据集构建了跨语言地名对齐评估基准,用以衡量不同语言版本下地名变体的检索一致性,并衍生出针对低资源区域(如中亚、东南亚)的迁移学习配方。这些工作共同昭示,一份精心编纂的行政层级地名词典能够成为撬动整个地址解析领域技术进步的支点。
数据集最近研究
最新研究方向
在地理编码与地址解析领域,多语种地名辞典的构建正朝着高效、跨脚本与深度学习融合的方向演进。该数据集基于Who's On First全球行政层级数据,通过统一SQLite数据库与有限状态变换器(FST)二进制格式,为七个优先国家提供了超千万条多语言地名变体与跨源映射记录。其前沿价值不仅体现在支持中日韩及西里尔字母等多脚本查询的Unicode标准化策略,更在于将FST预编译为神经网络分类器的Viterbi发射先验,实现了符号系统与神经模型的协同推理。此举标志着地址解析任务从单一规则或纯数据驱动,迈向可解释性与大规模并行查找并重的混合架构,对物流、地理信息系统及多语言自然语言处理具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务