遇见数据集

cities

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Geomelon — World Cities, Regions & Countries 是一个多语言地理参考数据集,数据来源于 Wikidata,并遵循 CC0 1.0 公共领域许可证(无需署名,可自由商用)。该数据集提供全球城市、地区(区域)和国家的地理信息,每项数据均包含丰富的属性字段:国家包括名称、ISO代码、首都、政府首脑、电话区号、驾驶方向及多语言翻译;地区包括名称、人口、坐标及翻译;城市包括名称、人口、坐标、海拔、面积、邮政编码、电话区号、定居点类型、时区、官方网站以及50多种语言的翻译。数据集按国家划分配置(config),每个国家对应一个独立的子集,用户可通过选择国家来避免下载整个数据集。当前已发布的国家配置包括西班牙、美国、印度、德国等,总样本量在10万到100万之间。该数据集适用于文本分类、令牌分类(如命名实体识别NER)、地理空间分析、检索增强生成(RAG)等任务,也可作为地名词典(gazetteer)使用。

Geomelon — World Cities, Regions & Countries is a multilingual georeferenced dataset sourced from Wikidata, released under the CC0 1.0 Universal Public Domain Dedication (no attribution required, free for commercial use). It provides geographical information on cities, regions, and countries worldwide. Each entry includes rich attributes: for countries — name, ISO code, capital, head of government, calling code, driving side, and multilingual translations; for regions — name, population, coordinates, and translations; for cities — name, population, coordinates, elevation, area, postal code, calling code, settlement type, time zone, official website, and translations in over 50 languages. The dataset is organized by country configuration, each country being a separate subset, allowing users to avoid downloading the entire dataset by selecting a specific country. Currently released country configurations include Spain, United States, India, Germany, etc., with total sample size between 100k and 1M. It is suitable for tasks such as text classification, token classification (e.g., named entity recognition NER), geospatial analysis, retrieval-augmented generation (RAG), and can be used as a gazetteer.

创建时间:
2026-09-01
原始信息汇总

数据集概述

Geomelon — World Cities, Regions & Countries (geomelon/cities) 是一个多语言地理参考数据集,包含城市、地区和国家数据,数据来源于 Wikidata,并以 CC0 1.0 公共领域许可发布,无需署名,可免费用于商业用途。


基本信息

  • 许可协议: CC0 1.0(公共领域)
  • 语言: 多语言(multilingual)
  • 标签: 地理、地理空间、城市、地名录、地点、NER、RAG、Wikidata
  • 任务类别: 文本分类、词元分类
  • 数据规模: 100K 至 1M 条记录

数据内容与字段

每个城市包含人口、坐标、海拔、面积、邮政编码/电话区号、聚落类型以及 50 多种语言的名称翻译。数据集按国家分为不同配置(config),每个国家一个配置文件。

字段结构

  • 国家: 名称、ISO代码、首都、国家元首/政府首脑、电话区号、行驶方向、翻译
  • 地区: 名称、人口、坐标、翻译
  • 城市: 名称、人口、坐标、海拔、面积、邮政编码、电话区号、聚落类型、时区、官方网站、翻译(覆盖全球前50大语言及该国官方语言)

可用配置

当前已发布的国家配置包括:

  • spain: 数据文件 data/spain/cities.jsonl
  • united-states: 数据文件 data/united-states/cities.jsonl
  • india: 数据文件 data/india/cities.jsonl
  • germany: 数据文件 data/germany/cities.jsonl

用户可通过 load_dataset("geomelon/cities", "spain", split="train") 方式按国家加载数据,无需下载全部语料。


更新记录

  • germany v1.0.0 (2026-09-04): 初始发布,29,924 个城市,16 个地区
  • india v1.0.0 (2026-08-31): 初始发布,50,000 个城市,35 个地区
  • united-states v1.0.0 (2026-08-29): 初始发布,46,565 个城市,56 个地区
  • spain v1.0.2 (2026-08-29): 新增 4,596 个城市和 2 个地区
  • spain v1.0.1 (2026-08-09): README 更新,新增 FAQ 部分
  • spain v1.0.0 (2026-08-09): 初始发布,19,423 个城市,17 个地区

来源与声明

数据集通过 SPARQL 从 Wikidata 派生而来,以 CC0 1.0 许可发布。Wikidata 数据按"原样"提供,该数据集与维基媒体基金会无关联,也未获其认可。建议(但不强制要求)在回链中标注 geomelon.dev。

搜集汇总
数据集介绍
cities 数据集图片
构建方式
该数据集以Wikidata为数据源,通过SPARQL查询语言提取全球城市、区域及国家的结构化地理信息。构建过程遵循按国家分组的配置策略,每个国家对应独立的JSONL数据文件,涵盖西班牙、美国、印度、英国等已导出国家。字段提取涵盖人口、经纬度、海拔、面积、邮政编码、电话区号、定居类型、时区及多语言名称翻译,其中城市翻译覆盖全球前五十种语言及该国官方语言。所有数据经标准化处理后以CC0 1.0协议发布,确保公共领域可用性,并持续随国家导出进度扩展覆盖范围。
特点
该数据集以多语言地理参考为核心特征,每个城市记录包含人口、坐标、海拔、面积、邮政与拨号代码、定居类型、时区、官方网站及逾五十种语言的名称翻译。数据以国家为配置单元组织,用户可按需加载特定国家,避免下载全量语料。其规模介于十万至百万条之间,兼顾广度与细粒度。采用CC0 1.0公共领域许可,无署名要求,允许商业使用。数据源自Wikidata的SPARQL导出,保持中立性与可追溯性,适用于命名实体识别、检索增强生成及地理信息检索等任务。
使用方法
使用者可通过Hugging Face datasets库以load_dataset函数加载指定国家配置,例如load_dataset("geomelon/cities", "spain", split="train"),返回包含城市名称、翻译、人口、经纬度等字段的样本。除离线静态导出外,该数据集亦可经由Geomelon API、免费城市自动补全接口、按国家发布的npm包、TypeScript与Python客户端、React自动补全组件、MCP服务器及n8n社区节点等多种途径获取实时或集成化服务。用户可依据应用场景选择静态数据、动态查询或工具调用方式,灵活嵌入地理信息处理流程。
背景与挑战
背景概述
地理命名实体识别与检索增强生成等任务长期依赖覆盖广泛、多语言且结构化的地名数据,既有资源或受限于商业许可,或在多语言翻译与细粒度属性上有所欠缺。Geomelon团队自2026年起基于Wikidata构建世界城市、区域与国家数据集cities,以SPARQL抽取多语言地名信息,涵盖人口、坐标、海拔、面积、邮政编码及五十余种语言译名,并以CC0 1.0协议公有领域发布。该数据集按国家分设配置,兼顾多语言与地理空间属性,为地理信息检索、命名实体识别及跨语言应用提供了可自由使用的数据基础。
当前挑战
地理命名实体识别与跨语言地理信息检索面临地名歧义消解、多语言译名对齐及细粒度属性抽取等核心难题,传统地名词典往往覆盖有限或语言单一。构建过程中,Wikidata知识图谱存在条目完整度参差、多语言译名缺失、人口与坐标等属性更新滞后及国家边界与行政区划定义不一致等问题,需经SPARQL查询清洗、去重与标准化。同时,按国家分片导出并保持各配置间字段结构统一,对数据管道的一致性与可扩展性构成持续挑战。
常用场景
经典使用场景
在自然语言处理与地理信息科学的交叉领域,地名实体识别与地理编码任务长期依赖高质量的多语种地名词典。Geomelon—World Cities, Regions & Countries数据集以维基数据为源,按国家配置提供城市、区域与国家的结构化记录,涵盖人口、坐标、海拔、面积、邮政编码、电话区号及50余种语言译名。其最经典的使用场景在于序列标注与命名实体识别中的地点类实体抽取,研究者可直接加载特定国家配置,利用多语言译名字段构建训练语料,提升模型对地名边界与语种变体的辨识能力。
实际应用
在实际应用中,该数据集广泛服务于地址解析、物流路径规划、位置智能分析与检索增强生成系统。其CC0公共领域许可允许商业免费使用,开发者可借助每国独立配置快速获取城市坐标与行政属性,用于构建自动补全、地理围栏、区域统计仪表板及多语种地图标注。无归属要求的授权模式降低了企业集成门槛,结合同源API与npm包,可在Web、移动端及AI代理工具调用中实现一致的地理参考数据供给。
衍生相关工作
围绕该数据集已衍生出一系列工具与接口生态,包括Geomelon实时API、免密钥城市自动补全服务、按国家发布的npm数据包(@geomelon/<country>)、零依赖的Python与TypeScript客户端、React自动补全组件、MCP服务器以及n8n社区节点。这些衍生工作共享同一维基数据来源与CC0许可,形成了从静态离线导出到动态查询、从代码集成到低代码工作流的完整链路,推动了地理数据在多语种应用中的可及性与复用性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务