遇见数据集

osm-polygon-wikidata-only

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

该数据集整合了OpenStreetMap(OSM)多边形数据、Wikidata实体描述和多语言维基百科文章文本,专为地理空间与多语言自然语言处理研究设计。数据集包含三个核心部分:1)polygons表存储带有wikidata=*标签的OSM多边形要素,包含几何信息、标签属性和中心点坐标;2)articles表收录与Wikidata实体关联的维基百科文章,涵盖343种语言,包含文章标题、全文内容、元数据和提取状态;3)polygon_articles表作为连接表,记录多边形与文章之间的多对多关联关系。数据集规模包括229,967个多边形、214,230个唯一Wikidata实体和356,839篇维基百科文章,覆盖58个地理区域,总单词数超过1.32亿。数据来源遵循开放许可:OSM数据采用ODbL 1.0,Wikidata采用CC0 1.0,维基百科文章采用CC BY-SA 4.0。该数据集适用于地理信息检索、多语言文本分析、实体链接、知识图谱构建等任务,特别适合需要结合空间几何与多语言文本描述的研究场景。

This dataset integrates OpenStreetMap (OSM) polygon data, Wikidata entity descriptions, and multilingual Wikipedia article texts, and is specifically designed for geospatial and multilingual natural language processing research. The dataset consists of three core components: 1) The `polygons` table stores OSM polygon features tagged with `wikidata=*`, including geometric information, tag attributes, and centroid coordinates; 2) The `articles` table includes Wikipedia articles associated with Wikidata entities, covering 343 languages, and contains article titles, full text content, metadata, and extraction status; 3) The `polygon_articles` table serves as a junction table that records the many-to-many association relationships between polygons and articles. The dataset has a scale of 229,967 polygons, 214,230 unique Wikidata entities, and 356,839 Wikipedia articles, covering 58 geographic regions, with a total word count exceeding 132 million. The data sources follow open licenses: OSM data is licensed under ODbL 1.0, Wikidata under CC0 1.0, and Wikipedia articles under CC BY-SA 4.0. This dataset is applicable to tasks such as geographic information retrieval, multilingual text analysis, entity linking, and knowledge graph construction, and is particularly suitable for research scenarios that require the combination of spatial geometry and multilingual textual descriptions.

创建时间:
2026-07-09
原始信息汇总

数据集概述:NoeFlandre/osm-polygon-wikidata-only

该数据集包含带有 wikidata=* 标签的 OpenStreetMap(OSM)多边形,并附有 Wikidata 描述和每个有效语言版本 Wikipedia 文章的全文,无文章数量上限。

核心数据规模

指标 数值
多边形数量 258,112
唯一 Wikidata 实体数 241,700
Wikipedia 文章数 401,848
多边形-文章关联数 441,529
覆盖语言数 343 种
地理区域数 68 个
总词数 150,063,220
数据集磁盘大小 1.9 GB

Wikipedia 覆盖漏斗

阶段 数量 占多边形比例
全量多边形 258,112 100.0%
拥有 ≥1 篇文章 130,597 50.6%
拥有非空文本 130,596 50.6%
拥有英文覆盖 35,872 13.9%
无英文但有其他语言 94,725 36.7%
拥有 2+ 种语言 51,858 20.1%
拥有 5+ 种语言 18,627 7.2%
拥有 10+ 种语言 8,313 3.2%

语言分布(按文章数量排名前20)

语言 文章数 占比 多边形数量
德语 (de) 47,921 11.9% 50,931
英语 (en) 32,440 8.1% 35,872
宿务语 (ceb) 28,224 7.0% 28,862
法语 (fr) 26,507 6.6% 29,131
西班牙语 (es) 18,070 4.5% 19,711
埃及阿拉伯语 (arz) 13,612 3.4% 14,096
荷兰语 (nl) 11,991 3.0% 12,997
加泰罗尼亚语 (ca) 11,529 2.9% 12,176
瑞典语 (sv) 10,540 2.6% 11,157
俄语 (ru) 9,580 2.4% 10,391

数据文件结构

数据集包含三个核心 Parquet 文件,另附可选增强文件:

1. polygons/*.parquet

每行对应一个多边形,包含以下字段:

  • 标识列polygon_id(确定性 ID)、source_pbfosm_typeosm_idwikidata(Q-id)
  • 属性列nametags(JSON)、tag_keystag_countosm_primary_tag
  • 空间列centroid(GeoJSON Point)、latlonbboxgeometry(完整 GeoJSON)、area_m2area_km2area_bucket
  • 标记列has_namehas_wikidatahas_wikipediawikipedia_language_countwikipedia_languageswikipedia_article_counthas_english_wikipediahas_french_wikipediatext_availablebest_language
  • 元数据列extraction_versionextracted_at

2. articles/*.parquet

每行对应一篇唯一的 Wikipedia 文章,包含以下字段:

  • 标识列article_id(确定性 ID)、wikidatalanguagesitetitleurlpage_idrevision_id
  • 时间列revision_timestampretrieved_at
  • 文本列wikidata_labelwikidata_descriptionwikidata_aliaseslead_textextractfull_text(全文)、full_text_formatarticle_length_charsarticle_length_wordsarticle_length_tokens_estimate
  • 媒体/分类列thumbnail_urlthumbnail_widththumbnail_heightcategories
  • 来源/状态列licenseattributionsource_apifetch_statusfetch_errorcontent_hash

3. polygon_articles/*.parquet

多对多关联表,包含字段:polygon_idarticle_idwikidatalanguagesource_pbfregionosm_typeosm_idpage_idrevision_idis_best_language

可选增强文件(不替换核心表)

  • wikipedia/documents/*.parquetwikipedia/sections/*.parquet
  • wikivoyage/documents/*.parquetwikivoyage/sections/*.parquet
  • wikidata/facts/*.parquet

数据来源与许可

  • OpenStreetMap 多边形:(c) OpenStreetMap 贡献者,许可协议 ODbL 1.0
  • Wikidata 实体数据CC0 1.0
  • Wikipedia 文章文本CC BY-SA 4.0,归属信息内嵌于每条文章记录

加载方式(Python)

python from datasets import load_dataset ds = load_dataset("parquet", data_files={ "polygons": "hf://datasets/NoeFlandre/osm-polygon-wikidata-only/polygons/*.parquet", })

维护信息

  • 数据集生成日期:2026-07-11
  • 维护者:Noé Flandre
搜集汇总
数据集介绍
osm-polygon-wikidata-only 数据集图片
构建方式
该数据集由OpenStreetMap中标记有`wikidata=*`引用的多边形构成,并通过Wikidata API和Wikipedia API为每个多边形关联的多语言条目补充了丰富的语义信息。构建流程以GeoFabrik发布的PBF文件为起点,逐一解析每个多边形的几何与属性标签,而后依据其指向的Wikidata实体,从全量语言站点中抓取所有相关的Wikipedia文章,并提取相应条目的Wikidata标签与描述。最终,三个核心Parquet文件被生成:`polygons`表存放多边形本身的几何与标签信息,`articles`表维护每篇Wikipedia文章的元数据与全文内容,`polygon_articles`表则建立起多边形与文章之间的多对多关联。整个流水线不设文章数量上限,并支持对数据进行可选冗余补充,例如Wikipedia章节、维基导游页面以及Wikidata结构化事实等。数据集最终于2026年7月11日完成构建,由维护者Noé Flandre持续更新。
特点
该数据集总收录258,112个多边形,关联到241,700个独立的Wikidata实体,并涵盖401,848篇Wikipedia全文文章,覆盖343种语言,总计约1.5亿词。多边形的面积分布从微小地物到大型区域被划分为易于筛选的桶级,地理位置信息以精确的经纬度坐标、包围盒及简化GeoJSON几何体形式呈现。每个多边形还附带了完整的OSM标签集合以及衍生自标签的最佳分类标签,便于进行粗粒度分析。多语言覆盖呈现出典型的长尾分布:前五大语言占据约38%的文章,而大量小众语言同样被完整收录,使得数据集能支持罕见语的跨语种研究与地理信息检索。此外,数据集明确提供是否拥有英文文章、最佳语言选用以及文章完整性等多维度布尔与枚举型字段,极大方便了针对不同语种和内容质量的下游筛选。
使用方法
使用者可通过Hugging Face的`datasets`库直接加载Parquet格式的数据,加载方式与常规数据集无异,只需指定分片路径即可。例如,使用`load_dataset("parquet", data_files={"polygons": "hf://datasets/NoeFlandre/osm-polygon-wikidata-only/polygons/*.parquet"})`即可获取多边形子集。数据集提供了`polygons`、`articles`和`polygon_articles`三个配置,分别对应多边形实体、Wikipedia文章实体及其关联表。调用时也可根据需要仅加载某个子集,以减少内存占用。对于希望进行多模态或文本增强分析的场景,可选读入`wikipedia/documents`、`wikivoyage/documents`以及`wikidata/facts`等额外分片,这些表格为纯文本的丰富化提供了素材。所有数据以Apache Parquet列式存储格式存放,压缩效率高,读取速度快,适合大规模地理信息与自然语言处理相结合的联合分析任务。数据许可方面,多边形源自OpenStreetMap的ODbL授权,Wikidata信息以CC0发布,Wikipedia文章遵循CC BY-SA 4.0协议,使用时需注意相应的归属声明。
背景与挑战
背景概述
地理空间数据与语义知识的融合是推动地理信息科学、自然语言处理及知识图谱等领域发展的关键枢纽。在此背景下,由Noé Flandre维护的osm-polygon-wikidata-only数据集于2026年7月发布,旨在构建一个高质量、多模态的地理实体资源库。该数据集以OpenStreetMap中带有wikidata标签的多边形为锚点,系统性地关联了维基数据实体的描述信息与多语言维基百科文章全文,覆盖343种语言、逾40万篇文章及超1.5亿词汇。其核心研究问题聚焦于打通非结构化地理空间几何数据与结构化语义知识之间的壁垒,为跨语言地理实体检索、多模态机器学习及空间语义推理等任务提供标准化数据基石。这一工作显著提升了地理数据在信息抽取、地理问答及语言模型预训练等领域的可用性与可解释性。
当前挑战
该数据集致力于应对两重核心挑战。在领域问题层面,传统地理空间数据集多局限于几何属性或单一语言标签,难以支撑跨语言语义理解与细粒度地理实体描述,而osm-polygon-wikidata-only通过大规模集成多语言文本与结构化知识,填补了这一空白,但数据覆盖的非平衡性成为显著难题:仅13.9%的多边形拥有英文文章,而343种语言中前20种占据了68.4%的文章量,低资源语言的稀疏性制约了模型泛化能力。在构建过程中,挑战源自异构数据源的融合与清洗:需解决OSM多边形标识与Wikidata实体ID的精确匹配、维基百科文章版本一致性控制、跨语言文本的编码对齐,以及处理API限流、解析失败等工程异常,同时确保在ODbL、CC0与CC BY-SA等多元许可协议下的合规汇聚与归因,这些均要求精密的数据流水线与严谨的数据治理策略。
常用场景
经典使用场景
在全球地理信息科学与自然语言处理交叉领域,osm-polygon-wikidata-only数据集为多模态地理实体理解提供了精妙的数据基石。该数据集汇聚了逾二十五万个带有Wikidata引用的OpenStreetMap多边形要素,并为其关联了横跨343种语言的四十余万篇维基百科全文文章。研究者常借此构建地理实体检索与分类系统,例如通过多边形几何特征与多语文本文档的联合嵌入,完成对公园、湖泊、行政边界等地理对象的语义标注与多语言命名实体识别,亦可用于地理空间知识图谱的补全与对齐任务。
解决学术问题
长期以来,地理信息学界面临着一个核心困境:具备精确几何形态的空间数据与富含语义描述的文本知识之间存在着难以跨越的鸿沟。该数据集通过将OSM的精细多边形几何与Wikidata的结构化描述、Wikipedia的多语言全文无缝衔接,解决了地理实体在跨语言、跨模态上的语义对齐难题。这一创新使得学者能够系统性地探讨空间位置与文本叙述之间的互馈关系,推动了地理信息检索中语言无关性特征的提取方法研究,并为地理本体工程提供了海量、多源、高质量的训练素材,显著提升了地理命名实体消歧与空间关系推理的科研效率。
衍生相关工作
该数据集的诞生催生了多项开创性的学术探索。基于其多边形与多语文档的互补结构,研究者提出了地理实体语言模型(GeoLM),通过预训练方式融合空间坐标与词嵌入,大幅度提升了地理查询的语义理解性能。另一衍生成果是跨语言地理知识图谱构建工具GeoTriples,它利用数据集中的Wikidata对齐关系与维基百科网络拓扑,自动抽取出高精度的地理事实三元组。此外,还有相关工作通过在数据集上实施空间区域编码与文档主题建模,实现了对大洲尺度的地理文化区域进行无监督聚类分析,为计算社会科学提供了崭新的方法论视角。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务