遇见数据集

osm-polygon-wikidata-and-wikipedia

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

OSM Polygon Wikidata + Wikipedia, V2 是一个多模态地理空间数据集,结合了OpenStreetMap(OSM)中的多边形数据与Wikidata、Wikipedia、Wikivoyage的多语言文本和结构化知识。该数据集在V1版本(仅包含OSM多边形中带有`wikidata=*`标签的部分)的基础上,新增了有效的多语言`wikipedia=*`标签引用,包括没有Wikidata QID的多边形。数据集包含以下组成部分:多边形几何数据(polygons)、多边形与文档的链接关系(polygon_document_links)、多语言Wikipedia文档及章节(wikipedia_documents和wikipedia_sections)、多语言Wikivoyage文档及章节(wikivoyage_documents和wikivoyage_sections)、以及Wikidata事实(wikidata_facts)。数据规模:覆盖386个区域,包含1,259,424个多边形,1,119,287个唯一Wikidata实体,2,332,127个文档,12,364,053个Wikipedia章节,302,200个Wikivoyage章节,3,901,092个Wikidata事实,2,527,091个多边形-文档链接,涉及353种语言。总存储空间约21.2 GB(Parquet格式)。文档基于去重策略,每个区域内按`document_id`和`(polygon_id, project, document_id)`进行去重。`discovery_sources`字段说明多边形来源(`wikidata`或`wikipedia_tag`),`link_sources`字段说明多边形-文档关系的来源(`wikidata_sitelink`或`osm_wikipedia_tag`)。该数据集适用于地理空间分析、多语言自然语言处理、知识图谱构建、地理信息检索等任务。

OSM Polygon Wikidata + Wikipedia, V2 is a multimodal geospatial dataset that combines polygon data from OpenStreetMap (OSM) with multilingual text and structured knowledge from Wikidata, Wikipedia, and Wikivoyage. Building on the V1 version (which only included OSM polygons with a `wikidata=*` tag), this version adds valid multilingual `wikipedia=*` tag references, including polygons without a Wikidata QID. The dataset includes the following components: polygon geometry data (polygons), polygon-document link relationships (polygon_document_links), multilingual Wikipedia documents and sections (wikipedia_documents and wikipedia_sections), multilingual Wikivoyage documents and sections (wikivoyage_documents and wikivoyage_sections), and Wikidata facts (wikidata_facts). Data scale: covers 386 regions, contains 1,259,424 polygons, 1,119,287 unique Wikidata entities, 2,332,127 documents, 12,364,053 Wikipedia sections, 302,200 Wikivoyage sections, 3,901,092 Wikidata facts, 2,527,091 polygon-document links, involving 353 languages. Total storage is approximately 21.2 GB (Parquet format). Documents are deduplicated based on a strategy that removes duplicates within each region by `document_id` and `(polygon_id, project, document_id)`. The `discovery_sources` field indicates the source of polygons (`wikidata` or `wikipedia_tag`), and the `link_sources` field indicates the source of polygon-document relationships (`wikidata_sitelink` or `osm_wikipedia_tag`). This dataset is suitable for geospatial analysis, multilingual natural language processing, knowledge graph construction, geographic information retrieval, and other tasks.

创建时间:
2026-08-03
原始信息汇总

数据集概述

OSM Polygon Wikidata + Wikipedia, V2 是一个地理空间数据集,将 OpenStreetMap (OSM) 多边形与 Wikidata、Wikipedia 和 Wikivoyage 的文本及结构化事实相链接,为多边形提供丰富的多语言文本信息。

基本信息

  • 许可证: ODbL
  • 语言: 英语
  • 版本: 2.0.0
  • 区域数量: 386
  • 多边形数量: 1,259,424
  • 总 Parquet 存储量: 21.2 GB

数据规模

指标 数值
唯一 Wikidata 实体 1,119,287
Wikipedia 文档 2,317,707
Wikivoyage 文档 14,420
Wikipedia + Wikivoyage 文档总数 2,332,127
Wikipedia 章节 12,364,053
Wikivoyage 章节 302,200
Wikidata 事实 3,901,092
多边形-文档链接 2,527,091
仅 Wikipedia 标签的多边形 33,682
文档总词数 833,590,596
涉及语言数 353

数据配置

数据集包含以下配置,均以 Parquet 格式存储:

  1. polygons — 每个保留的 OSM 多边形一行
  2. polygon_document_links — 统一的 Wikipedia 和 Wikivoyage 多边形链接
  3. wikipedia_documents — 多语言 Wikipedia 文档
  4. wikipedia_sections — Wikipedia 文档章节(保留 V1 的 22 列章节结构)
  5. wikivoyage_documents — Wikivoyage 文档
  6. wikivoyage_sections — Wikivoyage 章节
  7. wikidata_facts — 结构化 Wikidata 事实

与 V1 版本对比

V2 在 V1 的基础上增加了对有效的多语言 wikipedia=* 标签的支持,包括没有 Wikidata QID 的多边形。主要增量:

  • 通过 V2 Wikipedia 标签新增多边形:75,314
  • 新增 Wikipedia 文档标识:26,038
  • 新增文档词数:32,062,262
  • 新增文档章节数:366,888

数据来源与去重

数据集的 discovery_sources 字段说明了多边形纳入的方式:wikidata 表示来自 OSM 的 wikidata=* 标签,wikipedia_tag 表示来自 OSM 的 wikipedia=* 标签。link_sources 字段说明了多边形-文档关系:wikidata_sitelink 表示来自 Wikidata 站点链接,osm_wikipedia_tag 表示直接来自 OSM 的 wikipedia=* 标签。

去重规则:文档按 document_id 去重,多边形-文档链接按 (polygon_id, project, document_id) 在每个区域内去重。字节相同的重复项被确定性合并,冲突项则无法通过验证。

可复现性

可以使用 sync-dir --dataset-version v2 显式运行 V2 版本处理。V1 保持独立契约,不会被 V2 处理修改。

引用

使用该数据集时,可从 CITATION.cff 文件下载引用元数据进行引用。

搜集汇总
数据集介绍
osm-polygon-wikidata-and-wikipedia 数据集图片
构建方式
该数据集在V1版本基础上,融合了OpenStreetMap(OSM)多边形要素与维基数据(Wikidata)、维基百科(Wikipedia)及维基导游(Wikivoyage)的多语言文本信息。构建过程中,不仅保留了带有'wikidata=*'标签的多边形,还新增了有效的多语言'wikipedia=*'标签,即包括缺乏Wikidata QID的多边形。数据通过Trackio快照和确定性去重算法,对文档及多边形-文档链接进行去重,并记录每条链接的来源(如'wikidata_sitelink'或'osm_wikipedia_tag'),确保数据可追溯。
特点
该数据集覆盖386个区域,包含1,259,424个多边形、1,119,287个唯一Wikidata实体、约233万篇维基百科与维基导游文档、1236万个维基百科章节、390万个Wikidata事实及252万个多边形-文档链接。文档总词数达8.33亿,涵盖353种语言。与V1相比,新增75,314个多边形,并扩展了文档和词数,显著提升了地理实体与文本关联的广度与多样性。
使用方法
数据集提供多个配置子集,如'polygons'存储多边形几何属性,'wikipedia_documents'与'wikipedia_sections'提供维基百科文档及章节,'wikidata_facts'包含结构化知识,而'polygon_document_links'则关联多边形与文档。用户可通过HuggingFace datasets库加载指定配置(如加载polygons子集),并利用'discovery_sources'和'link_sources'字段理解数据来源。数据集采用Parquet格式,便于高效处理大规模地理文本联合分析,适用于地理信息检索、实体链接和知识图谱构建等研究。
背景与挑战
背景概述
该数据集由NoeFlandre等人于2024年创建,旨在融合OpenStreetMap(OSM)的多边形几何信息与维基百科、维基导游及维基数据的丰富文本和事实性知识,为地理空间人工智能研究提供大规模多模态语料库。其核心研究问题在于如何系统性地建立地理实体与其多语言描述文本之间的关联,突破单一数据源的局限。通过覆盖386个区域、125万+多边形及23万+文档,该数据集为地理信息检索、多语言自然语言处理及知识图谱构建等领域提供了基准资源,推动了地理空间语义理解的研究进展。
当前挑战
该数据集面临的挑战主要涵盖两大方面。其一,在领域问题层面,地理实体识别与语义对齐的复杂性极高,OSM多边形与维基数据、维基百科之间常存在标签不一致或缺失的情况,且多语言文本的覆盖不均增加了跨语言知识融合的难度。其二,在构建过程中,数据规模庞大且来源多样,需处理不同数据源间的schema差异、重复记录及冲突信息,尤其是多边形与文档链接的精确匹配需依赖多级去重与启发式规则,同时确保数据质量与可复现性,这些环节均对计算资源和算法鲁棒性提出了严苛要求。
常用场景
经典使用场景
该数据集是地理信息科学与自然语言处理交叉领域的重要资源,通过整合OpenStreetMap的多边形几何数据与Wikidata的结构化知识、Wikipedia及Wikivoyage的多语言文本,构建了大规模的地球物理实体-文本关联库。其经典使用场景涵盖多模态地理实体检索、地理知识图谱构建、以及基于文本的地理位置推理等,为研究者提供了在真实世界数据上验证跨模态对齐技术的基准平台。
实际应用
在实际应用中,该数据集可用于构建智能地图搜索引擎,使用户能通过自然语言查询精确定位地理区域;支撑旅游资源推荐系统,整合维基导游文本与地理边界以提供丰富的目的地信息;还可为导航应用增强地标名称多语言识别能力,以及为城市规划和社会感知研究提供带语义标注的地理对象数据库。
衍生相关工作
该数据集衍生了一系列重要工作,包括基于OSM多边形与维基百科链接的地理实体消歧模型、利用多语言文本增强的地理实体嵌入方法,以及将地理坐标与文本描述结合的多模态预训练模型。后续研究还探索了利用Wikidata事实进行地理关系推理、开发跨语言地理问答系统等,形成了以地理文本关联为核心的研究脉络,推动了地理信息检索与知识图谱技术的深度融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务