遇见数据集

osm-polygon-description-tag

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

OSM多边形描述标签数据集是一个从OpenStreetMap(OSM)区域提取中系统收集的地理空间数据集。该数据集专门聚焦于OSM中所有带有非空描述标签(包括基础description标签和带后缀的description:<suffix>标签)的多边形和多多边形几何要素。数据通过osmium工具处理,采用区域处理策略(area_tags: true, linear_tags: true),并包含成功组装面积的type=multipolygon和type=boundary关系。数据集以GeoParquet格式组织,每个OSM区域提取对应一个文件,共计184个文件,包含428,644行数据和367,655,861个地理特征。数据规模方面,包含144,834行基础名称数据、18,170行本地化名称数据、416,908行基础描述数据和16,444行本地化描述数据。数据覆盖广泛的语言和标签变体,描述后缀频率统计显示包含从通用语言代码(如en、zh、de、fr、ru等)到特定属性标签(如height、floor、emergency、covid19等)的多样化后缀。名称后缀同样呈现多样性,包括历史时期标记、语言变体和特殊用途标签。数据集中的几何要素全部为MultiPolygon类型,面积分布范围极广,从0.003平方米到3.477万亿平方米不等。时间跨度从2008年2月到2026年7月,覆盖了OSM数据的长期演变。该数据集适用于地理信息系统分析、多语言地理文本挖掘、开放地图数据质量评估、区域描述模式研究等任务,为研究人员和开发者提供了丰富的、带有文本描述的地理多边形标注数据。

The OSM Polygon Description Label Dataset is a geospatial dataset systematically collected from OpenStreetMap (OSM) region extracts. It specifically focuses on all polygon and multipolygon geometries in OSM that have non-empty description tags (including the base description tag and description:<suffix> tags). The data is processed using the osmium tool with area processing strategies (area_tags: true, linear_tags: true) and includes type=multipolygon and type=boundary relations that have successfully assembled areas. The dataset is organized in GeoParquet format, with each OSM region extract corresponding to one file, totaling 184 files, containing 428,644 rows and 367,655,861 geographic features. In terms of data scale, it includes 144,834 rows of base name data, 18,170 rows of localized name data, 416,908 rows of base description data, and 16,444 rows of localized description data. The data covers a wide range of languages and tag variants, with description suffix frequency statistics showing diverse suffixes from common language codes (e.g., en, zh, de, fr, ru) to specific attribute tags (e.g., height, floor, emergency, covid19). Name suffixes also exhibit diversity, including historical period markers, language variants, and special-purpose tags. All geometric features in the dataset are of MultiPolygon type, with area distribution ranging from 0.003 square meters to 3.477 trillion square meters. The time span ranges from February 2008 to July 2026, covering the long-term evolution of OSM data. The dataset is suitable for tasks such as GIS analysis, multilingual geographic text mining, open map data quality assessment, and regional description pattern research, providing researchers and developers with rich, textually annotated geographic polygon data.

创建时间:
2026-07-27
原始信息汇总

数据集概述:OSM Polygon Description Tag

基本信息

  • 名称:OSM Polygon Description Tag
  • 许可协议:ODbL(Open Database License)
  • 语言:多语言(multilingual)
  • 标签:地理空间(geospatial)、OpenStreetMap、GeoParquet
  • 数据集类型:每个 OpenStreetMap 区域提取对应一个 GeoParquet 文件

数据内容

  • 包含每个 OpenStreetMap 区域提取中所有带有至少一个非空 descriptiondescription:<suffix> 标签的多边形或复合多边形。
  • 通过 osmium 的通用区域处理(area_tags: true, linear_tags: true, --geometry-types polygon)选择闭合路径;当区域组装成功时,包含 type=multipolygontype=boundary 关系。

统计信息

  • 输出文件数量:212 个
  • 总行数:452,107 行
  • 发出的要素数:422,867,107 个
  • 基础名称行数:153,508 行
  • 本地化名称行数:19,977 行
  • 基础描述行数:440,033 行
  • 本地化描述行数:17,026 行
  • 源字节总数:41,365,500,593 字节
  • 输出字节总数:481,945,342 字节

按 OSM 类型统计

  • 关系(relation):29,224
  • 路径(way):422,883

按几何类型统计

  • MultiPolygon:452,107

描述后缀频率

  • 包含大量语言代码及非语言后缀,如 de(4,854)、en(4,728)、it(3,705)、zh(1,125)、fr(999)、ru(896)等,以及非标准后缀如 1939covid19url 等。

名称后缀频率

  • 包含大量语言代码及非标准后缀,如 en(8,492)、ru(3,512)、zh(2,614)、prefix(2,674)、ar(1,631)、de(1,359)等,以及历史年份(如 1977)或特定用途(如 disasteretymology)后缀。

转换拒绝原因

  • no_nonempty_description:422,415,000 次

面积分布(平方米)

  • 最小值:0.0032
  • 25%分位数:139.60
  • 中位数:1,057.89
  • 75%分位数:22,495.90
  • 最大值:3,477,486,032,789.22

OSM 数据时间戳范围(UTC)

  • 最小值:2008-02-03T04:10:29
  • 最大值:2026-07-25T21:38:32

文件列表(节选)

  • 数据集包含 212 个 GeoParquet 文件,按区域命名,例如:
    • afghanistan-latest.parquet(184 行)
    • albania-latest.parquet(149 行)
    • argentina-latest.parquet(8,884 行)
    • australia-latest.parquet(9,186 行)
    • austria-latest.parquet(8,465 行)
    • 每个文件附带源文件大小、输出文件大小及 SHA-256 哈希值。
搜集汇总
数据集介绍
osm-polygon-description-tag 数据集图片
构建方式
该数据集基于OpenStreetMap(OSM)的区域性提取文件,针对每一个地理区域生成独立的GeoParquet文件。数据集中仅收录那些携带至少一条非空description或description:<suffix>标签的多边形与多面体几何要素。具体构建过程中,通过osmium工具采用通用区域处理策略,激活area_tags与linear_tags选项,并限定geometry-types为polygon,以筛选闭合路径。此外,多边关系(type=multipolygon)及边界关系(type=boundary)在区域组装成功时亦被纳入,从而确保描述性标签覆盖的全面性与几何结构的完整性。
特点
该数据集囊括了横跨214个区域文件的452,359条记录,涵盖超过4.26亿个要素的筛选结果,展现了极为广泛的时空覆盖范围,其OSM数据时间戳最早可追溯至2008年。数据集中description标签后缀的语言种类极为丰富,除常见的英语、德语、法语外,还包含中文、阿拉伯语、日语及众多少数族裔语言,体现出显著的多语种特性。几何类型方面,所有要素均为MultiPolygon,面积跨度从接近零的极小微元到超过34亿平方米的宏观区域,分布特征经由四分位数清晰呈现。
使用方法
用户可通过地理区域名称访问对应于214个OSM区域提取的独立GeoParquet文件,例如使用afghanistan-latest.parquet代表阿富汗区域数据。这些文件可直接利用支持GeoParquet格式的GIS工具或数据处理库(如GeoPandas、Apache Arrow)载入,以便开展空间分析、地图制图或多语种描述文本挖掘等工作。数据集许可遵循ODbL协议,确保了在相应框架下的合法共享与再利用。建议使用者结合面积分布与语言标签过滤机制,聚焦特定研究兴趣区域或语言社群进行精细化分析。
背景与挑战
背景概述
OSM Polygon Description Tag数据集由OpenStreetMap社区于2026年创建,旨在系统化地收集和整理全球范围内所有携带非空description标签的多边形与多面体地理要素。该数据集以GeoParquet格式存储,覆盖214个区域提取文件,包含逾45万条记录,时间跨度从2008年至2026年,展现了开源地理信息社区在语义标注方面的不懈努力。核心研究问题聚焦于如何从海量众包地理数据中高效提取结构化的描述性文本,以支持地理信息检索、自然语言处理与空间语义理解等下游任务。该数据集的出现填补了大规模多语言地理描述数据的空白,对地理空间人工智能、智慧城市及文化景观数字化保护等领域具有重要推动价值。
当前挑战
该数据集旨在解决地理信息系统中描述性标签稀疏且语义异构的领域挑战,具体包括:1) 从OpenStreetMap中筛选出有效description标签的要素,过滤掉海量无描述的多边形(超过4.25亿个被排除要素);2) 处理多语言、多后缀描述标签的异构性,涉及数百种语言变体和非标准编码;3) 构建过程中需应对数据一致性检验,如确保所有输出为唯一的多面体几何类型,并处理关系类型(type=multipolygon与type=boundary)的合并失败情况。此外,数据分布极不均衡,面积从0.003平方米到34.7亿平方米不等,给统计分析与模型训练带来显著挑战。
常用场景
经典使用场景
该数据集专注于从OpenStreetMap区域数据中提取带有描述标签的多边形和多多边形要素,以GeoParquet格式存储,为地理信息科学领域提供了高质量的结构化数据。其经典使用场景涵盖了对地表覆盖物、建筑物、历史遗迹、自然保护区等空间对象的语义描述分析,研究者可借助该数据集探索不同语言和地域中描述标签的分布规律,支撑多模态地理信息检索与空间语义理解的研究。
解决学术问题
该数据集有效解决了地理信息科学中非结构化文本描述与空间几何难以联合分析的学术难题。通过系统收集全球范围内带有description标签的多边形数据,研究者得以开展空间对象的语义分类与聚类研究,探讨描述标签的语言多样性与地域文化特征。同时,它也为地理知识图谱构建、空间实体对齐以及众源地理数据质量评估提供了关键数据基础,推动了从空间数据向空间知识的转化进程。
衍生相关工作
该数据集衍生出的相关经典工作包括多语言地理描述标签的翻译与对齐方法研究、基于深度学习的地理实体描述自动生成模型,以及结合空间上下文的语义相似度计算框架。在此基础上,学者们还发展出描述标签的质量验证体系与时空演化分析技术,为OpenStreetMap数据贡献的持续优化提供了理论支撑。这些衍生工作进一步拓展了众源地理信息在数字人文、计算社会科学等领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务