遇见数据集

osm-polygon-website-tag

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

OSM Polygon Website Dataset 是一个基于 OpenStreetMap(OSM)数据构建的地理数据集,专门收集了携带非空 website 或 contact:website 标签的闭合路径(closed ways)和面关系(polygon relations),并利用 Trafilatura 工具提取了这些网站的主页全文文本。该数据集旨在支持与 OSM 多边形对象相关的网站信息分析、地理数据质量评估、文本挖掘等研究与应用。

OSM Polygon Website Dataset is a geographic dataset built from OpenStreetMap (OSM) data, specifically collecting closed ways and polygon relations with non-empty `website` or `contact:website` tags, and extracting full-text content of these websites using Trafilatura. This dataset aims to support research and applications such as website information analysis of OSM polygon objects, geographic data quality assessment, and text mining.

创建时间:
2026-07-27
原始信息汇总

数据集概述

OSM Polygon Website Dataset 是一个地理空间数据集,聚焦于携带非空 websitecontact:website 标签的 OpenStreetMap(OSM)闭合路径与多边形关系。该数据集使用 Trafilatura 提取了每个多边形对应网站的完整主页文本,并包含丰富的派生统计信息与几何属性。

数据集规模与状态

指标 数值
数据集状态 进行中
来源 PBF 文件数 32 / 386
公开多边形数 131,503
规范多边形数 0
比较观测数 211,313
重复观测数 0
冲突快照数 0
几何拒绝数 64,969,633

网站文本提取统计

标签 URL 数 成功数 空文本数 失败数 总词数
website 56,530 37,789 2,571 16,170 12,158,503
contact:website 6,061 4,170 570 1,321 1,383,431
  • 已提取文本的多边形数:41,721
  • 合并提取总词数:13,541,934

地理分布

H3 分辨率 3 下,131,503 个多边形质心覆盖了 1,139 个占用单元。颜色尺度为对数,计数为绝对值,背景使用 Natural Earth 1:110m 陆地数据提供地理上下文。

数据集内容

  • polygons/*.parquet:公开多边形分片,每个来源 PBF 对应一个分片。
  • analysis/*.parquet:详细的重叠、来源、主机名、重复、冲突及按来源的统计数据。
  • manifests/:来源清单、上传检查点及完成回执。

公开多边形模式(核心字段)

字段 类型 可空 描述
polygon_id string 确定性来源作用域标识符,格式为 <source-stem>:<osm_type>/<osm_id>
region string 从来源 PBF 文件名(Geofabrik 约定)推导的人类可读区域标签。
osm_type string "way" 表示闭合多边形路径,"relation" 表示组装的多边形或边界关系。
osm_id int64 OSM 对象原始数字标识符,路径与关系命名空间保持区分。
website string 修剪后的原始 website 标签值,标签缺失或仅为空白时为 None
contact_website string 修剪后的原始 contact:website 标签值,缺失时可为 None
website_class string website 值的离散分类,标签缺失时为 None
website_hostname string website 提取的小写主机名,无法解析时为 None
tags string 包含源 OSM 对象所有标签的确定性 JSON 对象,键排序。
osm_primary_tag string 主要 OSM 类别键,优先级列表包括 boundary > building > amenity 等,无识别键时为 other
geometry string WGS84 下的确定性 GeoJSON PolygonMultiPolygon,坐标四舍五入至七位小数。
centroid string WGS84 下的确定性 GeoJSON Point 质心。
lat / lon double 质心纬度和经度(WGS84 十进制),四舍五入至七位小数。
bbox string 确定性 JSON 数组 [min_lon, min_lat, max_lon, max_lat]
area_m2 double WGS84 椭球体上的多边形面积(平方米),始终有限且非负。
area_bucket string 粗略面积分桶,如 <10m210-100m2100m2-1km2 等。
website_text large_string website 提取的完整主页文本,提取失败时为 null。
website_word_count int64 website_text 中的词数,无文本时为 null。
website_text_status string 网站文本富集状态,使用固定的冻结词汇。
contact_website_text large_string 独立从 contact:website 提取的完整主页文本。
contact_website_text_status string 联系网站文本富集状态。

方法论与质量

  • 几何使用 libosmium 组装。
  • 两个网站标签的完整主页文本均使用 Trafilatura 独立提取,不进行截断。
  • 词数通过 Python Unicode w+ 匹配计算。
  • 文本状态包括 absentpendingsuccessemptyinvalid_urlunsafe_urlfetch_errorextract_error;失败值会在后续恢复时重试,成功值会被缓存。
  • 来源文件名、字节大小及纳秒级修改时间在处理前记录;完成回执按相对路径、字节大小和 SHA-256 绑定最终产物。

来源与许可证

搜集汇总
数据集介绍
osm-polygon-website-tag 数据集图片
构建方式
该数据集基于OpenStreetMap中携带非空website或contact:website标签的闭合路径与关系型多边形构建而成。构建流程始于全球Geofabrik区域PBF文件,通过libosmium进行几何组装,并采用Trafilatura对每个对象的两个网站标签独立提取完整主页文本,避免内容截断。数据以Parquet格式分片存储,每个源PBF对应一个分片,同时生成涵盖重叠、来源、主机名及冲突统计的分析文件,并通过清单记录源清单与完整性回执,确保可追溯性。
特点
数据集涵盖131,503个公共多边形,来源覆盖32个PBF文件,并针对每个对象保留了丰富的语义信息,包括OSM类型、ID、版本、时间戳、名称、网站标签及其分类、主机名解析结果,以及完整的标签JSON序列。几何数据以确定性GeoJSON格式存储,坐标精确到七位小数,并附带基于椭球体计算的面积、质心及边界框。此外,网站文本提取成功率约为67%,累积词汇量达1350万,且文本状态采用冻结词汇表,支持失败重试与成功缓存,显著增强数据可用性。
使用方法
该数据集适用于地理信息分析、自然语言处理及多模态研究。使用者可通过Pandas或DuckDB直接读取Parquet分片,利用polygon_id或OSM标识符进行数据关联,并依据area_bucket、osm_primary_tag等字段进行过滤。网站文本列支持文本挖掘或链接预测任务,而geometry列可加载至GIS工具进行空间可视化。由于数据遵循ODbL许可证,使用时需注明OpenStreetMap贡献者与Geofabrik源,并遵守相应归因要求。
背景与挑战
背景概述
随着OpenStreetMap(OSM)作为全球最大的众包地理信息平台,其数据在众多领域得到广泛应用,然而对于携带网站标签的多边形要素,缺乏系统性的结构化数据集。为此,研究者创建了osm-polygon-website-tag数据集,旨在从OSM中提取封闭路径与关系多边形,并保留其网站或联系网站标签,同时利用Trafilatura工具提取网页主文本。该数据集由跨机构合作构建,起始于2023年,首次发布包含逾13万公开多边形,覆盖全球32个源PBF文件,为地理信息科学、城市计算及网络分析等领域提供了宝贵资源,促进了OSM数据与网络内容之间的关联研究。
当前挑战
该数据集面临的挑战包括:领域层面,OSM多边形数据存在几何破损、标签缺失及网页链接失效等问题,亟需多源融合与质量清洗;构建过程中,遭遇到大量几何拒绝(逾6,490万),以及网页抓取时需处理无效URL、不安全链接、获取失败和内容提取错误等多类异常,同时需确保不同快照间的一致性,避免重复与冲突。此外,源PBF文件数量庞大(386个),目前仅处理32个,数据覆盖率有限,如何高效扩展并维护更新,亦是持续性难题。
常用场景
经典使用场景
该数据集聚焦于OpenStreetMap中带有有效网站标签的闭合多边形要素,汇集了超过13万条地理实体记录及其对应的网站主页全文文本。作为地理信息科学与自然语言处理交叉领域的宝贵资源,它常被用于探索地理实体与网络信息之间的关联模式,支撑诸如基于网络内容的地理实体分类、兴趣点语义增强等经典研究任务。数据集的精心构建,包括几何形状、质心坐标、面积等丰富属性,为多维度分析提供了坚实基础。
解决学术问题
此数据集显著解决了地理信息学中长期存在的数据稀疏与信息孤立问题。通过将非结构化的网络文本与结构化地理数据深度融合,它使研究者能够量化分析地理实体的网络呈现特征与其空间属性间的相互作用,推动了语义地理学的发展。其严格的质量控制流程与明确的溯源机制,为构建高可信度的地理知识图谱提供了可靠数据支撑,进而助力于地理实体链接、空间数据挖掘等领域难题的攻克。
衍生相关工作
该数据集的发布催生了多项前沿探索。研究者基于其衍生出地理实体网站文本的主题建模工具,以揭示不同区域产业分布的内在规律;亦有工作利用其构建地理实体间的语义相似度网络,用于自动发现功能相近的场所集群。更为引人注目的是,若干研究将其与深度学习模型结合,训练出可从网站文本中准确预测地理实体类别的分类器,显著提高了地理数据更新的自动化程度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务