遇见数据集

osm-polygon-web-search

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集名为“OSM Polygon Web Search”,是一个公开的 Hugging Face 数据集,包含一个经过明确批准的 POC(概念验证)表 `train.parquet`。表中的每一行对应一个通过 Brave 搜索引擎抓取的网页,并记录了与该网页相关的多边形几何信息、查询关键词、页面元数据以及经过 Trafilatura 工具提取的完整页面文本。数据集覆盖九种查询变体:V1“土地覆盖”、V2“土地利用”、V3“植被”、V4“地形”、V5“土壤表面”、V6“生态系统”、V7“自然地理”、V8“建筑基础设施”和V9“景观环境”。主要字段包括:多边形几何(GeoJSON、质心、边界框)、OSM 标识(多边形名称、国家、OSM 类型、OSM ID、土地利用)、查询信息(关键词、确切查询)、页面元数据(页面排名、标题、URL、HTTP 状态)以及页面文本及其字符数。该数据集专门设计用于 Hugging Face Dataset Viewer,以便用户直接检查抓取结果。注意:提取的证据和标准字段已被省略,但完整解析的文本仍然可用。Apache-2.0 许可证仅适用于项目的原始代码和文档,OSM 派生字段和网络派生文本应遵循其各自来源的条款。

The dataset is named OSM Polygon Web Search, a public Hugging Face dataset containing a POC (Proof of Concept) table `train.parquet`. Each row corresponds to a web page crawled via the Brave search engine, recording polygon geometry information, query keywords, page metadata, and the full page text extracted by the Trafilatura tool. The dataset covers nine query variants: V1 Land Cover, V2 Land Use, V3 Vegetation, V4 Terrain, V5 Soil Surface, V6 Ecosystem, V7 Physical Geography, V8 Built Infrastructure, and V9 Landscape Context. Key fields include: polygon geometry (GeoJSON, centroid, bounding box), OSM identifiers (polygon name, country, OSM type, OSM ID, land use), query information (keyword, exact query), page metadata (page rank, title, URL, HTTP status), and page text along with its character count. The dataset is specifically designed for the Hugging Face Dataset Viewer to allow users to directly inspect the crawled results. Note: Extracted evidence and standard fields have been omitted, but the fully parsed text remains available. The Apache-2.0 license applies only to the original code and documentation of the project; OSM-derived fields and web-derived text should follow the terms of their respective sources.

创建时间:
2026-08-26
原始信息汇总

数据集概述:OSM Polygon Web Search

数据集地址:https://huggingface.co/datasets/NoeFlandre/osm-polygon-web-search

简介
该数据集是一个公开的 Hugging Face 数据集,包含一个经明确批准的 POC(概念验证)表,存储于 train.parquet 文件中,每一行对应一个抓取的网页。数据集专为 Hugging Face Dataset Viewer 设计,公开了多边形几何信息、Brave 搜索查询、网页 URL、标题、HTTP 状态码以及通过 Trafilatura 解析的完整页面文本。


数据内容

  • 查询变体:共覆盖 9 种查询变体,包括:
    • V1:land cover
    • V2:land use
    • V3:vegetation
    • V4:terrain
    • V5:soil surface
    • V6:ecosystem
    • V7:physical geography
    • V8:buildings infrastructure
    • V9:landscape environment

主要字段说明

字段名 用途
polygon_geojson、centroid、bounding-box 字段 多边形几何和地图上下文
polygon_namecountryosm_typeosm_idlanduse OSM 实体标识和标签
query_keywordquery 批准的查询关键词短语及实际使用的 Brave 查询语句
page_ranktitlepage_urlhttp_status 检索到的页面元数据
texttext_char_count 由 Trafilatura 提取的完整页面文本及其长度

数据说明与限制

  • 本版省略了提取的证据和标准字段,但保留了完整的解析文本(text)以供检查。
  • 原始 PBF 文件和本地中间产物仅存于本地,上传表中仅包含 source_pbf 字段(PBF 文件名),不含本地路径、原始 HTML 或提供方的响应内容。
  • 为便于在 Viewer 中检查结果,本 POC 明确包含了完整的页面解析文本。

许可说明

  • 该数据集采用 Apache-2.0 许可证,适用于项目原始代码和文档。
  • OSM 派生字段和网页派生文本保留其来源特定的条款,不应视为 Apache-2.0 授权内容。
搜集汇总
数据集介绍
osm-polygon-web-search 数据集图片
构建方式
该数据集源自对OpenStreetMap(OSM)地理实体的系统化探索,通过将OSM多边形要素与网络搜索引擎(Brave)查询结果联动,构建了一组地理空间与网页文本的关联数据。其构建流程严谨,基于九种精心设计的查询变体(如土地覆盖、植被、地形等),对每个OSM多边形执行标准化查询,并利用Trafilatura工具提取完整网页文本。数据以Parquet格式存储于`train.parquet`文件,每个记录对应一个获取的网页,包含多边形几何(GeoJSON)、OSM标识、查询关键词、页面URL及状态码等结构化字段,同时保留原始文本内容,从而形成一套可复现、可审计的地理参考语料库。
特点
该数据集的核心特色在于其深度整合地理空间信息与网络文本资源,提供了一种新颖的多模态数据视角。每条记录均包含精确的多边形几何信息(如重心、边界框)及OSM语义标签(如`landuse`),并关联了特定的网页搜索查询与结果,涵盖自然地理与人文景观的多元主题。数据集详细记录了查询变体与页面元数据(如标题、HTTP状态),使得研究者能追溯每个文本的检索背景。尤为重要的是,文本字段完整保留了网页的解析内容,便于直接用于信息抽取、语义关联或地理实体识别等任务,且数据设计兼顾了可读性与可扩展性,为后续研究提供了丰富的素材。
使用方法
此数据集可直接通过Hugging Face的Datasets库进行加载,界面友好,适合学术研究与实际应用。使用者可基于`polygon_geojson`字段实现地理可视化,或利用`text`字段进行自然语言处理,如主题建模、情感分析等。`query_keyword`与`query`字段支持按查询类型进行筛选,便于研究地理语义差异。数据集以Apache-2.0许可证发布,但需注意OSM与网页内容的单独条款。建议研究者在合规前提下,结合外部地理工具或语言模型,深入挖掘地理文本关联,推动地理信息科学、环境监测或城市建设等领域的创新研究。
背景与挑战
背景概述
随着地理空间数据与自然语言处理的深度融合,如何高效地将非结构化的网络文本与结构化的地理实体关联起来,已成为地理信息科学领域的重要研究方向。在此背景下,OSM Polygon Web Search数据集应运而生,由相关研究团队于近期构建并发布,旨在为开放街区地图(OSM)多边形要素提供系统性的网络证据搜索与解析基准。该数据集围绕九种核心地理语义查询变体,如土地覆盖、土地利用、生态系统等,采集了与OSM多边形对应的网页文本,并通过Trafilatura工具提取正文内容。其核心研究问题在于探索如何利用网络搜索增强OSM要素的语义描述,为地理信息检索、地理解译及遥感解译验证等任务提供数据支撑。该数据集的发布,为地理空间与文本跨模态研究提供了宝贵的实验资源,有望推动地理知识图谱构建与地理空间智能的发展。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,其核心任务是将多义、模糊的自然语言查询与精确的地理多边形实体进行匹配与关联,这涉及解决地理实体解析、语义消歧及跨模态对齐等长期存在的难题,尤其在地理语境复杂、术语多样的网页内容中,有效过滤噪声并抽取与OSM要素相关的证据文本尤为困难。在构建过程层面,数据采集需要向Brave搜索API发起查询并处理返回结果,这面临网络请求的合法性、查询频率限制及响应异构性等工程挑战;同时,从原始网页中提取纯净、结构化的全文内容,需应对不同网站的HTML结构差异、动态渲染内容及反爬机制,Trafilatura的解析效果也受限于网页质量。此外,数据清洗与脱敏流程需权衡信息完整性与隐私合规,例如本版本刻意省略了证据字段,仅保留解析文本,这在一定程度上限制了数据的直接可用性。
常用场景
经典使用场景
该数据集以OpenStreetMap(OSM)多边形要素为地理锚点,结合Brave搜索引擎检索的网页文本,构建了地理空间与网络文本的跨模态关联。经典使用场景聚焦于地理信息检索和地理文本挖掘,研究者可依据多边形几何、OSM标签(如landuse)及查询关键词,系统性地探索不同地理实体(如土地利用、植被、地形)的在线语义描述。其结构化字段设计(如centroid、bounding-box)便于空间索引与区域筛选,支持大规模地理语料库的构建与分析,为地理学、城市规划及环境科学等领域提供了数据基础。
实际应用
在实际应用中,该数据集可直接服务于智能地理信息检索系统,如基于文本的POI(兴趣点)描述增强、地图搜索引擎的语义理解模块,以及地理推荐服务。城市规划与管理机构可利用其网页文本分析区域功能特征,辅助用地评估。环境监测领域可借鉴其生态相关查询结果,用于地表覆盖信息的补充提取。此外,数据集的Apache-2.0许可和清晰架构便于集成至现有多模态地理分析平台,支持定制化文本挖掘与地理可视化,具有较高的工程应用价值。
衍生相关工作
基于该数据集,可衍生出一系列经典研究任务,例如地理实体文本描述生成模型,利用多边形属性与检索文本训练序列到序列模型,自动生成地物语义标签。同时可支撑地理预训练语言模型,将OSM空间关系与文本上下文联合编码,提升地理问答与位置理解能力。相关衍生工作还包括跨模态地理检索基准,用于评估文本检索与空间匹配的协同性能,以及地理知识图谱补全任务,利用网页证据推断地理实体的隐含关系。这些工作将推动地理信息科学与自然语言处理的交叉发展,形成新的研究增长点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务