遇见数据集

landuse-sentence-relevance-golden-human-set

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集是用于土地使用句子相关性的人工黄金标准集,包含100个英文句子,每个句子均经过人工标注,判断其是否描述了该地点可观察或地理特征(如土地利用、土地覆盖、土壤、地表、植被、生态系统、地形、地貌、可见建筑或基础设施,或地方的自然地理环境、形状、位置或范围)。数据集适用于文本分类任务,可用于训练或评估模型对句子与地点地理特征相关性的判断能力。数据来源包括OpenStreetMap(OSM)多边形关联的维基百科和网站文本,句子经过分割和语言过滤。数据集包含丰富的元数据字段,如候选ID、句子、来源、H3地理单元、经纬度、地点名称、区域等,并提供了明确的标签(Yes/No)。许可证兼容多个开源协议,其中原始标注和项目元数据采用Apache-2.0,OSM衍生字段采用ODbL,维基百科文本采用CC BY-SA 4.0。

This dataset is a human-annotated gold standard set for land use sentence relevance, containing 100 English sentences. Each sentence has been manually labeled to determine whether it describes observable or geographic features of a place (e.g., land use, land cover, soil, surface, vegetation, ecosystem, terrain, landform, visible buildings or infrastructure, or the natural geographic environment, shape, location, or extent of the place). The dataset is suitable for text classification tasks, used to train or evaluate models ability to judge the relevance of sentences to geographic features of a location. Data sources include Wikipedia and website texts associated with OpenStreetMap (OSM) polygons, with sentences segmented and language-filtered. It includes rich metadata fields such as candidate ID, sentence, source, H3 geographic unit, latitude/longitude, place name, region, etc., and provides explicit labels (Yes/No). The license is compatible with multiple open-source licenses, where original annotations and project metadata are under Apache-2.0, OSM-derived fields under ODbL, and Wikipedia text under CC BY-SA 4.0.

创建时间:
2026-08-23
原始信息汇总

数据集概述:土地利用句子相关性人工黄金集

基本信息

  • 数据集名称:Land-use sentence relevance golden human set
  • 任务类型:文本分类
  • 语言:英语
  • 许可证:Apache-2.0、ODbL、CC BY-SA 4.0
  • 数据集规模:少于1,000条样本

数据规模与划分

  • 总样本数:100条句子
  • 划分方式:仅包含训练集(train),共100个样本
  • 数据集大小:38,591字节(下载大小32,062字节)

数据字段

字段名 数据类型 说明
candidate_id string 候选样本ID
sentence string 待分类的句子
source string 数据来源
source_record_id string 来源记录ID
source_field string 来源字段
h3_cell string H3地理编码单元
h3_resolution int64 H3分辨率
latitude float64 纬度
longitude float64 经度
place_name string 地名
region string 区域
source_url string 来源URL
language string 语言
label string 标注标签(Yes/No)

数据集结构设计

该数据集设计遵循严格的合同约束:

  • 50条来自维基百科,50条来自网站
  • 50条为"Yes"标签,50条为"No"标签
  • 分布在25个共享的H3分辨率3级单元中,每个单元包含两个来源各一行

标注任务

标注者需判断句子是否描述了该地点可观察或可地理特征化的内容,具体包括:

  • 土地利用或土地覆盖
  • 土壤或地表
  • 植被、生态系统
  • 地形、地貌
  • 可见建筑或基础设施
  • 地点的物理地理环境、形状、位置或范围

上游数据来源

  1. OSM多边形Wikidata和Wikipedia数据(修订版7c2a123b):仅使用英文维基百科数据,排除Wikivoyage
  2. OSM多边形网站标签数据(修订版2c681544):使用website_textcontact_website_text两个字段

数据处理工具

  • 句子分割:使用固定的SaT-12L-sm模型
  • 网站英语检测:使用固定的CommonLingua模型

许可说明

  • 原始标注和项目自有元数据采用Apache-2.0许可
  • OSM衍生字段保留ODbL许可
  • 包含的维基百科文本采用CC BY-SA 4.0许可
搜集汇总
数据集介绍
landuse-sentence-relevance-golden-human-set 数据集图片
构建方式
该数据集作为土地利用相关句子的黄金人工标注集,构建过程严谨且具有代表性。其数据源自OSM多边形与维基百科、网站标签的交叉整合,经过精细的句子分割与语言检测技术处理,最终精选出100条英文句子。构建策略确保数据集的均衡性,涵盖50条维基百科与50条网站来源的句子,并分别包含50条正例与50条负例,同时保证每条来源在25个共享的H3分辨率3级网格中各占两席,从而在空间分布上实现均匀覆盖。
特点
此数据集的核心特点在于其专业化的标注维度与精细化的空间关联。标注员依据句子是否描述可观察或地理特征的土地利用、土地覆盖、土壤、植被、生态系统、地形、可见建筑物或物理地理位置等信息进行判定,确保标注的语义精准性。此外,每条样本均关联了H3单元、经纬度、地名等丰富的地理元数据,这不仅增强了数据集的空间分辨率,也为后续的地理空间分析与模型训练提供了坚实的数据基础。
使用方法
该数据集主要用于文本分类任务的模型训练与评估,尤其是针对土地利用相关句子的相关性判断。研究者可基于此黄金集训练分类器,以识别描述地理特征的自然语言句子,或评估现有模型在此类任务上的性能。数据集的100条样本虽规模有限,但因其来源多样、标注准确,可作为基准测试集,验证模型在跨域地理文本上的泛化能力,并推动地理信息检索与自然语言处理的交叉研究。
背景与挑战
背景概述
该数据集由NoeFlandre研究团队创建,旨在应对地理空间信息检索中自然语言描述与土地利用(land use)分类之间的语义鸿沟问题。随着遥感、地理信息系统及自然语言处理技术的交叉发展,从非结构化文本中自动提取地理实体及其空间属性成为智慧城市与土地资源管理的迫切需求。该数据集精心构建了一个包含100条人工标注句子的黄金标准集(golden human set),语料源自英语维基百科及各机构官方网站,通过严格的采样策略确保数据在空间(H3格网)与来源上的均衡性。其核心研究问题聚焦于判断句子是否描述某地点可观察或可地理特征化的内容,涵盖土地利用覆盖、土壤、植被、地貌及基础设施等要素。这一数据集的提出为训练和评估句子级地理相关性分类模型提供了权威基准,对推动地理自然语言处理(GeoNLP)领域发展具有显著作用。
当前挑战
该数据集面临的挑战分布于标注规范、构建流程及模型适用层面。在标注上,地理相关性判定涉及主观理解与领域知识,如区分“历史事件”与“现状描述”,需要对隐含空间语义进行精准辨别,易导致标注者间不一致。构建中,数据源自OSM多边形关联的Wikipedia与网站文本,需处理跨源文本筛选、多语言识别(仅保留英语)及句子分割的准确性,尤其是使用固定的句子分割模型可能引入语言偏差。此外,样本量仅百条,虽保证了平衡性,但限制了深度学习模型的泛化能力,对跨区域、跨分辨率的地理预测带来挑战。最终,标签定义具有专属性,覆盖土地、植被等物理特征,但对人文地理要素的排除可能限制模型对综合地理场景的适应力,未来需扩展数据规模与类别多样性。
常用场景
经典使用场景
该数据集作为土地利用句级相关性的人工黄金集,其核心用途在于评估与验证自动文本分类模型对地理实体描述中土地利用与覆盖信息的识别能力。在自然语言处理与地理信息科学的交叉领域,研究者常利用此类精细标注的句子级数据构建基准测试,用于衡量模型在区分描述性地理特征(如植被、地形、建筑)与非描述性内容(如历史事件、文化背景)方面的性能。其独特的构造,涵盖维基百科与网站文本,均匀分布于25个H3分辨率3级网格单元,确保了地理多样性与内容平衡,为文本地理信息提取提供了一个标准化的评估框架。
解决学术问题
在土地利用与土地覆盖信息自动提取研究中,现有数据集多侧重于遥感影像或结构化文本,缺乏对非结构化文本中隐含地理特征描述的系统捕获。本数据集精准地填补了此类空白,为学术研究提供了高质量的标注语料,用以解决从海量开源文本中自动识别与地理实体物理属性相关句子的核心问题。通过引入严格的人工标注标准,该数据集成为训练与评估机器学习模型的关键资源,推动了对文本中地理实体空间特性理解的研究进展,并促进了多模态地理知识图谱的构建与地理信息检索技术的优化。
衍生相关工作
该数据集催生了一系列围绕文本地理特征提取的后续研究。其发布促进了领域内针对多源异构文本(维基百科与网页)的跨域迁移学习方法的探索,衍生出专门针对地理实体描述的自监督学习模型。研究者基于其精细标注,开发了面向地理命名实体识别与关系抽取的扩展数据集,并启发了对H3网格化地理文本表示学习的研究。同时,该黄金集也常被用作多语言地理信息抽取评测的基准,推动了全球化地理知识库的融合与对齐工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务