landuse-sentence-relevance-golden-human-set
收藏资源简介:
该数据集是用于土地使用句子相关性的人工黄金标准集,包含100个英文句子,每个句子均经过人工标注,判断其是否描述了该地点可观察或地理特征(如土地利用、土地覆盖、土壤、地表、植被、生态系统、地形、地貌、可见建筑或基础设施,或地方的自然地理环境、形状、位置或范围)。数据集适用于文本分类任务,可用于训练或评估模型对句子与地点地理特征相关性的判断能力。数据来源包括OpenStreetMap(OSM)多边形关联的维基百科和网站文本,句子经过分割和语言过滤。数据集包含丰富的元数据字段,如候选ID、句子、来源、H3地理单元、经纬度、地点名称、区域等,并提供了明确的标签(Yes/No)。许可证兼容多个开源协议,其中原始标注和项目元数据采用Apache-2.0,OSM衍生字段采用ODbL,维基百科文本采用CC BY-SA 4.0。
This dataset is a human-annotated gold standard set for land use sentence relevance, containing 100 English sentences. Each sentence has been manually labeled to determine whether it describes observable or geographic features of a place (e.g., land use, land cover, soil, surface, vegetation, ecosystem, terrain, landform, visible buildings or infrastructure, or the natural geographic environment, shape, location, or extent of the place). The dataset is suitable for text classification tasks, used to train or evaluate models ability to judge the relevance of sentences to geographic features of a location. Data sources include Wikipedia and website texts associated with OpenStreetMap (OSM) polygons, with sentences segmented and language-filtered. It includes rich metadata fields such as candidate ID, sentence, source, H3 geographic unit, latitude/longitude, place name, region, etc., and provides explicit labels (Yes/No). The license is compatible with multiple open-source licenses, where original annotations and project metadata are under Apache-2.0, OSM-derived fields under ODbL, and Wikipedia text under CC BY-SA 4.0.
数据集概述:土地利用句子相关性人工黄金集
基本信息
- 数据集名称:Land-use sentence relevance golden human set
- 任务类型:文本分类
- 语言:英语
- 许可证:Apache-2.0、ODbL、CC BY-SA 4.0
- 数据集规模:少于1,000条样本
数据规模与划分
- 总样本数:100条句子
- 划分方式:仅包含训练集(train),共100个样本
- 数据集大小:38,591字节(下载大小32,062字节)
数据字段
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| candidate_id | string | 候选样本ID |
| sentence | string | 待分类的句子 |
| source | string | 数据来源 |
| source_record_id | string | 来源记录ID |
| source_field | string | 来源字段 |
| h3_cell | string | H3地理编码单元 |
| h3_resolution | int64 | H3分辨率 |
| latitude | float64 | 纬度 |
| longitude | float64 | 经度 |
| place_name | string | 地名 |
| region | string | 区域 |
| source_url | string | 来源URL |
| language | string | 语言 |
| label | string | 标注标签(Yes/No) |
数据集结构设计
该数据集设计遵循严格的合同约束:
- 50条来自维基百科,50条来自网站
- 50条为"Yes"标签,50条为"No"标签
- 分布在25个共享的H3分辨率3级单元中,每个单元包含两个来源各一行
标注任务
标注者需判断句子是否描述了该地点可观察或可地理特征化的内容,具体包括:
- 土地利用或土地覆盖
- 土壤或地表
- 植被、生态系统
- 地形、地貌
- 可见建筑或基础设施
- 地点的物理地理环境、形状、位置或范围
上游数据来源
- OSM多边形Wikidata和Wikipedia数据(修订版
7c2a123b):仅使用英文维基百科数据,排除Wikivoyage - OSM多边形网站标签数据(修订版
2c681544):使用website_text和contact_website_text两个字段
数据处理工具
- 句子分割:使用固定的SaT-12L-sm模型
- 网站英语检测:使用固定的CommonLingua模型
许可说明
- 原始标注和项目自有元数据采用Apache-2.0许可
- OSM衍生字段保留ODbL许可
- 包含的维基百科文本采用CC BY-SA 4.0许可





