遇见数据集

fineweb-polygons

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

FineWeb Polygons 是一个专注于地理空间信息检索的数据集,基于 FineWeb(HuggingFaceFW/fineweb)构建,旨在筛选出与 OpenStreetMap(OSM)多边形名称高度相关的文本片段。数据集通过将 FineWeb 文档中的地名与 OSM 多边形进行匹配,并经过多轮版本迭代,逐步优化匹配质量和精度。数据集包含 9 个版本(V1-V9),每个版本对应不同的匹配规则和过滤策略。V1 采用精确匹配;V2 引入边界内对象和文本过滤;V3 要求多边形名称同时出现在 URL 和文本中;V4 仅依赖文本匹配;V5 增加频率过滤和国名上下文的约束;V6 要求多边形名称与国名在文本中的距离不超过 500 个字符;V7 对 V6 结果进行句子分割;V8 使用 136 个主题词进行文档级过滤;V9 在句子级别进行主题过滤,仅保留与多边形名称相邻的主题句子。数据覆盖摩纳哥(Monaco)和列支敦士登(Liechtenstein)两个地区,每个版本均提供对应的 JSONL 格式数据文件。数据字段因版本而异,如 V1 包含 text_excerpt 和 url_excerpt,而 V2 及以后版本包含完整的 text 字段,以及 url、evidence 等。数据集规模示例:V3 版本在首个分片(1,048,581 个文档)中保留了 77 条证据记录,涉及 7 个多边形名称;V4 保留了 1,282 条记录,涉及 42 个多边形名称。该数据集适用于地理空间信息检索、地名识别、文档相关性评估等任务,并为研究文本-空间关联提供了可控的实验基准。

FineWeb Polygons is a dataset focused on geospatial information retrieval, built upon FineWeb (HuggingFaceFW/fineweb), aiming to filter text fragments that are highly relevant to OpenStreetMap (OSM) polygon names. The dataset matches place names from FineWeb documents with OSM polygons and undergoes multiple iterations of version refinement to gradually optimize matching quality and precision. The dataset contains 9 versions (V1-V9), each corresponding to different matching rules and filtering strategies. V1 uses exact matching; V2 introduces intra-boundary objects and text filtering; V3 requires polygon names to appear in both URL and text; V4 relies solely on text matching; V5 adds frequency filtering and constraints on country name context; V6 requires the distance between polygon names and country names in the text to be no more than 500 characters; V7 performs sentence segmentation on V6 results; V8 uses 136 topic words for document-level filtering; V9 applies topic filtering at the sentence level, retaining only topic sentences adjacent to polygon names. The data covers two regions: Monaco and Liechtenstein, with each version providing corresponding JSONL format data files. Data fields vary by version, e.g., V1 contains text_excerpt and url_excerpt, while V2 and later versions include the full text field, along with url, evidence, etc. Example dataset sizes: V3 retains 77 evidence records involving 7 polygon names in the first shard (1,048,581 documents); V4 retains 1,282 records involving 42 polygon names. The dataset is suitable for tasks such as geospatial information retrieval, place name recognition, document relevance evaluation, and provides a controlled experimental benchmark for studying text-spatial associations.

创建时间:
2026-08-24
原始信息汇总

FineWeb Polygons 数据集概述

基本信息

  • 许可证: ODC-BY
  • 语言: 英语 (en)
  • 任务类别: 文本检索 (text-retrieval)
  • 标签: 地理空间、OpenStreetMap、FineWeb、信息检索、可复现性
  • GitHub仓库: https://github.com/NoeFlandre/fineweb-polygons
  • Hugging Face数据集: https://huggingface.co/datasets/NoeFlandre/fineweb-polygons

数据集描述

FineWeb Polygons 是一个从 FineWeb 数据集中筛选出与 OpenStreetMap 多边形直接相关的高置信度文档的数据集。它通过将 OSM 中的多边形名称与 FineWeb 文档文本和URL进行匹配来实现检索。V1至V4版本使用摩纳哥(Monaco)作为实验区域,V5至V9版本同时覆盖摩纳哥和列支敦士登(Liechtenstein)。

版本说明

V1 — 命名多边形精确匹配

  • 保留所有命名的封闭路径和多边形关系
  • 要求多边形名称与“Monaco”或“Principality of Monaco”同时出现在文本或URL中
  • 输出包含 text_excerpturl_excerpt 字段,不包含完整 text

V2 — 边界内有意义的精确匹配

  • 保留摩纳哥 admin_level=8 城市边界内的命名区域对象
  • 过滤长度小于3、纯数字或无字母的名称
  • URL名称匹配即可,文本匹配需同时包含“Monaco”
  • 输出包含完整文本、URL和证据字段

V3 — 所有有意义的多边形区域,严格URL和文本匹配

  • 保留所有有效区域,使用主名称标签,应用同样的名称清理规则
  • 要求多边形名称出现在URL中,且多边形名称加“Monaco”出现在文本中
  • 输出包含完整文本、URL和去重后的证据

V4 — 所有有意义的多边形区域,仅文本匹配

  • 与V3使用相同的多边形配置文件
  • 仅要求多边形名称和“Monaco”出现在文本中,URL不作为选择条件
  • 输出包含完整文本,URL保留作为证据

V5 — 特定多边形区域,国家名称出现在文本中

  • 名称必须唯一(仅出现在一个OSM区域)
  • 名称在FineWeb分片中出现频率不超过0.1%
  • 要求所选多边形名称和精确的国家名称出现在文本中
  • 输出去重后的完整文本记录

V6 — 本地文本跨度证据

  • 保留V5的多边形和频率规则,要求多边形名称和国家名称在文本中相隔不超过500个标准化字符
  • 输出包含完整文本、最近距离和原始文本句子

V7 — 从V6获取精确句子列表

  • 后处理版本,使用 sat-3l-smwtpsplit 进行句子分割
  • 保留所有V6字段,添加有序的 sentences 列表
  • 要求 .join(sentences) == text 确保不篡改源文档

V8 — 从V7进行主题词汇过滤

  • 使用136个批准的主题术语进行过滤
  • 要求完整文本包含至少一个主题术语(不区分大小写、全词匹配)
  • 保留所有V7字段,包括完整文本和有序句子列表

V9 — 从V8进行句子级主题过滤

  • 检查每个原始句子是否包含主题术语,且最多距离包含多边形名称的句子两个位置
  • 保留完整文本和原始句子列表,添加 relevant_sentences 和元数据
  • 过滤掉没有局部主题句子的行

数据文件结构

数据集包含V1至V9共9个配置,每个配置包含对应版本的JSONL文件:

版本 文件路径 分片
V1 data/v1/monaco-v1-10bt-000-v3.jsonl train
V2 data/v2/monaco-v2-10bt-000-v2.jsonl train
V3 data/v3/monaco-v3-10bt-000-v1.jsonl train
V4 data/v4/monaco-v4-10bt-000-v1.jsonl train
V5 data/v5/monaco-v5-10bt-000-v3.jsonl monaco
V5 data/v5/liechtenstein-v5-10bt-000-v2.jsonl liechtenstein
V6 data/v6/monaco-v6-10bt-000-v1.jsonl monaco
V6 data/v6/liechtenstein-v6-10bt-000-v1.jsonl liechtenstein
V7 data/v7/monaco-v7-10bt-000-v1.jsonl monaco
V7 data/v7/liechtenstein-v7-10bt-000-v1.jsonl liechtenstein
V8 data/v8/monaco-v8-10bt-000-v1-topic.jsonl monaco
V8 data/v8/liechtenstein-v8-10bt-000-v1-topic.jsonl liechtenstein
V9 data/v9/monaco-v9-10bt-000-v1-topic-sentences.jsonl monaco
V9 data/v9/liechtenstein-v9-10bt-000-v1-topic-sentences.jsonl liechtenstein

首个分片运行结果

输入分片统计

  • 文档数量:1,048,581
  • 文件大小:2.0 GB Parquet
  • 空格分隔词数:539,338,878
  • FineWeb token_count 总和:726,306,534

V3结果

  • 保留77条最终证据记录,涉及7个多边形名称

V4结果

  • 保留1,282条去重证据记录,涉及42个多边形名称
  • 其中1,205条仅从文本选择,77条URL也包含名称
  • 1,067条使用多边形名称“Monaco”

V5结果

  • 摩纳哥: 起始741个规范化名称,保留713个,写入61条去重记录(33个多边形名称);57条仅文本匹配,4条URL也匹配
  • 列支敦士登: 起始565个名称,保留524个,写入12条去重记录(11个多边形名称);10条仅文本匹配,2条URL也匹配

V7结果

  • 摩纳哥:45行,4,569个句子
  • 列支敦士登:6行,328个句子

V8结果

  • 摩纳哥:45行中保留39行(过滤6行),覆盖25个多边形名称,4,472个句子
  • 列支敦士登:保留全部6行,覆盖5个多边形名称,328个句子

V9结果

  • 摩纳哥:39行中保留29行,写入93个相关句子;33个句子的多边形证据在同一句子中
  • 列支敦士登:6行中保留4行,写入9个相关句子;3个句子的多边形证据在同一句子中

重要说明

  • 数据集是证据记录,不是原始FineWeb分片的副本
  • 结果基于词汇匹配而非语义证明,存在误报案例(如 Buckingham、Bel Air、P 1、Maxi)
  • 版本ID是公共契约的一部分,不会静默更改,行为变化会分配新版本ID
  • V1至V6有意跳过别名、模糊匹配、嵌入和分类器
  • V7仅分割V6已选文档,V8使用固定主题词汇过滤V7文档,V9在V8基础上进行句子级过滤,均不添加新多边形名称或运行LLM
  • 原始OSM提取文件位于Seagate项目卷中,不上传至公开仓库
搜集汇总
数据集介绍
fineweb-polygons 数据集图片
构建方式
FineWeb Polygons数据集以OpenStreetMap(OSM)多边形为地理锚点,从FineWeb大规模语料库中精准筛选与特定地点高度相关的文档。构建过程历经多个版本迭代:V1至V4聚焦摩纳哥,从原始OSM PBF文件中提取命名闭合路径及多边形关系,并通过规范化名称匹配、国家名上下文限定等策略逐步收紧检索条件;V5起扩展至列支敦士登,引入名称频率过滤,确保候选多边形名称在文档中具有区分度。V6进一步要求多边形名称与国家名在文本中的距离不超过500个规范化字符,以增强空间语义关联。V7至V9为后处理阶段,依次进行句子分割、主题词汇过滤及句子级相关性筛选,每一步均保留完整文本与证据链,确保可复现性与审计追溯。
特点
该数据集的核心特色在于其严格的多版本合同机制与透明性。每个版本均对应明确的检索规则和输出模式,版本ID不可变更,确保结果的可复现性。数据记录包含完整的FineWeb文本、URL及证据字段,支持细粒度的地理-文本关联分析。V9输出额外提供相关句子及其元数据,便于快速审查。此外,数据集公开了详细的运行清单和指纹信息,涵盖输入数据、配置参数及处理步骤的哈希值,最大化科学严谨性。同时,构建过程刻意避免模糊匹配、嵌入向量等复杂技术,以词汇精确匹配为基础,为后续语义增强留有拓展空间。
使用方法
用户可通过Hugging Face平台直接访问V1至V9的多个配置版本,每个版本对应特定的数据文件,支持按国家(摩纳哥、列支敦士登)或处理阶段选取。数据集以JSONL格式存储,兼容常见数据处理工具链。对于研究应用,可加载特定版本进行地理信息检索、地方实体链接或语料库质量评估;V8和V9的过滤后数据适合构建精准的地理相关文本分类或摘要任务。同时,GitHub仓库提供了完整的代码复现流程,用户可依据文档配置环境、运行扫描及后处理命令,在自有数据上复现或扩展实验。
背景与挑战
背景概述
FineWeb Polygons数据集由NoeFlandre等人于2024年创建,旨在从大规模网络文本语料库FineWeb中,通过OpenStreetMap(OSM)多边形地名进行地理空间信息检索,以解决Web文本中地理实体识别与关联的难题。该数据集通过版本化实验(V1至V9)系统性地探索了从精确匹配到局部文本跨度证据的检索策略,其核心研究问题是如何在保持高精度的同时,提升地理相关文档的召回率。该工作为地理信息检索领域提供了可复现的基线,并推动了基于地名和空间关系的文本挖掘研究,对自然语言处理与地理信息科学的交叉领域具有重要影响力。
当前挑战
该数据集面临的挑战包括:首先,在领域问题层面,地理文本检索需应对地名歧义(如通用名称、多义地名)和长文档中相关证据的稀疏性,实现在大规模语料中准确筛选与地理实体强相关的文档,同时避免语义无关的噪声匹配。其次,在构建过程中,V1至V4阶段需处理OSM多边形数据预处理(如名称清洗、去重)、FineWeb分片的高吞吐量扫描与结果校验,而V5起引入的频率阈值和文本距离限制,虽提升了精度却增加了计算复杂性,并需在可重复性(严格版本合同)与实验灵活性间寻求平衡,确保数据版本的可追溯性及结果的科学稳健性。
常用场景
经典使用场景
FineWeb Polygons数据集精心构建了文本与地理空间实体之间的关联,其核心应用在于信息检索领域,尤其是地理空间信息检索。研究者可利用该数据集探索如何从海量非结构化文本中,基于OpenStreetMap多边形名称进行精确或模糊匹配,从而定位与特定地理区域相关的文档。这一过程涉及命名实体的识别与消歧,以及文本-地理映射的构建,为地理知识图谱的填充和地理信息抽取提供了宝贵的实验基准。数据集的多版本设计(V1-V9)逐步引入不同的匹配策略,从简单的名称匹配到结合文本跨度约束和主题过滤,为研究检索算法的演进提供了阶梯式的测试平台。
实际应用
在实际应用中,FineWeb Polygons的成果可直接服务于地理感知的搜索引擎、区域新闻聚合系统以及智慧城市的信息整合平台。例如,通过识别提及特定城市内地点(如摩纳哥的景点或列支敦士登的地标)的网页,可以增强本地化搜索的精确度,提升用户获取区域相关信息的效率。此外,该数据集还可用于自动构建地理区域的内容档案,辅助城市规划者对公众讨论的监测,或为旅游推荐系统提供地理维度的内容筛选。其索引和过滤机制为处理流式地理社交媒体数据提供了方法论借鉴,展示了从大语言模型训练语料中提炼结构化地理知识的实用路径。
衍生相关工作
该数据集的设计哲学和版本演进催生了多项衍生研究工作。其严格的可复现性契约和版本化匹配规则,为信息检索社区树立了新的实验标准,后续研究可能借鉴其方法论,构建类似的地理-文本对齐数据集(如其他国家的变体)。V7-V9中引入的句子分割和主题词汇过滤策略,有望启发细粒度地理证据抽取的研究,即在句子级别定位地理提及和上下文证据。此外,其基于多阶段后处理(从文档到句子再到主题过滤)的流水线思想,可被推广至其他垂直领域的上下文增强任务,如生物医学文本的地理标注或历史文献的空间信息挖掘。这些衍生工作共同丰富了文本地理信息提取的技术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务