fineweb-polygons
收藏资源简介:
FineWeb Polygons 是一个专注于地理空间信息检索的数据集,基于 FineWeb(HuggingFaceFW/fineweb)构建,旨在筛选出与 OpenStreetMap(OSM)多边形名称高度相关的文本片段。数据集通过将 FineWeb 文档中的地名与 OSM 多边形进行匹配,并经过多轮版本迭代,逐步优化匹配质量和精度。数据集包含 9 个版本(V1-V9),每个版本对应不同的匹配规则和过滤策略。V1 采用精确匹配;V2 引入边界内对象和文本过滤;V3 要求多边形名称同时出现在 URL 和文本中;V4 仅依赖文本匹配;V5 增加频率过滤和国名上下文的约束;V6 要求多边形名称与国名在文本中的距离不超过 500 个字符;V7 对 V6 结果进行句子分割;V8 使用 136 个主题词进行文档级过滤;V9 在句子级别进行主题过滤,仅保留与多边形名称相邻的主题句子。数据覆盖摩纳哥(Monaco)和列支敦士登(Liechtenstein)两个地区,每个版本均提供对应的 JSONL 格式数据文件。数据字段因版本而异,如 V1 包含 text_excerpt 和 url_excerpt,而 V2 及以后版本包含完整的 text 字段,以及 url、evidence 等。数据集规模示例:V3 版本在首个分片(1,048,581 个文档)中保留了 77 条证据记录,涉及 7 个多边形名称;V4 保留了 1,282 条记录,涉及 42 个多边形名称。该数据集适用于地理空间信息检索、地名识别、文档相关性评估等任务,并为研究文本-空间关联提供了可控的实验基准。
FineWeb Polygons is a dataset focused on geospatial information retrieval, built upon FineWeb (HuggingFaceFW/fineweb), aiming to filter text fragments that are highly relevant to OpenStreetMap (OSM) polygon names. The dataset matches place names from FineWeb documents with OSM polygons and undergoes multiple iterations of version refinement to gradually optimize matching quality and precision. The dataset contains 9 versions (V1-V9), each corresponding to different matching rules and filtering strategies. V1 uses exact matching; V2 introduces intra-boundary objects and text filtering; V3 requires polygon names to appear in both URL and text; V4 relies solely on text matching; V5 adds frequency filtering and constraints on country name context; V6 requires the distance between polygon names and country names in the text to be no more than 500 characters; V7 performs sentence segmentation on V6 results; V8 uses 136 topic words for document-level filtering; V9 applies topic filtering at the sentence level, retaining only topic sentences adjacent to polygon names. The data covers two regions: Monaco and Liechtenstein, with each version providing corresponding JSONL format data files. Data fields vary by version, e.g., V1 contains text_excerpt and url_excerpt, while V2 and later versions include the full text field, along with url, evidence, etc. Example dataset sizes: V3 retains 77 evidence records involving 7 polygon names in the first shard (1,048,581 documents); V4 retains 1,282 records involving 42 polygon names. The dataset is suitable for tasks such as geospatial information retrieval, place name recognition, document relevance evaluation, and provides a controlled experimental benchmark for studying text-spatial associations.
FineWeb Polygons 数据集概述
基本信息
- 许可证: ODC-BY
- 语言: 英语 (en)
- 任务类别: 文本检索 (text-retrieval)
- 标签: 地理空间、OpenStreetMap、FineWeb、信息检索、可复现性
- GitHub仓库: https://github.com/NoeFlandre/fineweb-polygons
- Hugging Face数据集: https://huggingface.co/datasets/NoeFlandre/fineweb-polygons
数据集描述
FineWeb Polygons 是一个从 FineWeb 数据集中筛选出与 OpenStreetMap 多边形直接相关的高置信度文档的数据集。它通过将 OSM 中的多边形名称与 FineWeb 文档文本和URL进行匹配来实现检索。V1至V4版本使用摩纳哥(Monaco)作为实验区域,V5至V9版本同时覆盖摩纳哥和列支敦士登(Liechtenstein)。
版本说明
V1 — 命名多边形精确匹配
- 保留所有命名的封闭路径和多边形关系
- 要求多边形名称与“Monaco”或“Principality of Monaco”同时出现在文本或URL中
- 输出包含
text_excerpt和url_excerpt字段,不包含完整text
V2 — 边界内有意义的精确匹配
- 保留摩纳哥 admin_level=8 城市边界内的命名区域对象
- 过滤长度小于3、纯数字或无字母的名称
- URL名称匹配即可,文本匹配需同时包含“Monaco”
- 输出包含完整文本、URL和证据字段
V3 — 所有有意义的多边形区域,严格URL和文本匹配
- 保留所有有效区域,使用主名称标签,应用同样的名称清理规则
- 要求多边形名称出现在URL中,且多边形名称加“Monaco”出现在文本中
- 输出包含完整文本、URL和去重后的证据
V4 — 所有有意义的多边形区域,仅文本匹配
- 与V3使用相同的多边形配置文件
- 仅要求多边形名称和“Monaco”出现在文本中,URL不作为选择条件
- 输出包含完整文本,URL保留作为证据
V5 — 特定多边形区域,国家名称出现在文本中
- 名称必须唯一(仅出现在一个OSM区域)
- 名称在FineWeb分片中出现频率不超过0.1%
- 要求所选多边形名称和精确的国家名称出现在文本中
- 输出去重后的完整文本记录
V6 — 本地文本跨度证据
- 保留V5的多边形和频率规则,要求多边形名称和国家名称在文本中相隔不超过500个标准化字符
- 输出包含完整文本、最近距离和原始文本句子
V7 — 从V6获取精确句子列表
- 后处理版本,使用
sat-3l-sm从wtpsplit进行句子分割 - 保留所有V6字段,添加有序的
sentences列表 - 要求
.join(sentences) == text确保不篡改源文档
V8 — 从V7进行主题词汇过滤
- 使用136个批准的主题术语进行过滤
- 要求完整文本包含至少一个主题术语(不区分大小写、全词匹配)
- 保留所有V7字段,包括完整文本和有序句子列表
V9 — 从V8进行句子级主题过滤
- 检查每个原始句子是否包含主题术语,且最多距离包含多边形名称的句子两个位置
- 保留完整文本和原始句子列表,添加
relevant_sentences和元数据 - 过滤掉没有局部主题句子的行
数据文件结构
数据集包含V1至V9共9个配置,每个配置包含对应版本的JSONL文件:
| 版本 | 文件路径 | 分片 |
|---|---|---|
| V1 | data/v1/monaco-v1-10bt-000-v3.jsonl |
train |
| V2 | data/v2/monaco-v2-10bt-000-v2.jsonl |
train |
| V3 | data/v3/monaco-v3-10bt-000-v1.jsonl |
train |
| V4 | data/v4/monaco-v4-10bt-000-v1.jsonl |
train |
| V5 | data/v5/monaco-v5-10bt-000-v3.jsonl |
monaco |
| V5 | data/v5/liechtenstein-v5-10bt-000-v2.jsonl |
liechtenstein |
| V6 | data/v6/monaco-v6-10bt-000-v1.jsonl |
monaco |
| V6 | data/v6/liechtenstein-v6-10bt-000-v1.jsonl |
liechtenstein |
| V7 | data/v7/monaco-v7-10bt-000-v1.jsonl |
monaco |
| V7 | data/v7/liechtenstein-v7-10bt-000-v1.jsonl |
liechtenstein |
| V8 | data/v8/monaco-v8-10bt-000-v1-topic.jsonl |
monaco |
| V8 | data/v8/liechtenstein-v8-10bt-000-v1-topic.jsonl |
liechtenstein |
| V9 | data/v9/monaco-v9-10bt-000-v1-topic-sentences.jsonl |
monaco |
| V9 | data/v9/liechtenstein-v9-10bt-000-v1-topic-sentences.jsonl |
liechtenstein |
首个分片运行结果
输入分片统计
- 文档数量:1,048,581
- 文件大小:2.0 GB Parquet
- 空格分隔词数:539,338,878
- FineWeb token_count 总和:726,306,534
V3结果
- 保留77条最终证据记录,涉及7个多边形名称
V4结果
- 保留1,282条去重证据记录,涉及42个多边形名称
- 其中1,205条仅从文本选择,77条URL也包含名称
- 1,067条使用多边形名称“Monaco”
V5结果
- 摩纳哥: 起始741个规范化名称,保留713个,写入61条去重记录(33个多边形名称);57条仅文本匹配,4条URL也匹配
- 列支敦士登: 起始565个名称,保留524个,写入12条去重记录(11个多边形名称);10条仅文本匹配,2条URL也匹配
V7结果
- 摩纳哥:45行,4,569个句子
- 列支敦士登:6行,328个句子
V8结果
- 摩纳哥:45行中保留39行(过滤6行),覆盖25个多边形名称,4,472个句子
- 列支敦士登:保留全部6行,覆盖5个多边形名称,328个句子
V9结果
- 摩纳哥:39行中保留29行,写入93个相关句子;33个句子的多边形证据在同一句子中
- 列支敦士登:6行中保留4行,写入9个相关句子;3个句子的多边形证据在同一句子中
重要说明
- 数据集是证据记录,不是原始FineWeb分片的副本
- 结果基于词汇匹配而非语义证明,存在误报案例(如 Buckingham、Bel Air、P 1、Maxi)
- 版本ID是公共契约的一部分,不会静默更改,行为变化会分配新版本ID
- V1至V6有意跳过别名、模糊匹配、嵌入和分类器
- V7仅分割V6已选文档,V8使用固定主题词汇过滤V7文档,V9在V8基础上进行句子级过滤,均不添加新多边形名称或运行LLM
- 原始OSM提取文件位于Seagate项目卷中,不上传至公开仓库




