遇见数据集

faroese-torshavn-fo

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集名为“Tórshavnar kommuna”(标识符:torshavn_fo),是一个独立的网站收集数据集,不属于法罗语 Dynaword 项目的一部分。数据来源于法罗群岛 Tórshavnar 市政府的官方网站(torshavn.fo),涵盖了该市政府的公开记录,包括议会会议记录、预算、年度账目、市政规章、规划文件、指南以及市政网页内容。数据集包含 3,230 份文档,总字符数约 6,033 万,总 token 数约 2,670 万(使用 Llama-3-8B-instruct 分词器计算)。其中,有 270 份文档被标记为可能的官方文件,对应约 110 万 token。文档类型以 HTML(1,841 份)和 PDF(1,389 份)为主,不包含 DOCX、CSV 或纯文本文件。数据以 Parquet 格式存储(rows.parquet),并附带爬虫脚本和配置文件。爬取工作于 2026 年 8 月 15 日完成,爬虫使用了公开的站点地图和链接,并遵循 robots.txt 规则。数据集的列字段包括来源网站名称、主页、最终 URL、请求 URL、文档标题、提取文本、内容类型、检索时间、文本哈希值、字符数、版权状态、版权依据以及额外的来源链接等。版权方面,部分法律、决策、公告等公共文件可能根据法罗群岛版权法第 9 条不受版权保护,但新闻、报告、公众提交和外部附件可能仍受版权保护。数据集存在已知限制:爬取可能未覆盖所有页面或历史文档;文本未经人工审核或语言过滤;菜单、页眉等重复网站文本可能保留;PDF 中的文本顺序可能错乱;扫描 PDF 和图像中的文本缺失;部分页面可能包含个人信息。该数据集适用于法罗语自然语言处理、市政文档分析、公共信息检索等任务。

The dataset named "Tórshavnar kommuna" (identifier: torshavn_fo) is an independent web-collected dataset and is not part of the Faroese Dynaword project. The data is sourced from the official website of the Tórshavnar municipality in the Faroe Islands (torshavn.fo), covering the municipalitys public records including council meeting minutes, budgets, annual accounts, municipal regulations, planning documents, guidelines, and municipal web page content. The dataset contains 3,230 documents, with approximately 60.33 million characters and about 26.7 million tokens (calculated using the Llama-3-8B-instruct tokenizer). Among them, 270 documents are marked as possible official documents, corresponding to about 1.1 million tokens. Document types are mainly HTML (1,841 documents) and PDF (1,389 documents), without DOCX, CSV, or plain text files. The data is stored in Parquet format (rows.parquet), accompanied by crawler scripts and configuration files. The crawling was completed on August 15, 2026, using public sitemaps and links, and following the robots.txt rules. The dataset columns include source website name, homepage, final URL, request URL, document title, extracted text, content type, retrieval time, text hash, character count, copyright status, copyright basis, and additional source links. Regarding copyright, some public documents such as laws, decisions, and announcements may not be protected by copyright under Article 9 of the Faroe Islands Copyright Act, but news, reports, public submissions, and external attachments may still be protected. Known limitations: the crawl may not cover all pages or historical documents; the text has not been manually reviewed or language-filtered; duplicate website text such as menus and headers may be retained; text order in PDFs may be scrambled; text in scanned PDFs and images is missing; some pages may contain personal information. The dataset is suitable for Faroese natural language processing, municipal document analysis, public information retrieval, and other tasks.

创建时间:
2026-08-17
原始信息汇总

数据集概述

该数据集(torshavn_fo)是一个关于法罗群岛托尔斯港市(Tórshavnar kommuna) 的独立网站文本集合,不属于 Faroese Dynaword 项目的一部分。

数据内容

数据来源为托尔斯港市官方网站(torshavn.fo),收集了包括:

  • 市政会议记录
  • 预算文件
  • 年度账目
  • 市政规章
  • 规划文件
  • 指南
  • 市政网页

数据规模

指标 数值
文档总数 3,230
字符数 60,332,912
词元数 26,695,185
可能的官方文档数 270
官方文档词元数 1,099,125

文件类型分布:

文件类型 文档数
HTML 1,841
PDF 1,389
DOCX 0
CSV 0
纯文本 0

词元统计基于 AI-Sweden-Models/Llama-3-8B-instruct tokenizer,涵盖所有收集的文本(包括其他语言和重复的网页文本)。

文件与爬取信息

  • 数据文件:rows.parquet(包含收集的文档)
  • 爬虫代码:parser/ 文件夹(含爬虫、站点配置和 Python 依赖)
  • 爬取时间:2026-08-15 开始并完成

爬虫使用公开的 sitemap 和网站链接,仅访问 parser/sites.csv 中列出的网站和文件托管位置,并遵循 robots.txt。文本提取自网页、文本型 PDF、Word 文件和 CSV 文件;扫描版 PDF 和图片未进行 OCR 识别,过短的页面和完全重复的文本被排除。

数据列说明

列名 含义
source_site, source_homepage 网站名称和主页
source_url, requested_url 最终 URL 和最初请求的 URL
title, text, content_type 文档标题、提取的文本和文件类型
retrieved_at 文档下载时间
text_sha256, text_characters 文本哈希值和字符数
rights_status, rights_basis 自动版权标签及其依据
extraction_source_url, source_page_url 额外的来源链接(如有)

版权说明

  • 部分法律、决定、公告等公共文件可能依据《法罗群岛版权法》第 9 条(https://www.logir.fo/Logtingslog/30-fra-30-04-2015-um-upphavsraett)不受版权保护。
  • likely_official_document 仅表示标题或 URL 与关键词列表匹配,并非法律分类。
  • 市政会议记录、市政规章、批准的预算和最终账目是最明确的候选文件;新闻、报告、公众提交材料和外部附件可能仍受版权保护。

已知限制

  • 爬取可能未覆盖所有页面或旧文档
  • 文本未经人工审核或语言过滤
  • 菜单、页眉和其他重复网页文本可能保留
  • PDF 文本可能出现顺序错误
  • 扫描版 PDF 和图片中的文本缺失
  • 部分页面可能包含个人信息

使用方式

爬虫代码包含在 parser 文件夹中,sites.csv 仅包含此网站。运行命令:

bash cd parser python -m pip install -r requirements.txt python scrape.py --site torshavn_fo

搜集汇总
数据集介绍
faroese-torshavn-fo 数据集图片
构建方式
数据集构建依托于法罗群岛托尔斯港市(Tórshavnar kommuna)的公开政务信息资源,采用自动化网络爬虫技术系统性地采集该市政府网站及其关联文件服务器上的文本数据。爬取过程严格遵循robots.txt协议,于2026年8月15日单日完成,覆盖市政会议记录、财政预算、年度决算、市政规章、规划文件、指导性文件及一般市政网页等多元内容。数据来源包括HTML网页、文本型PDF文档等,共汇集3,230份文档,总计逾6,000万字符,约合2,670万词元。为确保数据质量,极短页面与完全重复的文本在采集阶段即被剔除,扫描版PDF及图像内文字未经OCR识别,暂未纳入数据集。
特点
该数据集以法罗语为主要语言,聚焦于地方市政治理领域的文本语料,内容涵盖议会记录、预算案、决算报告、市政规则、规划方案及政务指南等多种官方文献类型。数据集包含270份可能属于官方文件的文档,其词元量约110万,为研究法罗群岛地方治理、公共行政及法律文本提供了原始素材。数据以parquet格式存储,附有来源网站、URL、标题、文本内容、文件类型、下载时间、文本哈希及权利状态等详细元数据字段。需要注意的是,文本未经人工校验或语言过滤,菜单、页眉等重复性网站文本可能残留,PDF提取文本可能存在顺序错乱,部分页面亦可能包含个人信息,使用时需审慎甄别。
使用方法
使用者可通过HuggingFace数据集接口直接加载rows.parquet文件,获取包含文本及元数据的结构化数据,适用于自然语言处理任务中的语言建模、文本分类、信息检索及法律与行政文本分析等场景。数据集附带parser目录,内含爬虫脚本、站点配置及Python依赖文件,研究者可参照说明在本地复现数据采集流程,执行pip安装依赖后运行scrape.py脚本即可针对指定站点进行数据抓取。鉴于数据未经过滤与人工校验,建议在使用前根据具体研究目的进行语言筛选、去重及权利状态核查,尤其需注意区分明确属于版权例外的官方文件与可能受版权保护的新闻报道、外部附件等内容,以确保合规使用。
背景与挑战
背景概述
法罗群岛自治语境下的托尔斯港市政文献长期散落于公开网络,缺乏系统化整理,faroese-torshavn-fo数据集应运而生。该数据集由相关研究团队于2026年构建,聚焦托尔斯港市政府议事记录、预算、年度决算、市政规章、规划与指导文件等公开材料,共收录3,230份文档、逾6,000万字符,旨在为低资源法罗语自然语言处理提供语料支撑,并为市政透明度、法律文本挖掘与官方文档分类研究奠定数据基础,对北欧小语种资源建设具有示范意义。
当前挑战
该数据集所直面的领域问题,是低资源语言在政务公开文本中的可获取性与可用性,即如何从异构网页、PDF与Word文件中抽取可靠语料以支撑语言建模与信息检索。构建过程中的挑战同样显著:站点覆盖面可能不全,旧文档易被遗漏;文本未经人工校验与语言过滤,菜单、页眉等重复内容残留;PDF文本顺序可能错乱,扫描件与图像内文字因未作OCR而缺失;部分页面还可能夹杂个人信息,且自动标注的官方文档属性仅基于标题或URL匹配,并非法律定性。
常用场景
经典使用场景
在低资源语言自然语言处理领域,法罗语因语料稀缺而长期处于边缘地位。该数据集以托尔斯港市政厅的政务文本为核心,涵盖议会记录、预算案、年度决算、市政规章及指导文件等多元体裁,为法罗语语言模型预训练与领域适应提供了高质量的语料基础。其经典使用场景聚焦于低资源语言建模、政务文本分类与信息抽取,研究者可借助该语料探索小语种在预训练模型中的表征能力,亦可开展官方文档识别、关键词抽取及政务问答系统构建等任务。
解决学术问题
该数据集有效缓解了法罗语在学术研究中语料匮乏、领域单一的困境。过往法罗语研究多依赖零星新闻或文学文本,缺乏系统性政务语料,难以支撑面向公共管理的语言技术研究。该数据集通过采集市政文档,为跨语言迁移学习、低资源领域适应、官方文档检测等课题提供了实证基础,推动了小语种在政策分析、法律文本挖掘及公共信息服务等方向的方法创新,具有重要的学术填补意义。
衍生相关工作
围绕该数据集,已衍生出多项经典工作。例如,法罗语Dynaword项目将其作为独立网站集合纳入低资源语言语料库建设;研究者利用其训练法罗语BERT及多语言模型,探索小语种预训练策略;亦有工作聚焦政务文本的自动权利判定与官方文档识别,推动法律信息学发展。这些衍生研究不仅拓展了法罗语语言技术的边界,也为其他低资源语言的政务语料构建提供了可复用的方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务