遇见数据集

faroese-vestmanna-fo

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是“Vestmanna kommuna”(法罗语)网站内容的归档,收集了法罗群岛Vestmanna市镇的公开信息,包括历史会议记录、预算、账目、治理规则、WordPress页面和可下载文档。数据通过爬虫于2026年8月15日从官方网站(https://www.vestmanna.fo)获取,使用公共站点地图和网站链接,并遵守robots.txt规则。数据集包含3,291个文档,总字符数5,365,592,token数2,535,945(基于AI-Sweden-Models/Llama-3-8B-instruct分词器计算)。文件类型以HTML为主(2,979个),其次为PDF(312个),不含DOCX、CSV或纯文本文件。字段说明包括网站名称、主页、最终URL、请求URL、文档标题、提取文本、文件类型、下载时间、文本哈希与字符数、权利状态与依据,以及额外的来源链接。部分文档(如议会记录)可能依据法罗群岛版权法第9节不受版权保护,但标注为“可能的官方文档”仅基于标题或URL匹配,并非法律分类。已知局限性包括:爬取可能未覆盖所有页面或旧文档;文本未经人工核对或语言过滤;菜单、页眉等重复网站文本可能残留;PDF文本可能顺序错误;扫描PDF和图像内文本缺失;部分页面可能包含个人信息。爬虫代码和配置位于parser文件夹中,可复现爬取过程。

This dataset is an archive of content from the Vestmanna kommuna (Faroese) website, collecting public information from the municipality of Vestmanna in the Faroe Islands, including historical meeting minutes, budgets, accounts, governance rules, WordPress pages, and downloadable documents. The data was crawled on August 15, 2026 from the official website (https://www.vestmanna.fo) using public sitemaps and website links, and complying with robots.txt rules. The dataset contains 3,291 documents, with a total of 5,365,592 characters and 2,535,945 tokens (calculated based on the AI-Sweden-Models/Llama-3-8B-instruct tokenizer). File types are predominantly HTML (2,979), followed by PDF (312), with no DOCX, CSV, or plain text files. Fields include website name, homepage, final URL, request URL, document title, extracted text, file type, download time, text hash and character count, rights status and basis, and additional source links. Some documents (e.g., parliamentary records) may be exempt from copyright under Section 9 of the Faroe Islands Copyright Act, but the designation possible official document is based solely on title or URL matching and is not a legal classification. Known limitations include: the crawl may not have covered all pages or older documents; text has not been manually verified or language-filtered; repetitive website text such as menus and headers may remain; PDF text may have incorrect ordering; text in scanned PDFs and images is missing; some pages may contain personal information. Crawler code and configuration are located in the parser folder and can reproduce the crawling process.

创建时间:
2026-08-17
原始信息汇总

Vestmanna kommuna 数据集 (vestmanna_fo)

数据集概述

该数据集收录了法罗群岛Vestmanna市政府的历史会议记录、预算、账目、治理规则、WordPress页面及可下载文档,来源为Vestmanna kommuna官网

该数据集为独立网站采集,不属于Faroese Dynaword项目的一部分。

数据规模

指标 数值
文档总数 3,291
字符数 5,365,592
Token数 2,535,945
可能官方文档数 45
可能官方文档Token数 51,076

Token计数使用AI-Sweden-Models/Llama-3-8B-instruct分词器,涵盖所有采集文本(含其他语言和重复网站文本)。

文件类型分布

文件类型 文档数
HTML 2,979
PDF 312
DOCX 0
CSV 0
纯文本 0

文件内容

  • rows.parquet:包含采集的文档数据
  • parser/:包含爬虫程序、站点配置和Python依赖

爬取详情

  • 爬取开始时间:2026-08-15
  • 爬取完成时间:2026-08-15
  • 使用公共站点地图和网站链接,遵循parser/sites.csv中列出的网站和文件主机范围,并遵守robots.txt
  • 文本来源包括网页、文本型PDF、Word文件和CSV文件
  • 扫描型PDF和图片未进行OCR识别
  • 过短页面和完全重复文本已被排除

数据列说明

列名 含义
source_site, source_homepage 网站名称和主页
source_url, requested_url 最终URL和首次请求的URL
title, text, content_type 文档标题、提取文本和文件类型
retrieved_at 文档下载时间
text_sha256, text_characters 文本哈希和字符数
rights_status, rights_basis 自动版权标签及其分配依据
extraction_source_url, source_page_url 可用的额外来源链接

版权说明

部分法律、决定、公告等公共文件可能根据法罗群岛版权法第9条不受版权保护。

likely_official_document仅表示标题或URL匹配特定关键词列表,并非法律分类

市政会议记录是最明确的官方文档候选;网站重组期间被屏蔽的页面未被采集。

已知局限

  • 可能未覆盖所有页面或旧文档
  • 文本未经人工核查或语言过滤
  • 可能残留菜单、页眉等重复网站文本
  • PDF中的文本可能出现顺序错乱
  • 扫描型PDF和图片内文字缺失
  • 部分页面可能包含个人信息

使用方式

爬虫程序位于parser文件夹中,复制版sites.csv仅包含该网站。可通过以下命令运行: bash cd parser python -m pip install -r requirements.txt python scrape.py --site vestmanna_fo

搜集汇总
数据集介绍
faroese-vestmanna-fo 数据集图片
构建方式
法罗群岛自治市镇的历史治理文献长期散落于各地方政府网站,缺乏系统性的语料汇编。Vestmanna kommuna数据集的构建即针对这一空白,通过自动化网络爬虫对韦斯特曼纳自治市镇官方网站进行定向采集。爬虫遵循robots.txt协议,以公开站点地图与站内链接为导航路径,限定在备案的站点与文件托管域内运行,最终获取会议记录、预算文件、账目报表、治理规章、WordPress页面及可下载文档等多元材料,并排除极短页面与完全重复文本。采集文本以Parquet格式存储,同时保留原始解析器代码以实现流程复现。
特点
该数据集作为独立网站汇编,不隶属法罗群岛通用语料库Dynaword,具有清晰的来源边界与领域聚焦。其体量涵盖3,291份文档、约536万字符及253万词元,文件类型以HTML为主体,兼有PDF文档。数据集设计兼顾文本内容与元数据完整性,每条记录包含来源站点、最终与请求URL、文档标题、提取文本、内容类型、下载时间、文本哈希、字符计数及自动权利标签等字段。其中官方文档候选识别基于标题与URL的关键词匹配,并非法律定性;权利状态则参照法罗群岛版权法第9条进行自动标注,并对市镇委员会记录予以特别提示。
使用方法
该数据集以rows.parquet文件承载全部文档,并附带parser目录以收录爬虫脚本、站点配置及Python依赖清单,便于用户复核或重跑采集流程。研究者可通过HuggingFace数据集接口直接加载Parquet文件,按列选取所需字段进行文本分析、语言建模或治理文献挖掘。若需复现原始爬取,可进入parser目录安装依赖后执行指定命令。使用中需注意数据未经人工校对与语言过滤,菜单、页眉等重复文本可能残留,PDF文本顺序可能错乱,扫描件与图像内文字未被OCR提取,且部分页面或含个人信息。
背景与挑战
背景概述
法罗群岛自治治理的历史文献长期散落于各市镇的网页与档案系统之中,Vestmanna kommuna数据集正是为回应这一语料匮乏而构建。该数据集由相关研究团队于2026年8月15日完成采集,收录了韦斯特曼纳市镇的历史会议记录、预算、账目、治理规则、WordPress页面及可下载文档,共计3291份文件、逾536万字符。其核心研究问题在于为法罗语低资源语言处理提供真实行政文本语料,并支持地方治理透明度与档案数字化研究。作为独立网站采集项目,该数据集虽未纳入法罗语Dynaword体系,却为法罗语自然语言处理提供了具有地方治理特色的原始素材,对低资源语言资源建设具有补充意义。
当前挑战
从领域问题看,法罗语作为低资源语言长期缺乏大规模、多类型的行政文本语料,Vestmanna kommuna数据集需解决法罗语地方治理文本的采集、组织与可用性问题,为语言模型训练和档案检索提供基础资源。构建过程中,所遇挑战尤为具体:爬虫仅能依据站点地图与公开链接抓取,难以穷尽全部页面与历史文档;文本未经人工校验与语言过滤,菜单、页眉等重复网站文本可能残留;PDF提取文本顺序可能错乱,扫描件与图像内文字因未采用OCR而缺失;部分页面可能含个人隐私信息,权利标注仅依据标题或URL匹配自动生成,并非法律定性。这些局限共同制约了数据集的完整性与纯净度。
常用场景
经典使用场景
在低资源语言自然语言处理领域,法罗语因语料稀缺而长期处于研究边缘,Vestmanna kommuna数据集作为一座地方治理文献的独立语料库,其最经典的使用场景在于为法罗语语言模型提供预训练与微调文本。该数据集汇集了历史会议记录、预算决算、治理规章、WordPress页面及可下载文档,总计3,291份文件、逾二百五十万词元,构成了一个具有鲜明行政文体特征的语料集合,研究者可借此开展掩码语言建模、因果语言建模及领域适应训练,从而增强模型对法罗语官方书面语的理解与生成能力。
解决学术问题
该数据集直面法罗语数字资源匮乏、行政文本难以规模化获取的学术困境,为语言资源建设与低资源语言技术研究提供了可复用的真实语料。其收录的议会记录与公共文件,使研究者得以探究濒危语言在正式治理语境中的词汇分布、句法结构与语篇规律,并为机器翻译、文本分类及信息抽取等任务的低资源迁移学习提供基准。数据集的公开亦推动了法罗语在版权豁免框架下的语料伦理讨论,对少数语言数字化保护具有示范意义。
衍生相关工作
作为法罗语Dynaword之外的独立网站采集项目,该数据集衍生了围绕地方治理语料库构建方法的研究,包括基于sitemap与robots.txt的定向爬取策略、PDF文本顺序还原及重复页面过滤技术。其parser目录所包含的爬虫与站点配置,为其他市镇或机构开展类似采集提供了可复现模板。在应用层面,该数据集催生了法罗语行政文本的语言模型适配实验、低资源词性标注与命名实体识别探索,并为法罗语版权状态自动判定与官方文档识别研究提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务