遇见数据集

faroese-eysturkommuna-fo

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Eysturkommuna 数据集(eysturkommuna_fo)是一个从法罗群岛 Eysturkommuna 市政网站收集的档案数据集。该数据集包含 HTML 页面、理事会材料、PDF、DOCX 文件、新闻、计划和服务内容,旨在提供法罗语公共文档的语料。数据规模为 6,565 个文档,共计约 22,104,698 个字符和 10,719,723 个 token(使用 Llama-3-8B-instruct 分词器计算)。其中 HTML 文档 5,921 个,PDF 文档 640 个,DOCX 文档 4 个,可能包含 157 个官方文档(486,132 个 token)。数据以 rows.parquet 文件存储,包含以下字段:source_site(来源网站名称)、source_homepage(首页)、source_url(最终 URL)、requested_url(初始请求 URL)、title(文档标题)、text(提取的文本)、content_type(文件类型)、retrieved_at(下载时间)、text_sha256(文本哈希)、text_characters(字符数)、rights_status(自动权利标签)、rights_basis(依据)、extraction_source_url(额外来源链接)、source_page_url(源页面链接)。爬取于 2026-08-15 至 2026-08-16,使用公共 sitemap 和链接,并遵守 robots.txt。文本提取自网页、文本 PDF、Word 文件和 CSV 文件,但未对扫描 PDF 和图像进行 OCR。短页面和重复文本被排除。权利方面,部分法律、决定、通知等公共文档可能不受法罗版权法第 9 条保护,但 'likely_official_document' 标签仅基于标题或 URL 关键词匹配,并非法律分类。已知限制:爬取可能未覆盖所有页面或旧文档;文本未经人工审核或语言过滤;菜单、页眉等重复网站文本可能保留;PDF 文本可能顺序错误;扫描 PDF 和图像文本缺失;可能包含个人信息。该数据集适用于法罗语自然语言处理、文档分类、公共档案研究、多模态文档分析等任务。

The Eysturkommuna dataset (eysturkommuna_fo) is an archival dataset collected from the municipal website of Eysturkommuna in the Faroe Islands. It contains HTML pages, council materials, PDFs, DOCX files, news, plans, and service content, aiming to provide a corpus of Faroese public documents.

创建时间:
2026-08-17
原始信息汇总

数据集概述:Eysturkommuna(eysturkommuna_fo

状态: 独立网站采集数据集,不属于 Faroese Dynaword 项目。

数据内容

该数据集包含一个大型市政档案,涵盖 HTML 页面、议会材料、PDF、DOCX 文件、新闻、规划及服务内容。数据来源为 Eysturkommuna 官方网站

数据规模

指标 数值
文档总数 6,565
字符总数 22,104,698
Token 总数 10,719,723
可能官方文档数 157
可能官方文档 Token 数 486,132
文件类型 文档数
HTML 5,921
PDF 640
DOCX 4
CSV 0
纯文本 0

Token 计数使用 AI-Sweden-Models/Llama-3-8B-instruct 分词器,统计所有采集文本(包含其他语言及重复网站文本)。

文件结构

  • rows.parquet:包含采集到的文档。
  • parser/:包含爬虫、站点设置及 Python 依赖。

爬取详情

  • 爬取开始时间:2026-08-15
  • 爬取完成时间:2026-08-16
  • 爬虫使用公开 sitemap 和网站内链接,严格限制在 parser/sites.csv 中列出的站点及文件主机,并遵守 robots.txt
  • 文本提取自网页、文本型 PDF、Word 文件和 CSV 文件;扫描版 PDF 和图片未进行 OCR 识别。
  • 过短页面及完全重复的文本已被去除。

数据列说明

列名 含义
source_site, source_homepage 网站名称和主页
source_url, requested_url 最终 URL 和最初请求的 URL
title, text, content_type 文档标题、提取文本和文件类型
retrieved_at 文档下载时间
text_sha256, text_characters 文本哈希和字符计数
rights_status, rights_basis 自动版权标签及其分配依据
extraction_source_url, source_page_url 可用的额外来源链接

版权说明

部分法律、决定、通知等公共文档可能依据法罗群岛版权法第 9 条不受版权保护。likely_official_document 标记仅表示标题或 URL 匹配特定词汇列表,并非法律分类。

针对本站的特别说明: 议会记录和市政规章是最明确的候选对象;新闻、报告、公众提交材料及外部附件仍可能受版权保护。文件类型错误的文件已被排除。

已知限制

  • 爬取可能未覆盖所有页面或旧文档。
  • 文本未经人工核查,也未按语言过滤。
  • 菜单、页眉等重复网站文本可能残留。
  • PDF 文本可能出现顺序错乱。
  • 扫描版 PDF 和图片中的文字缺失。
  • 部分页面可能包含个人敏感信息。

使用方式

数据集包含爬虫代码,可通过以下命令运行(需在 parser 目录下):

bash cd parser python -m pip install -r requirements.txt python scrape.py --site eysturkommuna_fo

搜集汇总
数据集介绍
faroese-eysturkommuna-fo 数据集图片
构建方式
该数据集源自对法罗群岛Eysturkommuna市政府官方网站的全面爬取,时间跨越2026年8月15日至16日。爬虫程序依据公共站点地图及网页内链接,严格遵循robots.txt协议,并限定于parser/sites.csv中列出的域名与文件宿主。采集内容涵盖HTML页面、PDF文档、Word文件及CSV,但排除扫描件与图片中的文本,同时滤除高重复或过短的页面。原始数据以parquet格式存储于rows.parquet,每一行对应一个独立文档,并附有来源URL、标题、文本内容、文件类型、抓取时间、文本哈希值及字符数等元数据。自动权利标记基于法罗群岛版权法第9条评估,但明确标注非法律分类。
使用方法
使用者可直接通过HuggingFace数据集加载工具获取rows.parquet文件,适用于语言模型预训练、法罗语文本挖掘或市政文档分析。针对追求官方文件语料的场景,可利用列rights_status和likely_official_document进行初步筛选,但需留意此类标记并非法律定论。若需扩展或定制语料,可进入parser目录安装依赖并运行scrape.py --site eysturkommuna_fo命令,以复现原始采集过程。鉴于数据存在已知限制,建议在重要应用中先执行文本清洗,如移除重复导航信息、按语言过滤,并验证PDF提取的完整性。
背景与挑战
背景概述
法罗语作为北欧地区使用人数极少的语言,其数字资源的稀缺性对自然语言处理研究构成显著制约。Eysturkommuna数据集由瑞典人工智能研究所于2026年8月创建,旨在通过系统化采集法罗群岛Eysturkommuna市政厅网站的公开内容,构建首个面向该语言的市政文档语料库。该数据集涵盖6,565份文档,包括HTML页面、PDF文件及少量Word文档,总计约2,210万字符,分词后约1,072万词元,为法罗语的文本分类、信息检索及低资源语言建模提供了宝贵的基础数据。其建设过程遵循robots.txt并聚焦单一域名,确保了数据来源的合法性与边界性。该数据集的发布填补了法罗语在公共行政领域语料空白,为研究极低资源语言的技术适配与评估提供了基准,对该语言社区的语言技术发展具有深远影响。
当前挑战
构建和利用该数据集面临多重挑战。在领域问题上,法罗语作为极低资源语言,缺乏成熟的标注数据和预训练模型,导致文本清洗、分词及语言识别等基础处理难度大,且数据集中可能混入其他语言或导航栏等重复文本,影响了语料的纯净度。在构建过程中,压缩包内的PDF多为扫描件,无法经OCR提取,致使大量图像化文本缺失;HTML中菜单、页眉等模板内容重复频繁,需设计启发式规则去重;市政文档涉及个人隐私信息,自动爬取可能违反数据保护法规,且版权归属复杂,官方文件与新闻、附件等的授权状态不一,为合法公开数据带来法律风险。此外,爬取过程受限于站点地图与robots.txt,未能覆盖所有历史文档,造成语料不完整,这些挑战共同制约了数据集的全面适用性。
常用场景
经典使用场景
该数据集汇聚了法罗群岛Eysturkommuna市镇政府网站的6,565份公开文档,涵盖HTML页面、PDF、DOCX等多种格式,内容涉及市政新闻、议会材料、服务公告及规划文件等。在语料库构建与低资源语言处理研究中,它可作为法罗语非正式与半正式文本的珍贵语料,用于语言建模、词频统计及拼写校对等任务,填补该语种在真实世界网络文本上的数据空白。
解决学术问题
此数据集旨在缓解法罗语自然语言处理资源匮乏的困境。通过提供大规模、多类型的原始文本,它支持研究者探索低资源语言下的无监督预训练、跨语言迁移及文档分类等课题,助力构建法罗语的语言模型、词性标注器和信息检索系统,推动北欧小语种的数字化保存与计算语言学研究。
实际应用
在公共治理数字化领域,该数据集可用于开发面向法罗群岛居民的信息检索工具,实现市政文件的自动化分类、摘要与搜索。同时,其版权标注字段(如官方文档识别)为法律文本挖掘和透明政府项目提供数据基础,例如构建公民服务问答系统或自动归档平台,从而提升市镇信息管理的效率与可达性。
数据集最近研究
最新研究方向
在当前自然语言处理与低资源语言数字化浪潮中,法罗语作为北欧极小众语言,其数据资源匮乏严重制约了语言模型与信息抽取技术的本地化发展。Eysturkommuna数据集的问世,为法罗语研究提供了前所未有的市政级语料宝库,涵盖逾六千份HTML、PDF及Word文档,包含大量官方决议、公告与规划文本。该数据集不仅支撑了法罗语文档分类、命名实体识别及机器翻译等基础任务,更聚焦于低资源场景下的迁移学习与多语言模型微调,为探索行政文本的语义解析与知识图谱构建提供了试验田。其公开爬虫与权限标注机制亦为数据伦理与版权合规树立新范式,或将推动北欧语言资源共建共享的科研协作网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务