遇见数据集

ua-council-decisions

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

乌克兰市政委员会决策报头身份抽取数据集是一个结构化信息抽取数据集,包含1,075份乌克兰市政委员会决策文件,来自43个地方议会(每个议会精确采样25份决策)。数据来源于乌克兰政府公开记录,所有个人姓名均为以官方身份行事的公职人员(如市长或议会秘书)。该数据集的任务是:给定单份决策文件的完整文本,提取其报头中的五个身份字段:决策编号(decision_no,约19%的合法空值)、决策日期(date,ISO格式)、决策标题/主题行(title)、签署官员姓名(signatory)以及发布议会的规范名称(council_name)。数据以扁平化JSONL格式存储,每条记录对应一份决策,包含唯一标识符(key)、源文档索引(index)、来源议会主机(council)、原始文档页面链接(source_url)、完整决策文本(text,包含OCR和markdown转换输出)以及五个目标字段。数据集采用按议会分组的划分方式:34个训练议会(850条记录)和9个保留评估议会(225条记录),确保评估集测量对未见议会的泛化能力,而非记忆议会内部模式。数据构建流程包括:从rada.info平台获取2025年度的决策文件,通过OCR+文档管道转换为每页markdown;使用蒸馏的DistilBERT边界分割器隔离每个决策片段;通过Claude Haiku生成初始字段抽取结果;最后由Claude Opus对所有片段进行完整审查和校正。数据局限性包括:源扫描件为约120 DPI的图像PDF,文本可能包含OCR错误、同形异义字和间距伪影;部分决策报头无编号,模型需学习输出空值而非虚构编号;领域特定于乌克兰语市政决策;签署官员姓名为公职人员的真实姓名(以官方角色出现)。数据集以CC-BY-4.0许可证发布,基于底层文档为乌克兰政府公开记录的性质。

The Ukrainian Municipal Council Decision Header Identity Extraction Dataset is a structured information extraction dataset containing 1,075 Ukrainian municipal council decision documents from 43 local councils (with exactly 25 decisions sampled per council). The data is sourced from Ukrainian government public records, and all personal names are public officials acting in their official capacity (e.g., mayors or council secretaries). The task of this dataset is: given the full text of a single decision document, extract five identity fields from its header: decision number (decision_no, with approximately 19% legitimate null values), decision date (date, in ISO format), decision title/subject line (title), signatory official name (signatory), and the canonical name of the issuing council (council_name). The data is stored in a flattened JSONL format, with each record corresponding to one decision, containing a unique identifier (key), source document index (index), source council host (council), original document page link (source_url), full decision text (text, including OCR and markdown conversion outputs), and the five target fields. The dataset uses a council-grouped split: 34 training councils (850 records) and 9 held-out evaluation councils (225 records), ensuring that the evaluation set measures generalization to unseen councils rather than memorizing intra-council patterns. The data construction pipeline includes: obtaining decision documents from the rada.info platform for the year 2025, converting them to per-page markdown via an OCR+document pipeline; isolating each decision segment using a distilled DistilBERT boundary segmenter; generating initial field extraction results via Claude Haiku; and finally, conducting a full review and correction of all segments by Claude Opus. Data limitations include: source scans are image PDFs at approximately 120 DPI, and text may contain OCR errors, homoglyphs, and spacing artifacts; some decision headers lack a number, requiring models to learn to output null values rather than fabricating numbers; the domain is specific to Ukrainian-language municipal decisions; and signatory names are real names of public officials (appearing in their official roles). The dataset is released under the CC-BY-4.0 license, based on the nature of the underlying documents as Ukrainian government public records.

创建时间:
2026-07-16
原始信息汇总

数据集概述

数据集名称:Ukrainian Municipal Council Decisions — Masthead Identity Extraction
许可证:CC-BY-4.0
语言:乌克兰语


数据集规模与构成

  • 总记录数:1,075 份乌克兰市政委员会决议(рішення),来自 43 个地方委员会(громади / ради),每个委员会 恰好 25 份 决议(规模较大的委员会被下采样)。
  • 数据集拆分
    • 训练集:34 个委员会,850 行
    • 评估集:9 个委员会,225 行(评估集委员会完全不出现在训练集中,用于衡量跨委员会泛化能力)
  • 拆分方式:基于委员会的分组拆分(GroupShuffleSplit),种子 13。

任务定义

给定一份决议的完整文本,从文档报头(masthead) 中提取以下五个字段:

字段 说明
decision_no 决议编号(如 4169VIII-12)。约 19% 的记录为 null——这是正确的标签(许多委员会报头没有编号),并非遗漏。
date 决议日期,ISO 格式 yyyy-mm-dd
title 决议标题/主题行(通常为“Про ...”开头)。
signatory 签署官员姓名(公职人员,官方身份)。
council_name 发布委员会的规范名称。

数据列说明

每条记录(JSONL 格式)包含:

  • key:源决议内容的 SHA256 哈希(稳定 ID)
  • index:源文档中的索引
  • council:源委员会主机名(如 agronomichna-gromada.gov.ua
  • source_url:原始文档页面的链接(100% 记录均有)
  • text:决议全文(Markdown 格式,包含 OCR 标记 [pN]
  • decision_nodatetitlesignatorycouncil_name:五个金标准字段

数据构建流程

  1. 数据来源:来自 rada.info 平台的 51 个委员会 2025 年普通决议(OCR 转录 + 原生 .doc/.docx 转换),筛选为单决议 ≤10 页的文档,排除重命名/修正类决议。
  2. 分割:使用蒸馏版 DistilBERT 边界分割器(边界 F1 0.957,类型准确率 0.932)分离每个决议片段,仅保留非全空的 decision 类型。
  3. 银标准标签:由 claude-haiku-4-5 初步提取字段。
  4. Opus 审查(全量):所有训练集和评估集均由 Claude Opus 子代理审查并修正。
  5. 权威 decision_no:由 Opus 对所有真实决议报头独立重新提取并标准化(ASCII 连字符、拉丁罗马数字);空白报头设为 null
  6. council_name:每个委员会归一化为一个 Opus 选择的规范形式。

局限性

  • OCR 噪声:源扫描件为约 120 DPI 图像型 PDF,text 可能包含 OCR 错误、同形字和排版伪影。
  • 空白报头:约 19% 的 decision_no 合法为 null,模型应学会输出 null,而非虚构编号。
  • 领域特定:仅限乌克兰语市政决议,非通用抽取数据集。
  • 公职人员姓名signatory 包含真实公职人员的官方身份姓名,不包含任何私人个人 PII。

数据来源与版本

  • 数据集内容 SHA256:cb703652815d…(v1.1 版本,新增 source_url
  • 内部数据集 ID:19,修订版 2

许可证说明

采用 CC-BY-4.0 许可证发布,基础文档为乌克兰政府公共记录。使用者应自行确认该许可证在其司法管辖区和用途下的适用性。

搜集汇总
数据集介绍
ua-council-decisions 数据集图片
构建方式
该数据集源自乌克兰地方议会于rada.info平台发布的2025年度一般决策文件,涵盖51个地方议会。构建流程始于对单页≤10页的单决策文件进行OCR及Markdown格式转换,随后利用蒸馏DistilBERT边界分割模型(边界F1达0.957)精准提取决策文本片段。初步字段抽取由Claude Haiku 4.5模型生成银标签,再经Claude Opus子代智能体对全部1,347条训练样本与324条评估样本进行逐项审核与修正。为确保权威性,决策编号由Opus针对每个报头独立重提取并标准化,空白报头统一标记为null;议会名称则规范为每个议会唯一的规范表述。最终形成按议会分组、每议会恰好25条决策的平衡数据集。
特点
该数据集的核心特色在于其跨议会泛化评估设计:训练集与评估集依据议会进行分组划分(基于GroupShuffleSplit算法),9个评估议会完全不出现在训练集中,强制模型学习可迁移的模式而非记忆特定议会的模板。任务聚焦于从决策全文报头中提取五个身份字段——决策编号、日期、标题、签署人及议会名称,其中约19%的决策编号因原始报头空白而天然为null,考验模型输出空值而非虚构能力。数据集还提供了完整的来源链接(source_url)用于溯源,并附有PDF去噪工具链(image-only约120 DPI扫描件及原生文档),体现了对真实政务OCR噪声场景的适配。
使用方法
该数据集支持文本生成与词元分类两大任务。使用时应加载JSONL格式文件,每条记录包含sha256稳定标识符(key)、决策全文(text)及五个目标字段列。推荐按议会分组的训练/评估划分(train: 1,347条/51议会,eval: 324条/49议会)进行模型训练与跨议会泛化评估,注意评估集中出现的议会均未在训练集中出现。对于决策编号字段,需引导模型正确输出null值而非虚构数字。由于文本中包含OCR噪声及标记[pN]的页码标识,建议在预处理时加以处理或保留作为噪声增强。所有数据均以CC-BY-4.0许可发布,确认符合所在司法管辖区规定后即可使用。
背景与挑战
背景概述
乌克兰市政决策数据集(ua-council-decisions)由研究团队于2025年构建,聚焦于从乌克兰地方议会发布的官方决策文件中提取报头身份信息。该数据集收录了来自43个地方议会的1075份决策文本,每份决策均标注了决策编号、日期、标题、签署官员及发布议会名称五个字段。作为公共政府记录的结构化提取数据集,它填补了东欧语言在政务信息抽取领域的资源空白,为跨议会泛化能力评估提供了基准。数据集采用逐议会分组划分训练与评估集,确保评估议会完全未见于训练数据,从而严格衡量模型在新兴议会上的迁移表现。其发布在HuggingFace平台,采用CC-BY-4.0许可,对乌克兰政务公开与自然语言处理交叉研究具有重要推动作用。
当前挑战
该数据集面临多重挑战。领域层面上,乌克兰地方议会决策文档多为120 DPI的低分辨率扫描件,OCR错误、同形字符混淆及间距异常普遍存在,严重干扰信息抽取的准确性。约19%的决策报头缺失编号,模型需学会输出空值而非臆造数字,这对序列标注模型提出了鲁棒性要求。构建过程中,研究团队需从原始PDF或DOCX中分割单篇决策,虽采用DistilBERT边界分割器达到0.957的F1值,但分割误差仍可能引入噪声。关键字段的标注依赖Claude Opus子代理进行逐条审核修正,尽管保证了质量,却耗费了大量人工与算力资源。此外,字段规范化(如议会名称的统一)和跨议会泛化评估的设计也增加了数据构建的复杂性。
常用场景
经典使用场景
乌克兰市政决议数据集(ua-council-decisions)专为结构化信息抽取任务而设计,其经典使用场景是从乌克兰地方议会的官方决议文档中精准提取报头身份标识。具体而言,模型需基于给定决议的完整文本,抽取出决议编号、通过日期、标题、签署官员姓名以及发布议会的规范名称等五项核心字段。该数据集覆盖43个地方议会、每议会恰好25份决议的均衡样本,并采用按议会分组的留出法划分训练集与评估集,确保评估难度聚焦于跨议会泛化能力,而非简单的模式记忆。
衍生相关工作
围绕该数据集可衍生出一系列经典研究方向:基于预训练语言模型的跨领域文档结构化抽取方法,尤其是针对OCR噪声的鲁棒性增强技术;少样本与零样本场景下报头身份抽取的迁移学习框架;以及面向乌克兰语政务文本的多任务学习模型,同时处理文本分类、序列标注与信息抽取。此外,该数据集为评估大语言模型在低资源、高结构化需求政务场景中的真实能力提供了稀缺的基准,有望催生一批聚焦于政务文档自动解析与知识图谱构建的创新工作。
数据集最近研究
最新研究方向
在乌克兰政务公开与数字治理的前沿领域,该数据集聚焦于市政委员会决策文件的报头身份信息结构化抽取任务,填补了低资源语言政务OCR后处理与跨机构泛化研究的空白。其精心设计的平衡抽样与按委员会分组的评估策略,使得模型必须在未见过的市政机构上验证抽取能力,推动了信息抽取从单源记忆向跨域迁移的范式转变。结合2025年乌克兰持续推动的政务数据标准化与透明度倡议,该数据集为自动化档案索引、公共记录审计以及多模态文档理解提供了高价值的基准,同时也揭示了面向斯拉夫语族小样本OCR清洗与空字段处理的关键挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务