遇见数据集

parliamentrag-camera-leg19

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

ParliamentRAG 数据集收录了意大利众议院(Camera dei deputati)第19届立法机构(2022年10月13日至2026年8月6日)的完整会议记录。该数据集是 ParliamentRAG 知识图谱的扁平化形式,由众议院官方开放数据(dati.camera.it)和每次会议的速记报告构建而成,旨在支持基于权威感知的多视角检索增强生成(RAG)应用。所有内容均为意大利语,但会议和议程摘要提供意大利语和英语版本。 数据集包含11个表格,通过共享标识符(如 session_id、person_id 等)相互关联: - 'speeches'(46,844行):每场演讲的逐字记录,包含日期、辩论标题、阶段和演讲者信息。 - 'sessions'(705行):全体会议,含意大利语和英语摘要。 - 'debates'(7,080行):每次会议的议程项目,附摘要。 - 'votes'(17,295行):点名投票记录,包含主题、结果、数字统计及关联法案。 - 'individual_votes'(6,893,559行):每位议员的个人投票详情(支持、反对、弃权、缺席)。 - 'persons'(455行):议员和政府成员的个人信息,包括职业、教育背景、职务。 - 'organizations'(97行):议会团体、委员会、混合小组组成及政府。 - 'memberships'(2,204行):人员与组织的隶属关系,包含起止日期和任职。 - 'acts'(35,616行):法案、动议、质询、决议等。 - 'act_subjects'(148,387行):法案与 EuroVoc 概念主题的关联。 - 'speech_references'(31,495行):演讲中通过命名实体识别(NER)解析的人员提及和法案引用。 该数据集适用于文本检索、问答、检索增强生成(RAG)等自然语言处理任务,尤其适合涉及议会政治、法律文本和意大利语处理的场景。已知限制包括:仅包含众议院记录,不含参议院;444项法案为占位符;44场演讲缺少演讲者归属;部分会议和议程摘要为空(仅60/705次会议和222/7,080项议程包含摘要)。数据集采用 CC-BY 4.0 许可,使用时应同时标注众议院和 ParliamentRAG 的出处,并引用相关论文。

ParliamentRAG dataset contains the complete parliamentary records of the Italian Chamber of Deputies (Camera dei deputati) for the 19th legislature (13 October 2022 to 6 August 2026). It is a flattened version of the ParliamentRAG knowledge graph, built from the official open data of the Chamber (dati.camera.it) and stenographic reports of each session, designed to support perspective-aware multi-view retrieval-augmented generation (RAG) applications. All content is in Italian, with session and agenda summaries in both Italian and English. The dataset includes 11 tables linked by shared identifiers, suitable for text retrieval, question answering, and RAG tasks, especially in parliamentary politics, legal texts, and Italian language processing. Known limitations include: only Chamber records, no Senate; 444 bills are placeholders; 44 speeches lack speaker attribution; some session and agenda summaries are empty. Licensed under CC-BY 4.0.

创建时间:
2026-08-14
原始信息汇总

ParliamentRAG 数据集概述

基本信息

  • 数据集名称:ParliamentRAG — Italian Chamber of Deputies, 19th legislature
  • 许可证:CC-BY 4.0
  • 语言:意大利语(会议和辩论摘要提供意大利语和英语双语版本)
  • 数据规模:1M < n < 10M 行
  • 任务类型:文本检索、问答
  • 标签:议会、政治、意大利、法律、知识图谱、RAG

内容简介

该数据集收录了意大利众议院(Camera dei deputati)第19届立法机构(2022年10月13日至2026年8月6日)的完整会议记录,包括逐字发言稿、点名投票记录(含每名议员的投票)、带有EuroVoc主题的议会法案,以及议员在政党、委员会和政府中的任职变动情况。数据会随着新会议内容的录入持续更新。

数据表结构

数据集包含11张表,通过共享标识符(如session_idvote_idspeech_idperson_idact_uri)相互关联:

表名 行数 内容
speeches 46,844 每次发言的逐字记录,含日期、辩论标题、阶段和发言人
sessions 705 全体会议,含意大利语和英语摘要
debates 7,080 每次会议的议程项目及摘要
votes 17,295 点名投票:主题、结果、数字统计、关联法案
individual_votes 6,893,559 每名议员每次投票的记录
persons 455 议员和政府成员:职业、教育、职务
organizations 97 议会党团、委员会、混合小组组成、政府
memberships 2,204 人员与组织的关系起止时间及担任职务
acts 35,616 法案、动议、质询、决议及其他议会文件
act_subjects 148,387 法案与EuroVoc概念之间的关联
speech_references 31,495 发言中经NER识别的人物提及和法案引用

数据特点

  • 个人投票结果为favoragainstabstainabsent四种;秘密投票(secret_vote = true)仅记录参与情况(absentabstain),不公开具体投票方向,仅提供汇总数据
  • 发言按实际发表顺序排列(会议日期、辩论顺序、阶段顺序)

数据来源与构建

数据来源于以下三个渠道:

  • dati.camera.it SPARQL端点(OCD本体):议员、任期、党团、委员会、法案、投票数据
  • 众议院速记报告(XML格式):发言记录、辩论结构
  • EuroVoc:欧盟多语言主题词表

构建流程(下载、解析、实体解析、NER关联)为开源项目,可通过GitHub获取:github.com/Emeierkeio/ParliamentRAG。会话和辩论摘要是LLM生成的摘要,已在数据中标记;其余内容均来自官方记录。

已知限制

  • 仅包含众议院数据,不包括参议院会议记录
  • 444项法案为占位符(is_placeholder = true):被辩论或投票引用,但尚未对应到完整记录(多为编号格式变体和委员会版本的法案)
  • 有44次发言缺少发言人归属信息(速记报告未标明发言人)
  • 摘要仅覆盖2026年年中引入摘要功能后收录的会议:705场会议中60场、7,080场辩论中222场有摘要,其余为null

使用与引用

可通过Hugging Face的datasets库加载使用,例如: python from datasets import load_dataset speeches = load_dataset("emeierkeio/parliamentrag-camera-leg19", "speeches", split="train") votes = load_dataset("emeierkeio/parliamentrag-camera-leg19", "votes", split="train")

数据集的RDF版本已归档在Zenodo(10.5281/zenodo.21560331)。使用该数据集时需同时标注数据来源(意大利众议院)和数据集制作者(ParliamentRAG),并引用论文《Who Speaks Matters: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings》。

搜集汇总
数据集介绍
parliamentrag-camera-leg19 数据集图片
构建方式
该数据集源自意大利众议院第十九届立法机关的完整议事记录,通过整合官方开放数据门户dati.camera.it的SPARQL端点(基于OCD本体)、众议院逐字速记报告以及欧盟EuroVoc主题词表等多源异构数据,构建了一个涵盖演讲、投票、法案、人物及组织隶属关系的知识图谱,并将其扁平化为11个相互关联的表格,以Parquet格式存储。其构建流程包括数据下载、解析、实体消解与命名实体识别链接,全程开源,并定期随新议事的纳入而更新。
特点
该数据集的核心特色在于其多维度、细粒度的结构,不仅包含46,844篇逐字演讲记录、17,295次唱名投票及逾689万条个人投票记录,还通过共享的标识符(如session_id、person_id)实现跨表关联,支持对议会活动的全息透视。此外,数据集中融入了知识图谱的语义关联,通过EuroVoc主题链接法案,并通过NER技术识别演讲中提及的人物与法案,为权威感知的多视角检索增强生成(RAG)提供坚实的数据基础。
使用方法
该数据集可通过HuggingFace Datasets库轻松加载,例如使用`load_dataset`函数分别获取演讲、投票等不同配置的数据。其表结构设计清晰,支持复杂的SQL式查询与关系型分析。研究人员可基于`speeches`表进行文本分析,结合`individual_votes`表进行投票行为研究,或利用`acts`与`act_subjects`表探讨立法主题演变。配套的论文及开源构建管道(github.com/Emeierkeio/ParliamentRAG)为复现与扩展研究提供了便利。
背景与挑战
背景概述
在数字治理与开放政府数据运动蓬勃发展的当下,议会语料作为民主决策的透明化记录,其结构化与知识化对于提升政治问责和研究立法过程具有重要价值。ParliamentRAG — Italian Chamber of Deputies, 19th legislature 数据集由 Emeierkeio 团队创建,核心研究者包括 Mirko Tritella、Riccardo Pozzi 和 Matteo Palmonari,于 2026 年发布,旨在将意大利众议院第 19 届立法机构(2022年10月至2026年8月)的完整议事录、唱名表决、议会法案及议员隶属关系等异构信息整合为知识图谱,并开放为扁平化表格,以支持检索增强生成(RAG)等自然语言处理任务。该数据集依托官方数据源 dati.camera.it、速记报告及 EuroVoc 主题词表构建,其配套系统 parliamentrag.it 和论文《Who Speaks Matters》展示了权威感知的多视图 RAG 应用,对议会信息学、法律 NLP 及政治科学领域产生了开拓性影响。
当前挑战
该数据集所应对的领域挑战在于议会数据的高度异构性与语义复杂性,涵盖多语种文本、复杂实体关系及动态时间维度,传统方法难以有效支撑细粒度的信息检索与问答;此外,从原始速记报告到结构化知识图谱的构建过程中,需攻克实体解析、NER 链接、跨表关联及缺失数据处理等难题。具体而言,构建中面临典型困难包括:个别法案因格式变体或源数据缺失而以占位符呈现(444 项);44 条发言缺乏说话人归属;LLM 生成的会议与辩论摘要仅覆盖部分期次(60/705 会议、222/7080 辩论),导致数据不完整;同时需确保跨表主键的一致性与隐私约束(如秘密投票仅记录参与状态),这些因素对数据质量与可用性构成持续挑战。
常用场景
经典使用场景
在计算社会科学与政治学语料库语言学研究中,该数据集作为意大利第十九届众议院全体会议记录的权威来源,为研究者提供了覆盖2022年10月至2026年8月间逾四万六千篇逐字演讲文本、七千余项议程辩论及近七百万条个人投票记录的结构化语料。其独特的层次化设计——从会议、辩论到演讲与投票的细粒度关联——使得学者能够以高精度追踪立法过程中的话语互动与决策动态,特别适用于议会辩论分析、投票行为建模以及政治议程演化等经典研究场景。
解决学术问题
该数据集有效突破了传统议会语料库在结构化程度与实体关联性上的局限,解决了从非结构化会议记录中提取可量化政治信号的学术难题。通过将演讲者属性、组织隶属关系、法案主题(EuroVoc分类)及投票结果进行交叉链接,它支持对政治立场迁移、党派纪律性以及话语影响力进行多维度实证检验。其行级标识符的统一性消除了数据整合瓶颈,使研究者能直接运用图神经网络、时序分析或自然语言处理方法,探究立法过程中的深层模式,推动了计算政治学从描述性分析向因果推断范式的转变。
衍生相关工作
围绕该数据集已衍生出一系列具有代表性的学术工作,其中最为瞩目的是其支撑的论文《Who Speaks Matters: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings》(ISWC 2026)。该工作通过融合演讲者权威性特征,提出了多视图RAG架构,显著提升了对议会记录中复杂查询的应答质量。此外,基于同一知识图谱的开源构建管线(GitHub ParliamentRAG)及Zenodo上的RDF归档版本,为知识工程领域提供了可复现的基准资源,促使后续研究探索议会数据在跨语言摘要、实体消歧及时间感知知识图谱补全等方向上的更广泛应用,形成了活跃的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务