遇见数据集

korean-assembly-minutes

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集收录了韩国国会第22届至第26届(2024~2026年)的会议记录原文,数据来源于韩国国会记录官方网站(record.assembly.go.kr)的PDF文件,经过文本提取后整理而成。数据集包含全体会议和各类委员会会议的记录,共计1,373次会议,文本总字数约1.18亿字。数据按年份组织为多个JSONL格式的gzip压缩文件。每条记录包含15个字段:会议唯一标识(meeting_key)、原始记录ID(record_id)、会议日期(conf_date)、议会届次(era)、会议期次与次数(session_no/sitting_no)、委员会名称(committee,全体会议标记为‘국회본회의’)、会议类型(conf_kind,如全体会议、小委员会等)、会议记录标题(title)、原始PDF链接(source_url)、文本提取器版本(extractor)、PDF页数与字符数(page_count/char_count)、以及会议记录全文(text)。数据集的适用任务包括文本生成和摘要生成,尤其适用于韩语议会文本分析、政治话语研究、自然语言处理中的长文本摘要等场景。需要注意的是,数据包含发言者的真实姓名和具体发言内容,建议不要用于个人评价或画像分析。

This dataset contains the original meeting records of the 22nd to 26th sessions (2024~2026) of the South Korean National Assembly (국회). The data is sourced from PDF files on the official National Assembly records website (record.assembly.go.kr), extracted and organized through text processing. It includes records from plenary sessions and various committee meetings, totaling 1,373 meetings with approximately 118 million characters of text. The data is organized by year into multiple JSONL-format gzip compressed files. Each record contains 15 fields: meeting unique identifier (meeting_key), original record ID (record_id), meeting date (conf_date), parliamentary term (era), session and sitting numbers (session_no/sitting_no), committee name (committee, with plenary sessions marked as 국회본회의), meeting type (conf_kind, e.g., plenary, subcommittee), meeting record title (title), original PDF link (source_url), text extractor version (extractor), PDF page count and character count (page_count/char_count), and full meeting text (text). Applicable tasks include text generation and summarization, especially suitable for Korean parliamentary text analysis, political discourse research, and long-text summarization in natural language processing. Note that the data includes real names and specific speech content; it is not recommended for personal evaluation or profiling.

创建时间:
2026-08-26
原始信息汇总

大韩民国国会会议记录档案数据集

数据集简介

该数据集包含从韩国国会会议记录官方网站(record.assembly.go.kr)PDF中提取的会议记录全文,涵盖1948年至1993年期间的本会议及各委员会会议记录。

数据规模

  • 会议数量:1,951件
  • 正文篇幅:65,306,444字
  • 数据量级:10K至100K条记录

数据构成

数据按年度整理为JSONL(gzip压缩)格式文件,支持以下加载方式:

  • 加载全部数据:使用load_dataset("seoulraphaellee/korean-assembly-minutes", split="train")
  • 加载特定年份数据:通过data_files参数指定如data/2026.jsonl.gz的文件

字段说明

字段名 说明
meeting_key 会议标识符(形式为record:<id>
record_id 国会会议记录原文ID
conf_date 会议日期(YYYY-MM-DD格式)
era 届数(如:第22届国会)
session_no / sitting_no 会期/次第
committee 委员会名称(本会议为"国会本会议")
conf_kind 会议类型(全体会议、小委员会等)
title 会议记录标题
source_url 原文PDF地址
extractor 正文提取器
page_count / char_count 原文页数/字数
text 会议记录正文

构建方法

正文提取优先使用pdfplumber,若失败或提取结果不理想则改用PyMuPDF或pypdf,并在页面边界处进行文本衔接以避免句子被截断。

年度分布

各年份会议数量从1件至239件不等,其中1970年(239件)、1968年(182件)、1992年(163件)的会议数量较多,而1954年、1980年等年份仅1件。1958年至1972年间会议数量相对密集,1993年后数据收录结束。

使用建议

国会会议记录属于公开资料,但由于其中包含发言者真实姓名及个人发言内容,建议不要用于对个人的判断或画像分析。

数据集元数据

  • 许可协议:other
  • 语言:韩语(ko)
  • 任务类别:文本生成、摘要
  • 标签:韩语、议会、政府、会议记录
搜集汇总
数据集介绍
korean-assembly-minutes 数据集图片
构建方式
该数据集源自韩国国会会议记录原文PDF,通过系统化文本抽取流程构建而成。具体而言,以pdfplumber作为首选解析工具,当解析失败或输出内容过于稀疏时,依次启用PyMuPDF与pypdf进行补充提取,并在页面边界处实施句子级拼接处理,以避免文本断裂。最终按年度维度将全部记录整合为JSONL格式的gzip压缩文件,形成涵盖1948年至1993年间共1,951场会议、约6,530万字符的全文语料库。
特点
数据集以韩国国会会议记录为核心内容,覆盖全体会议及各委员会会议,时间跨度自1948年延续至1993年。其显著特征在于收录了1,951场会议的完整正文,总字符量逾6,500万,且每场会议均附有会议标识符、原始记录编号、会议日期、届次、会期、委员会名称、会议类型、标题、原文PDF链接、提取工具、页数及字符数等元数据字段。文本来源为公开的国会会议记录原文,兼具历史纵深与机构覆盖的完整性。
使用方法
研究者可通过Hugging Face数据集接口便捷加载该语料,使用load_dataset函数指定训练集划分即可获取全部数据,亦可按年度加载特定JSONL压缩文件。数据字段设计支持文本生成与摘要任务,用户可依据会议元数据筛选特定届次、委员会或日期范围,并利用text字段进行模型训练或分析。需要注意的是,会议记录中包含发言者真实姓名与具体发言内容,使用时应避免用于针对个人的判断或画像构建。
背景与挑战
背景概述
韩国国会会议录作为韩国立法史与政治史的核心档案,长期以分散的PDF文件形式存储于官方记录系统,检索与计算分析极为不便。在此背景下,首尔研究人员于2024年前后构建了korean-assembly-minutes数据集,将1948年至1993年间1951次会议、逾6500万字的全会与委员会记录予以结构化整理,涵盖第1至第14届国会时段。该数据集首次为韩国政治文本挖掘、议会话语分析与历史语言学研究提供了大规模、可复现的语料基础,对韩国数字人文及计算社会科学具有奠基性意义。
当前挑战
该数据集所面向的领域问题在于超长议会记录的多任务处理,包括文本生成、摘要与说话人解析,其挑战源自会议录篇幅宏大、格式异质且历时跨度长。构建过程中的具体困难体现为:原始PDF版式复杂,表格、批注与多栏排版导致单一提取器失效,需在pdfplumber、PyMuPDF与pypdf间回退;跨页句子易被截断,需精细拼接以保持语义完整;早期文档扫描质量低、韩文旧式拼写与汉字混用进一步加剧识别难度。此外,发言者实名信息带来的隐私与伦理风险亦构成持续挑战。
常用场景
经典使用场景
在政治文本挖掘与议会话语分析领域,该数据集最为经典的用途在于对韩国国会会议记录进行长文本摘要与生成式建模。研究者借助其涵盖1948年至1993年间1951次会议、逾6500万字的会议原文,训练和评估韩语长文档摘要模型,或利用其结构化字段(如会议日期、委员会名称、会议类型)开展议题追踪与发言模式分析。该数据集亦常被用于韩语预训练语言模型的领域适应微调,以增强模型对正式公文与口语化议事记录的语义理解能力。
衍生相关工作
围绕该数据集,已衍生出若干与韩语议会文本处理相关的研究工作。部分研究以其为基础构建了韩语长文本摘要基准,并比较了不同预训练模型在正式议事记录上的表现;另有工作利用其时间跨度与元数据开展政治话语的历时分析,探讨议题关注点的迁移。该数据集亦被用于开发韩语命名实体识别与说话人角色分类任务,促进了议会场景下信息抽取技术的发展,并为后续更大规模议会语料库的建设提供了方法参考。
数据集最近研究
最新研究方向
在韩国国会会议记录档案的近期研究中,基于1948至1993年跨越四十五载的六千五百万字实录,前沿探索集中于议会话语的历时性计算分析与政治传播机制挖掘。研究者利用该数据集训练韩语预训练模型,开展会议摘要生成、议题演化追踪及立法共识形成过程的建模,尤其关注威权转型期民主话语的微妙变迁。伴随韩国政治史与数字人文的交叉热点,该档案为理解东亚代议政治运作、冷战时期议会外交及本土政治术语体系提供了不可替代的语料基础,对推动低资源政治文本处理及历史记忆的量化研究具有显著学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务