遇见数据集

OpenJA

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

OpenJA 是一个高质量的日本国会会议记录文本数据集,核心内容为日本官方发布的议会辩论和会议的文字转录稿,源自“Kokkai Kaigiroku”(国会会議録)。该数据集经过自动化清理,移除了HTML标签、脚注、编辑表格和导航模板等非文本内容,确保了文本的纯净性(无网络噪声、HTML或广告)和元数据的可靠性。然而,其语域相对狭窄,主要集中于正式、官方的议会演讲风格。因此,它更适合作为对更广泛、更多样化日语语料库(如网络文本)的补充,用于持续预训练或特定领域任务,而非作为通用语言模型预训练的唯一数据源。数据集规模为3,244,877条记录,使用Qwen/Qwen3.5-9B模型进行分词后,总计约6.79亿个token。数据以JSONL格式存储,遵循CC BY 4.0开源许可。未来计划推出覆盖1947年至2026年更长时间范围的扩展版本(OpenJA-Max)。

OpenJA is a high-quality Japanese parliamentary proceedings text dataset. Its core content consists of official transcripts of parliamentary debates and meetings released by the Japanese government, sourced from Kokkai Kaigiroku (国会会議録). The dataset has been automatically cleaned to remove non-textual content such as HTML tags, footnotes, editorial tables, and navigation templates, ensuring text purity (free from web noise, HTML, or ads) and metadata reliability. However, its domain is relatively narrow, primarily focused on formal, official parliamentary speech styles. Therefore, it is more suitable as a supplement to broader and more diverse Japanese corpora (e.g., web text) for continued pre-training or domain-specific tasks, rather than as the sole data source for general language model pre-training. The dataset scale is 3,244,877 records, with approximately 679 million tokens after tokenization using the Qwen/Qwen3.5-9B model. Data is stored in JSONL format under the CC BY 4.0 open-source license. Future plans include an extended version (OpenJA-Max) covering a longer time range from 1947 to 2026.

创建时间:
2026-07-23
原始信息汇总

数据集概述:OpenJA

OpenJA 是一个高质量、经过清洗的日本国会会议记录(Kokkai Kaigiroku)文本数据集,专注于日语官方/议会语言。该数据集适合作为预训练或持续预训练的补充语料,尤其适用于文本生成、掩码填充和文本分类任务。

关键统计信息

  • 总记录数: 3,244,877 条发言记录。
  • 总数据量: 约 679,496,535 个 token(使用 Qwen/Qwen3.5-9B 分词器)。
  • 格式: Parquet。
  • 覆盖年份: 2000 年至 2026 年。

数据结构

数据集包含 17 个字段,提供了发言内容、发言人信息、会议元数据及来源链接。

字段 类型 说明
id string 唯一发言 ID
issueID string 所属会议 ID
year int 会议年份(主要过滤字段)
date string 会议日期(YYYY-MM-DD)
session string 国会会期编号
nameOfHouse string 议院:众议院或参议院
nameOfMeeting string 委员会/会议名称
issue string 会议记录期号
closing string 会议闭幕标记
speaker string 发言人姓名
speakerYomi string 发言人姓名(注音假名)
speakerGroup string 发言人所处政党/派系
speakerPosition string 发言人职务
speakerRole string 发言人在会议中的角色
speechOrder int 发言在会议中的顺序
text string 清洗后的发言文本(无 HTML、注释等)
speechURL string 原始会议记录链接

创建与清洗流程

  1. 来源: 数据来自日本国会会议录系统(Kokkai Kaigiroku)。
  2. 清洗: 通过自动化处理,移除了 HTML 标签、脚注、编辑表格和导航模板,保留纯净文本。

许可与版权

  • 数据集的整理和策展采用 CC BY 4.0 许可,允许商业和非商业用途,需标注出处。

使用示例

python from datasets import load_dataset dataset = load_dataset("maxzt/OpenJA", split="train")

未来规划

后续将发布 OpenJA-Max 版本,时间范围扩展至 1947 年至 2026 年。

搜集汇总
数据集介绍
OpenJA 数据集图片
构建方式
OpenJA数据集源自日本国会会议录(Kokkai Kaigiroku)的官方正式文本,通过编程方式系统化地采集了2000年至2026年间发布的议会发言记录。在数据构建过程中,研究者实施了自动化清洗流程,严格剔除HTML标签、脚注、编辑表格及导航模板等网页噪声,保留了纯净的日语口语文本。最终以Parquet格式存储,包含超过324万条发言记录,约6.8亿个token,为日语自然语言处理研究提供了高质量的结构化数据源。
特点
该数据集的核心优势在于其卓越的数据质量与丰富的元数据体系。每一条发言记录均附带17个字段的详细标注,涵盖发言者姓名、政党派系、职务角色、会议名称、议院类型及日期等关键信息,尤其支持按年份进行灵活的数据筛选。尽管文本风格局限于正式的政治议会议事场合,但其无网络噪音、无广告干扰的纯净特点,使其成为补充通用预训练语料库的宝贵资源。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载OpenJA数据集,代码示例为`from datasets import load_dataset; dataset = load_dataset("maxzt/OpenJA", split="train")`。该数据集主要适用于文本生成、掩码填充及文本分类等下游任务。未来还将推出涵盖1947至2026年更长时段数据的OpenJA-Max版本,进一步扩展其时间覆盖范围。数据遵循CC BY 4.0许可协议,支持商业与非商业用途。
背景与挑战
背景概述
OpenJA数据集由研究者maxzt于近期创建,专注于提供高质量、去噪的日本国会会议记录(Kokkai Kaigiroku)文本,涵盖2000年至2026年的发言数据,总计约324万条记录、6.79亿个token。其核心研究问题在于为日语预训练语言模型提供一份纯净、结构化且附带丰富元数据(如发言者、党派、会议日期等)的语料来源。该数据集以CC BY 4.0许可发布,填补了日语领域缺乏大规模、清洁官方语料的空白,尤其对研究议会语言风格、政治话语分析及领域自适应预训练具有重要价值。尽管其语言注册较为单一,OpenJA仍作为高质量补充语料,在日语自然语言处理社区中初步展现了影响力,推动了更规范的日语预训练语料构建工作。
当前挑战
OpenJA数据集所解决的领域问题在于,通用日语预训练语料常受网络噪声(如HTML标签、广告、非规范表达)污染,而该数据集通过自动化清洗流程提供了几乎无噪的议会文本,但其构建过程中面临的主要挑战包括:1) 原始会议记录包含大量表格、脚注及导航模板等非纯文本元素,需设计鲁棒的解析与移除算法;2) 单一语言注册导致数据多样性不足,模型若仅依赖此语料可能过拟合于正式、程式化的议会用语,削弱泛化能力;3) 元数据中发言者姓名、党派等字段存在格式不统一及缺失问题,需人工修正和标准化;4) 数据集覆盖年限虽广,但早期(如1947-1999年)文本的数字化质量与结构化程度差异显著,阻碍了历史数据的完整纳入,因此目前版本仅包含2000年后的数据,未来计划发布的OpenJA-Max版本需解决跨年代数据对齐与清洗一致性的技术难题。
常用场景
经典使用场景
OpenJA数据集旨在为日语自然语言处理研究提供高质量、去噪的官方议会文本资源。其经典使用场景涵盖日语预训练语言模型的持续预训练(continued pretraining),研究者可将其作为多样化语料库的补充,提升模型对正式日语文本的理解能力。此外,该数据集亦适用于掩码语言建模(fill-mask)与文本生成任务,凭借其经过精心清洗的议会发言文本,确保模型在训练过程中免受网页噪声、HTML标签及广告等干扰,从而专注于学习日语官方语言风格中的语法结构与修辞特征。
衍生相关工作
围绕OpenJA数据集,已衍生出若干相关研究工作。数据集的创建者计划发布更广泛的OpenJA-Max版本,覆盖1947年至2026年的更长时段,旨在进一步扩展历时尚归的覆盖范围。该数据集的开放许可(CC BY 4.0)与Parquet格式的易用性,也激励了后续研究者利用其开展跨领域预训练实验,例如将议会文本与其他日语语料(如新闻、小说)融合,探索多样化语域对语言模型泛化能力的增益效果。此外,数据集丰富的元数据还为发言角色识别、党派倾向分析等细粒度研究任务提供了支持。
数据集最近研究
最新研究方向
OpenJA数据集聚焦于日本国会会议录的高质量文本语料构建,为日语预训练模型提供了纯净、无噪声的官方语言样本。近期前沿研究方向主要围绕利用议会话语的正式性与结构化元数据(如发言者党派、角色、时间跨度)进行细粒度语言建模、政治话语分析以及跨领域持续预训练。该数据集的出现响应了日语自然语言处理中稀缺的高可靠性、低资源领域语料需求,尤其在文本生成与少样本学习任务中作用显著。其未来扩展至1947至2026年跨度的OpenJA-Max版本,将极大推动对日本战后政治话语演变的时序分析与模型时序适应研究,对理解社会语言变迁与政策传播机制具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务