OpenJA
收藏资源简介:
OpenJA 是一个高质量的日本国会会议记录文本数据集,核心内容为日本官方发布的议会辩论和会议的文字转录稿,源自“Kokkai Kaigiroku”(国会会議録)。该数据集经过自动化清理,移除了HTML标签、脚注、编辑表格和导航模板等非文本内容,确保了文本的纯净性(无网络噪声、HTML或广告)和元数据的可靠性。然而,其语域相对狭窄,主要集中于正式、官方的议会演讲风格。因此,它更适合作为对更广泛、更多样化日语语料库(如网络文本)的补充,用于持续预训练或特定领域任务,而非作为通用语言模型预训练的唯一数据源。数据集规模为3,244,877条记录,使用Qwen/Qwen3.5-9B模型进行分词后,总计约6.79亿个token。数据以JSONL格式存储,遵循CC BY 4.0开源许可。未来计划推出覆盖1947年至2026年更长时间范围的扩展版本(OpenJA-Max)。
OpenJA is a high-quality Japanese parliamentary proceedings text dataset. Its core content consists of official transcripts of parliamentary debates and meetings released by the Japanese government, sourced from Kokkai Kaigiroku (国会会議録). The dataset has been automatically cleaned to remove non-textual content such as HTML tags, footnotes, editorial tables, and navigation templates, ensuring text purity (free from web noise, HTML, or ads) and metadata reliability. However, its domain is relatively narrow, primarily focused on formal, official parliamentary speech styles. Therefore, it is more suitable as a supplement to broader and more diverse Japanese corpora (e.g., web text) for continued pre-training or domain-specific tasks, rather than as the sole data source for general language model pre-training. The dataset scale is 3,244,877 records, with approximately 679 million tokens after tokenization using the Qwen/Qwen3.5-9B model. Data is stored in JSONL format under the CC BY 4.0 open-source license. Future plans include an extended version (OpenJA-Max) covering a longer time range from 1947 to 2026.
数据集概述:OpenJA
OpenJA 是一个高质量、经过清洗的日本国会会议记录(Kokkai Kaigiroku)文本数据集,专注于日语官方/议会语言。该数据集适合作为预训练或持续预训练的补充语料,尤其适用于文本生成、掩码填充和文本分类任务。
关键统计信息
- 总记录数: 3,244,877 条发言记录。
- 总数据量: 约 679,496,535 个 token(使用
Qwen/Qwen3.5-9B分词器)。 - 格式: Parquet。
- 覆盖年份: 2000 年至 2026 年。
数据结构
数据集包含 17 个字段,提供了发言内容、发言人信息、会议元数据及来源链接。
| 字段 | 类型 | 说明 |
|---|---|---|
id |
string | 唯一发言 ID |
issueID |
string | 所属会议 ID |
year |
int | 会议年份(主要过滤字段) |
date |
string | 会议日期(YYYY-MM-DD) |
session |
string | 国会会期编号 |
nameOfHouse |
string | 议院:众议院或参议院 |
nameOfMeeting |
string | 委员会/会议名称 |
issue |
string | 会议记录期号 |
closing |
string | 会议闭幕标记 |
speaker |
string | 发言人姓名 |
speakerYomi |
string | 发言人姓名(注音假名) |
speakerGroup |
string | 发言人所处政党/派系 |
speakerPosition |
string | 发言人职务 |
speakerRole |
string | 发言人在会议中的角色 |
speechOrder |
int | 发言在会议中的顺序 |
text |
string | 清洗后的发言文本(无 HTML、注释等) |
speechURL |
string | 原始会议记录链接 |
创建与清洗流程
- 来源: 数据来自日本国会会议录系统(Kokkai Kaigiroku)。
- 清洗: 通过自动化处理,移除了 HTML 标签、脚注、编辑表格和导航模板,保留纯净文本。
许可与版权
- 数据集的整理和策展采用 CC BY 4.0 许可,允许商业和非商业用途,需标注出处。
使用示例
python from datasets import load_dataset dataset = load_dataset("maxzt/OpenJA", split="train")
未来规划
后续将发布 OpenJA-Max 版本,时间范围扩展至 1947 年至 2026 年。





