OpenJLPT
收藏数据链接:
官方服务:
资源简介:
OpenJLPT是一个开放、正确许可的JLPT N5至N1数据集,包含词汇、汉字和例句,以JSON、CSV和SQLite格式提供,适用于开发者和学习者。
OpenJLPT is an open and properly licensed JLPT dataset covering levels N5 through N1. It includes vocabulary, kanji, and example sentences, and is provided in JSON, CSV, and SQLite formats for developers and learners.
创建时间:
2026-07-01
原始信息汇总
OpenJLPT 数据集概述
OpenJLPT 是一个面向开发者的、开放且拥有正确许可的 JLPT(日本语能力测试)数据集。它包含了从 N5 到 N1 所有级别的日语词汇和汉字,并提供干净的 JSON、CSV 格式以及预构建的 SQLite 数据库,便于直接集成到各种语言学习应用中。
核心特性
- 完整覆盖:包含 N5 至 N1 全部五个级别的词汇和汉字。
- 例句丰富:约 89% 的词汇配有来自 Tatoeba 的真实日英对照例句。
- 标准架构:提供经过版本控制、文档验证的统一数据规范(Schema)。
- 多格式支持:数据提供 JSON(按级别分文件)、CSV(电子表格友好)和预建的、带索引的 SQLite 数据库。
- 许可明确:采用 CC BY-SA 4.0 许可,并在
NOTICE.md文件中详细说明了所有数据的来源和归属。 - 可复现:通过单一命令即可从上游源数据重建整个数据集。
数据内容详情
按级别划分的数据量
| 级别 | 词汇量 | 汉字量 | 语法点 |
|---|---|---|---|
| N5 | 662 | 79 | 20 |
| N4 | 632 | 166 | 20 |
| N3 | 1,784 | 367 | 20 |
| N2 | 1,793 | 367 | 20 |
| N1 | 3,463 | 1,232 | 20 |
| 总计 | 8,334 | 2,211 | 100 |
数据文件结构
data/ ├── json/ │ ├── vocab/{n5,n4,n3,n2,n1}.json │ ├── kanji/{n5,n4,n3,n2,n1}.json │ └── grammar/{n5,n4,n3,n2,n1}.json ├── csv/ │ ├── vocab-n5.csv … vocab-n1.csv │ ├── kanji-n5.csv … kanji-n1.csv │ └── grammar-n5.csv … grammar-n1.csv └── openjlpt.sqlite # 数据库表: vocab, kanji, grammar
数据条目示例
- 词汇条目:包含单词(word)、读音(reading)、含义(meanings)、级别(level)和例句(examples,约89%词汇具备)。
- 汉字条目:包含汉字(character)、级别(level)、笔画数(strokes)、年级(grade)、频率(freq)、音读(onyomi)、训读(kunyomi)和含义(meanings)。
- 语法条目:包含语法模式(pattern)、级别(level)、含义(meaning)、构成(formation)、例句(examples)和标签(tags,如“permission”)。
数据来源
- 级别归属:基于 Jonathan Waller 的社区标准列表(CC BY)。
- 汉字详情:来自 KANJIDIC2 项目(EDRDG, CC BY-SA 4.0)。
- 例句:来自 Tatoeba 项目(CC许可)。
适用人群
- 应用与工具开发者:快速获取构建闪卡、测验或学习机器人所需的基础数据。
- 教师:提取现成的工作表和教学材料单词/汉字列表。
- 学习者:获取特定级别(如 N4)的准确学习清单及例句。
- 研究人员:获得一个干净、文档齐全的数据集用于构建和实验。
数据获取与使用方式
- 直接下载:从
data/目录下载 JSON 或 CSV 文件。 - 通过 npm 安装(TypeScript):
npm install openjlpt。 - 通过 PyPI 安装(Python):
pip install openjlpt。 - SQLite 查询:直接查询
openjlpt.sqlite数据库。
许可说明
- 数据集与代码:采用 CC BY-SA 4.0 许可,可免费商用,需注明出处并遵循相同方式共享。
项目路线图
- 已完成:N5-N1 词汇(含三种格式)、从 KANJIDIC2 扩展的汉字、JSON Schema 及 CI 验证、词汇例句、结构化语法点(种子数据)、Python PyPI 包。
- 待开发:原生/TTS 音频、托管 REST/GraphQL API。
搜集汇总
数据集介绍

构建方式
OpenJLPT数据集是一项针对日语能力测试(JLPT)的开放资源,其构建依托于社区公认的Jonathan Waller词汇与汉字等级列表(CC BY许可)以及EDRDG提供的KANJIDIC2汉字详情(CC BY-SA 4.0)。通过集成Tatoeba项目中的日英对照例句,数据集实现了对89%词汇的例句覆盖。整个构建过程采用可复现的自动化管道,通过单一命令即可从上游源头抓取原始数据,并经过格式转换、架构验证等步骤,最终生成JSON、CSV及SQLite三种标准化格式,确保每个字段的出处清晰可溯。
使用方法
用户可通过多种便捷途径调用数据:直接访问GitHub仓库中的JSON或CSV文件即可获取结构化词条;若采用编程方式,可使用npm安装TypeScript包调用如getVocab('N5')等函数,或通过pip安装Python包利用get_vocab、find_kanji等接口进行查询。对于数据库分析场景,内置的SQLite文件支持原生SQL查询,例如筛选特定级别的汉字或搜索词汇。非技术用户亦可直接下载各级别的预设列表,无缝嵌入学习应用或教学材料中,实现零门槛的数据利用。
背景与挑战
背景概述
OpenJLPT数据集诞生于日语学习工具开发领域长期存在的碎片化数据困境。该数据集由社区开发者于2023年创建,旨在为日语能力测试(JLPT)提供一份完整、开放且具有明确许可证的标准化词库。核心研究问题聚焦于如何系统整合N5至N1五个级别的词汇、汉字及语法点,并确保数据来源清晰、格式统一。数据集收录了8,334个词汇、2,211个汉字及100个语法条目,并附带来自Tatoeba的真实例句(覆盖89%词汇)。其影响力体现在为应用开发者、教师及研究者提供了可直接使用的JSON、CSV及SQLite格式资源,显著降低了日语学习工具的开发门槛,填补了该领域高质量开放数据集的空白。
当前挑战
OpenJLPT所解决的核心领域挑战是日语教育数据长期缺乏官方标准与统一许可。日本国际交流基金会从未公开发布官方JLPT单词或汉字列表,导致民间衍生数据版本混杂、层级矛盾频发,且多数仓库版权不明或仅部分维护,严重阻碍了学习工具的开发与互操作性。在构建过程中,团队面临的首要挑战是数据溯源与合规:必须依赖Jonathan Waller社区标准列表(CC BY)作为层级依据,并整合KANJIDIC2等外部资源,同时确保每一字段的归属清晰、许可兼容。其次,数据整合的复杂性远超预期——需要协调同一汉字在不同来源中的频率、笔画、音读训读差异,并为绝大多数词汇匹配准确的双语例句。此外,还需设计可验证的规范模式(JSON Schema)并搭建自动化CI流程,以确保持续维护下的数据质量与可复现性。
常用场景
经典使用场景
在日语教育研究领域,OpenJLPT数据集最经典的使用场景是为开发者构建语言学习应用程序提供标准化的基础数据支撑。该数据集整合了日本语能力测试(JLPT)从N5到N1五个级别的8,334个词汇、2,211个汉字及100个语法点,并以JSON、CSV和SQLite三种格式统一呈现。这使得研究人员与开发者能够直接获取经过版本控制、模式验证和明确许可的数据,从而大幅简化了词典查询、闪卡训练、分级练习等核心功能的实现流程,为构建高效、可扩展的日语学习工具奠定了坚实的数据基础。
解决学术问题
OpenJLPT数据集有效解决了日语自然语言处理与教育技术研究中长期存在的数据碎片化与许可不明问题。以往,研究者需要从多个维护不一的开源仓库中拼接词汇和汉字列表,且多数缺乏标准化的等级划分、例句标注和清晰的使用许可,极大阻碍了可复现实验与跨系统对比。该数据集通过统一社区公认的等级映射、附以89%词汇的日英对照例句,并提供CC BY-SA 4.0许可,使得词汇级别分类、汉字频率统计、语法点分布分析等基础研究拥有了可靠、可验证的基准数据,显著提升了学术成果的可信度与可比较性。
实际应用
在实际应用层面,OpenJLPT数据集已被广泛集成于各类日语学习平台与智能工具中。例如,移动端的记忆卡片应用可通过其SQLite数据库实现无缝的离线查询与分级复习;在线测试系统能够基于词汇和语法点自动生成适应不同水平(N5至N1)的练习题目;浏览器插件利用其结构化数据提供即时的单词和汉字释义弹出功能。此外,教育工作者可便捷地提取指定级别的词表用于教案编写和课堂测验,而自学用户则能直接获取精确的“N4需要掌握哪些汉字”等实用性列表,极大提升了学习材料准备的效率与准确性。
数据集最近研究
最新研究方向
面向日语能力测试(JLPT)的开放标准化数据集构建与应用,聚焦于合规授权、多格式兼容与可复现性,推动语言学习工具与教育资源的高效开发。
以上内容由遇见数据集搜集并总结生成



