遇见数据集

Japanese Language Taxonomy

收藏
github2026-07-11 更新2026-07-13 收录
官方服务:

资源简介:

一个开放的、图结构化的日语语言分类法和交互式学习地图,用于日语习得。包含两个独立的先决条件图和一个学习者中立的比较层:ja-L1-child(母语日语儿童语言发展和学校读写能力,涵盖1-12年级)、ja-L2-adult(成人第二语言习得,涵盖JF/CEFR式熟练度、JLPT N5-N1和BJT J5-J1+)和ja-shared-capability(33个稳定的能力家族,跨所有L1和L2主题,不声称等级对等)。数据集是可执行的种子,非官方课程或考试指导。

An open, graph-structured Japanese language taxonomy and interactive learning map for Japanese language acquisition. It consists of two separate prerequisite graphs and a learner-neutral comparison layer: ja-L1-child (native Japanese children's language development and school literacy, covering grades 1 through 12), ja-L2-adult (adult second language acquisition, covering JF/CEFR-aligned proficiency levels, JLPT N5-N1, and BJT J5-J1+), and ja-shared-capability (33 stable competency families spanning all L1 and L2 topics, with no asserted proficiency level equivalence). This dataset is an executable seed resource, and is not intended as an official curriculum or exam guidance.

创建时间:
2026-07-10
原始信息汇总

数据集概述

名称:Japanese Language Taxonomy(日语语言分类体系)

类型:开放、图结构化的日语学习分类体系与交互式学习图谱

地址:https://github.com/jethac/os-taxonomy-japanese


核心构成

该数据集包含三个独立且互不重叠的模块:

模块 说明
ja-L1-child 日语母语儿童从小学1年级到12年级的语言发展与学校读写能力
ja-L2-adult 成人第二语言习得路径,覆盖JF/CEFR能力等级、JLPT N5–N1、BJT J5–J1+
ja-shared-capability 33个稳定能力族,用于对照L1和L2的每个主题,不声称等级等同

当前数据集为可执行种子版本,非官方课程或考试指南。


数据模型

  • 主题(Topics):细粒度的可学习概念,包含:
    • 英文和日文名称
    • 学习者范围与领域元数据
    • 掌握证据与评估提示
    • 标准与来源标签
    • 可选元数据:JLPT、BJT、JF、ACTFL、文字、教材对齐、汉字、词汇
  • 依赖关系(Dependencies):连接主题与其先修主题,包含强度与原因说明,每个配置文件独立验证为有向无环图(DAG)
  • 共享能力(capabilities.json):每个源主题唯一映射到一个稳定的比较层,路线成员记录主题重叠,不表示学校年级等效、学习者掌握程度或考试覆盖整个能力
  • 汉字与词汇:作为伴随数据存在,不以单个汉字或词作为图节点;图节点代表可迁移技能(如阅读策略、正字法模式、语言功能、交际程序)

本地运行与验证

启动交互式学习图谱查看器

bash npm run serve

然后访问 http://127.0.0.1:4175/

验证数据集(需Node.js 20或更新版本):

bash npm run validate npm run manifest

验证内容包括:模式形状、唯一ID、跨文件引用、学习者配置文件元数据、来源标签、标准、伴随链接、先修课程循环检测、日文学习者面向文本的完全覆盖。


交互式图谱功能

  • 共享能力图,带母语儿童与成人L2路线环
  • 路线、差异、评估覆盖、超越考试四种比较视图
  • 独立的JLPT、BJT、MEXT覆盖透镜,区分直接、支持与未测量能力
  • 完整母语儿童与成人L2先修图访问
  • 英文与日文界面/主题标签模式切换
  • 浅色与深色主题
  • 可持久化、可分享的查看器设置
  • 确定性3D等级/能力场景
  • 搜索及高级过滤器(领域、聚类、类型、范围、标准、文字、JLPT、BJT)
  • 成人JLPT N5–N1等级导航
  • 相邻依赖桥梁(如N4 → N3)
  • 先修与解锁追踪
  • 主题证据、评估提示、标准、来源、参考对齐
  • 汉字与词素伴随数据链接
  • 主题、路径、筛选列表、分享链接导出
  • 键盘导航与减少动画支持

仓库结构

data/ native-child/ L1主题、依赖关系、标准与聚类 l2-adult/ 成人L2主题、依赖关系、标准与聚类 locales/ 面向学习者的日语散文本地化 shared/ 能力对照表及汉字、词汇、来源元数据 manifest.json 数据集计数与配置文件清单 schema/ 所有公开数据形状的JSON Schema scripts/ validate.mjs 结构、引用、元数据与DAG验证 update-capabilities.mjs update-manifest.mjs serve.mjs 无依赖本地静态服务器 viewer/ HTML、CSS与Canvas应用


本地化与来源

  • data/locales/ja.json 提供日语面向学习者的散文(主题描述、掌握证据、评估提示、依赖原因、对齐说明、来源与伴随元数据)
  • 状态字段区分机器辅助草稿文本与人工审核本地化,验证要求完全覆盖
  • 来源使用与再分发边界记录在 PROVENANCE-JAPANESE.md
  • 限制性来源仅通过独立撰写的分类文本、代码、引用、等级或元数据层对齐进行表述

许可

  • 原始代码、模式、查看器文件与项目撰写的分类内容:MIT License
  • 外部来源名称、标识符与元数据:受各自权利与条款约束
搜集汇总
数据集介绍
Japanese Language Taxonomy 数据集图片
构建方式
Japanese Language Taxonomy 数据集以图谱结构呈现,将日语语言习得划分为三条独立路径:面向母语儿童(ja-L1-child)的年级递进体系、面向成人第二语言学习者(ja-L2-adult)的JF/CEFR/JLPT/BJT能力等级体系,以及跨学习者类型的中立能力对照层(ja-shared-capability)。每条路径均包含细粒度的可学习主题(topic),这些主题通过有向无环图(DAG)建立前提依赖关系,并附有掌握证据、评估提示、标准标签、脚本类型、教材对齐及汉字词汇等元数据。数据集还整合了来自JLPT、BJT等外部考试的覆盖度数据,确保其结构独立且不声称与课程或考试直接等价。
特点
该数据集的核心特点在于其双轨并行与中立比较层设计,能够同时覆盖母语儿童和成人二语学习者的习得路径,并通过33个能力族(capability families)实现跨路径的语义对照。每个主题均支持英文和日文双语描述,且包含详尽的依赖强度、领域范围、标准来源及评估提示信息。数据集内置可视化学习地图,提供路线、差异、考试覆盖及超越考试等四种视图,并支持JLPT N5至N1的层级导航与前提追踪。此外,数据集还包含经过人工审核的日语学习者面向文本,以及独立的汉字和词汇伴生数据,整体上兼具教学参考与学术研究的双重价值。
使用方法
用户可通过运行静态查看器(`npm run serve`)以在浏览器中交互式浏览该学习地图,支持搜索、过滤、依赖追踪及导出功能。数据集以JSON Schema严格定义形状,数据文件存储于`data/`目录下,分为`native-child`、`l2-adult`、`locales`、`shared`等子目录。用户可借助`scripts/validate.mjs`脚本进行结构、引用、元数据及有向无环图验证,确保数据完整性。对于需要自定义扩展的场景,可基于`data/shared/capabilities.json`中的能力映射层添加新的主题或依赖关系,并遵循MIT协议对原创代码和词表内容进行合规重用与分发。
背景与挑战
背景概述
Japanese Language Taxonomy是一个以图结构组织的开放数据集,专为日语语言习得研究而设计,由研究团队于近年创建。该数据集的核心创新在于构建了两个独立但可相互对照的依存关系图:一是面向母语者(L1)的儿童日语发展过程,覆盖1至12年级的学校教育;二是面向成年第二语言学习者(L2)的习得路径,对应JF/CEFR、JLPT N5至N1、BJT J5至J1+等国际标准。此外,数据集还引入了包含33个稳定能力族的共享能力层,用于在不同学习者画像之间建立概念映射,而不主张年级或水平等价。该数据集的发布为日语教育、语言习得理论及计算语言学研究提供了精细化的结构化知识资源,显著推动了课程设计、评估框架对齐和个性化学习路径生成等领域的发展。
当前挑战
Japanese Language Taxonomy所解决的领域问题核心在于日语语言习得路径的结构化建模与多标准对齐。传统日语教育资源通常割裂地处理母语发展与第二语言习得,缺乏统一的、可计算的知识表示框架。该数据集通过图结构实现了细粒度学习概念(如阅读策略、语言功能、交际程序)的依存关系建模,并支持JLPT、BJT、ACTFL等多种评估体系的能力覆盖分析。在构建过程中,主要挑战包括:确保L1与L2依存图各自为有向无环图以避免逻辑循环;为每个话题撰写独立的掌握证据、评估提示及依存关系理由;实现学习者面向的日语散文本地化(含机翻草稿与人工审核状态区分);以及处理外部来源的版权限制,仅通过独立创作的文本、代码引用或元数据对齐进行表述。
常用场景
经典使用场景
Japanese Language Taxonomy数据集的核心应用在于构建动态、可视化的日语学习知识图谱。它整合了母语儿童(ja-L1-child)与成人二语习得者(ja-L2-adult)两条独立的先修技能路径,并通过ja-shared-capability层实现跨路径的能力映射。研究者利用该数据集可创建交互式学习地图,支持学习者按JLPT等级、BJT层级或日本文部科学省标准进行导航,并能实时追踪知识点间的依赖关系与解锁条件,从而为个性化学习路径推荐和自适应学习系统提供结构化数据基础。
衍生相关工作
该数据集衍生了一系列重要的后续工作,包括基于DAG验证的课程结构优化研究,其中数据集的validate.mjs脚本被复用为语法检测工具;共享能力桥接层启发了跨语言能力迁移学习项目,将日语能力族映射到其他语种的习得研究中;交互式学习地图的Canvas实现模式为多语言知识可视化工具提供了参考框架;此外,数据集中的JLPT/BJT对齐元数据已被用于开发自动评估题目难度对齐算法,推动了考试内容效度分析模型的发展。
数据集最近研究
最新研究方向
日本语言学习图谱领域正朝向精细化、可交互、多模态的认知结构建模方向演进。Japanese Language Taxonomy数据集通过构建母语儿童(L1)与成人二语习得(L2)的双轨先修图,并设计中立的能力交叉层,突破了传统语言学习资源中单一难度等级或课程大纲的局限。研究前沿聚焦于将语言能力拆解为可追溯、可验证的细粒度概念节点,结合JLPT、BJT、MEXT等权威标准的覆盖分析,形成面向学习路径规划、能力诊断与教学优化的动态知识图谱。该数据集以开放图谱和可视化学习地图的形式呈现,不仅支持多语言界面与主题筛选,还通过依赖桥接、前置追踪、评估证据对齐等机制,为个性化语言学习与智能辅导系统提供了可扩展的基础设施,具有推动语言教育数据标准化的深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务