遇见数据集

MeloLingua CEFR-Graded Multilingual Stories Dataset

收藏
github2026-08-28 更新2026-09-11 收录
官方服务:

资源简介:

MeloLingua CEFR分级多语言故事数据集是一个可引用的教育语料库,包含118个公共语言学习故事,涵盖德语、西班牙语、法语、意大利语、韩语和俄语。它将目标语言文本与对齐的英语翻译配对,并添加了上下文词汇、理解问题、句子构建练习、教学元数据以及指向MeloLingua原始课程的规范链接。

The MeloLingua CEFR-aligned Multilingual Story Dataset is a citable educational corpus containing 118 publicly available language learning stories spanning German, Spanish, French, Italian, Korean, and Russian. It pairs target-language texts with aligned English translations, and includes contextual vocabulary, comprehension questions, sentence-building exercises, instructional metadata, as well as official links to the original MeloLingua courses.

创建时间:
2026-08-28
原始信息汇总

MeloLingua CEFR分级多语言故事数据集

数据集概况

  • 名称:MeloLingua CEFR-Graded Multilingual Stories Dataset
  • 版本:1.0.0
  • 发布日期:2026年8月27日
  • 维护方:MeloLingua
  • 内容:118篇公开语言学习故事的教学语料库
  • 目标语言:德语、西班牙语、法语、意大利语、韩语、俄语
  • 对齐方式:目标语言 ↔ 英语
  • CEFR范围:A1、A2、B1、B2
  • 数据许可:CC BY-NC 4.0

数据集组成

语言 代码 A1 A2 B1 B2 合计
德语 de 6 7 6 6 25
西班牙语 es 7 5 6 6 24
法语 fr 6 6 6 6 24
意大利语 it 6 7 6 6 25
韩语 ko 5 5 0 0 10
俄语 ru 5 5 0 0 10
合计 35 36 24 24 118

自动化验证器会断言这些计数,确保每次发布具有透明、可复现的组成结构。

每篇故事包含的内容

  • 稳定的故事ID、语言、区域设置、文字系统和编辑设定的CEFR等级
  • 标题、摘要、主题、背景标签、语法重点和学习成果
  • 按顺序排列的目标语言句子与英语翻译一一配对
  • 词汇(含词元、含义、句子锚点和示例,如可用)
  • 阅读前词汇和可复用的语言注释(如可用)
  • 多项选择理解题及参考答案和解释
  • 基于已发布故事文本的确定性组句练习
  • 规范课程URL、源哈希、导出日期和数据集语义哈希

每个 canonical_url 均链接至 MeloLingua 上面向学习者的源课程,便于教师、研究人员和开发者验证上下文与出处。

数据文件

文件 单位 推荐用途
data/stories.json 每篇故事一条嵌套记录 完整教学结构、API、检索、定性研究
data/stories.csv 每篇故事一行 电子表格、筛选、目录分析
data/sentences.csv 每行一对对齐句子 平行文本与翻译实验
data/vocabulary.csv 每行一个词汇项 语境词汇分析
data/questions.csv 每行一道理解题 教育评估与问答原型
schema/story.schema.json 单篇故事的JSON Schema 验证与集成

加载数据集

Python

python import json

with open("data/stories.json", encoding="utf-8") as handle: stories = json.load(handle)

french_b1 = [ story for story in stories if story["language"]["code"] == "fr" and story["cefr_level"] == "B1" ]

print(len(french_b1)) # 6 print(french_b1[0]["canonical_url"])

JavaScript

js import stories from ./data/stories.json with { type: json };

const koreanA2 = stories.filter( (story) => story.language.code === ko && story.cefr_level === A2, );

console.log(koreanA2.map(({ title, canonical_url }) => ({ title, canonical_url })));

来源与方法论

版本1.0.0是MeloLingua公共学习目录中于2026年8月27日发布的118篇A1–B2故事的结构化快照。故事记录保留了其公开的规范URL和源哈希。该导出规范化了教学结构并创建确定性CSV视图,未重写故事文本或翻译。

相关文档:方法论、数据集数据表、JSON Schema。

CEFR等级

欧洲语言共同参考框架描述了从A1到C2的语言能力。本数据集覆盖A1至B2。其等级为MeloLingua编辑教学标签,并非官方测试成绩或认证。

适用用途

  • 课堂阅读活动和非商业课程改编
  • 多语言搜索、检索和筛选原型
  • 平行文本与翻译界面实验
  • 语境词汇分析
  • 教育问答原型
  • 数字分级读物与学习资源结构研究
  • 出处感知教育数据集演示

本数据集不是心理测量学验证的评估工具、统计代表性语言语料库,也不能替代经过验证的能力测试。

验证数据集

建议使用Node.js 22或更新版本。

bash npm run build npm run check

持续集成会验证记录数量、语言和等级覆盖、句子对齐、规范URL、哈希、模式兼容字段以及生成的CSV新鲜度。

许可与署名

数据集内容依据知识共享署名-非商业性使用4.0国际许可协议授权。您可以在署名、提供许可链接并注明更改的情况下,为非商业目的共享和改编材料。验证和转换代码采用MIT许可。

建议署名:

MeloLingua CEFR-Graded Multilingual Stories Dataset, version 1.0.0, MeloLingua, 2026. https://github.com/MeloLingua/melolingua-language-stories-dataset — CC BY-NC 4.0.

相关文件:LICENSE-DATA.mdLICENSE-CODEdocs/ATTRIBUTION.md

引用

GitHub可从 CITATION.cff 生成引用。在获得带DOI的存档之前,请引用版本1.0.0和仓库URL。

bibtex @dataset{melolingua_stories_2026, author = {{MeloLingua}}, title = {MeloLingua CEFR-Graded Multilingual Stories Dataset}, year = {2026}, version = {1.0.0}, publisher = {MeloLingua}, url = {https://github.com/MeloLingua/melolingua-language-stories-dataset} }

常见问题

数据集涵盖什么内容?

包含六种目标语言的118篇公开分级故事。德语、西班牙语、法语和意大利语覆盖A1–B2;韩语和俄语目前覆盖A1–A2。

英语翻译是否按句子对齐?

是。每个目标语言句子在同一记录中都有对应的英语翻译。对齐为教学性和句子级别,而非词级别。

CEFR标签是否为官方认证?

否。它们是用于组织MeloLingua故事的编辑教学标签,不应用于高风险评估。

是否可以商业使用该数据集?

根据CC BY-NC 4.0,不可商业使用。如需商业许可,请通过MeloLingua联系。

在哪里可以阅读原始课程?

打开任意记录的 canonical_url。每篇故事都链接到MeloLingua上面向学习者的课程。

关于MeloLingua

MeloLingua发布基于故事的语言学习资源。本仓库为教师、研究人员和开发者提供对其公开分级故事目录的结构化、可引用访问。

搜集汇总
数据集介绍
MeloLingua CEFR-Graded Multilingual Stories Dataset 数据集图片
构建方式
该数据集以MeloLingua平台公开发布的118篇分级故事为源文本,在版本1.0.0中通过结构化导出流程构建而成。每篇故事均保留其公开规范链接与源哈希,导出过程对教学结构进行归一化处理,并将目标语言句子与英语译文逐句对齐,配以词汇、语言注释、阅读理解问题及基于原文自动生成的组句练习。自动化校验脚本对故事数量、语言与级别覆盖、句子对齐、规范链接、哈希值及CSV视图一致性进行核验,从而确保各版本具有透明且可复现的组成结构。
特点
数据集涵盖德语、西班牙语、法语、意大利语、韩语和俄语六种目标语言,CEFR等级覆盖A1至B2,各语言在各等级上的篇数分布均衡且经自动化校验确认。每个故事记录包含稳定标识、语言与区域信息、脚本类型、编辑性CEFR标签、标题、摘要、主题、场景标签、语法焦点、学习成果、逐句对齐译文、词汇条目及其例句、读前词汇、可复用语言注释、多项选择理解题及确定性组句练习,并提供规范课程链接、源哈希、导出日期与语义哈希,兼顾教学支持与来源可溯。
使用方法
使用者可通过Python或JavaScript直接加载data/stories.json获取完整的嵌套教育结构,用于API构建、检索系统及定性研究;data/stories.csv适用于电子表格筛选与目录分析;sentences.csv可用于平行文本与翻译实验;vocabulary.csv支持语境词汇分析;questions.csv则服务于教育评估与问答原型。使用时应遵循CC BY-NC 4.0许可,注明出处并保留规范链接,且需注意该数据集并非心理测量学验证的评估工具,CEFR标签仅为编辑性教学标识,不宜用于高风险测评。
背景与挑战
背景概述
在数字化语言教育资源日益丰富的背景下,分级阅读材料的结构化与可复现性成为教育技术与二语习得研究的热点议题。MeloLingua于2026年8月27日发布了CEFR分级多语言故事数据集1.0版本,由MeloLingua团队维护,涵盖德语、西班牙语、法语、意大利语、韩语和俄语共118篇公开语言学习故事,每个故事均配有对齐的英文翻译、词汇注释、理解问题及造句练习等教学元数据。该数据集旨在为教师、研究者和开发者提供可引用的分级阅读语料,推动数字分级读物的结构研究与教育问答系统开发,其规范化的数据视图和持续集成验证机制为教育数据集的透明性与可复现性树立了典范。
当前挑战
该数据集所面对的核心领域问题在于多语言分级阅读资源的标准化构建与教育适用性平衡。在构建过程中,主要挑战包括:确保六种语言在A1至B2各层级上的数量均衡与质量一致,韩语和俄语目前仅覆盖A1至A2,暴露出语言覆盖不均衡的局限;实现目标语言与英语之间句子级别的教学对齐,需兼顾语义准确与教学适用性;维护CEFR等级标注的编辑一致性,避免主观偏差影响资源可信度;以及通过自动化验证保障数据模式、哈希、链接与CSV导出的一致性,同时保留原始故事的公共链接与出处信息,满足溯源需求。
常用场景
经典使用场景
在语言教育与多语言自然语言处理的交叉领域,分级阅读语料库长期扮演着连接教学实践与计算研究的枢纽角色。MeloLingua CEFR-Graded Multilingual Stories Dataset 最经典的使用场景在于为二语习得研究与教学实践提供CEFR分级的平行故事文本。研究者可依据A1至B2的编辑分级标签筛选德语、西班牙语、法语、意大利语、韩语和俄语的目标语篇,借助与英语逐句对齐的翻译结构开展可读性分析、词汇分布统计与阅读难度建模。教师则可将故事、词汇表、阅读理解题及造句练习直接嵌入课堂阅读活动,学习者通过目标语与母语对照的语篇输入,在语境中习得词汇与句法结构。该数据集以JSON与CSV等多种格式封装,便于检索、过滤与教学适配,构成分级阅读研究与课堂应用的基础资源。
解决学术问题
分级阅读语料库的稀缺长期制约着二语习得、机器翻译与教育数据科学等领域的实证研究。MeloLingua数据集以其CEFR分级的多语言平行故事文本,缓解了若干常见的学术困境:其一,为跨语言可读性研究提供了具有统一教学分级标签的对照语料,使不同目标语之间的难度比较成为可能;其二,逐句对齐的目标语—英语翻译对为平行文本挖掘、翻译界面实验与对齐算法评估提供了结构化的数据支撑;其三,词汇表、语言注释与阅读理解题的嵌套结构,为教育问答系统、自动出题与学习者建模研究提供了可复用的标注资源。该数据集的意义在于以可引用、可验证的方式将公开教学资源转化为学术研究基础设施,推动了数字分级读物的结构研究与来源可追溯的教育数据实践。
衍生相关工作
作为MeloLingua公开分级故事目录的结构化快照,该数据集衍生了一系列围绕分级阅读与多语言教育数据的研究与开发工作。其语义哈希与来源哈希机制支持构建可追溯的教育数据管道,为来源感知的数据集演示提供了参考范例;其确定性的CSV视图与JSON Schema校验流程,促进了可复现数据发布标准的讨论。基于该语料,研究者可开展数字分级读物的结构分析与学习资源元数据研究,或利用平行句对拓展低资源语言的翻译实验。词汇语境分析与教育问答原型亦在其基础上形成若干探索性工作。该数据集以CC BY-NC 4.0协议开放,为非商业研究与教学衍生工作提供了清晰的许可边界,持续吸引着二语习得、教育技术与计算语言学领域的关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务