MeloLingua CEFR-Graded Multilingual Stories Dataset
收藏资源简介:
MeloLingua CEFR分级多语言故事数据集是一个可引用的教育语料库,包含118个公共语言学习故事,涵盖德语、西班牙语、法语、意大利语、韩语和俄语。它将目标语言文本与对齐的英语翻译配对,并添加了上下文词汇、理解问题、句子构建练习、教学元数据以及指向MeloLingua原始课程的规范链接。
The MeloLingua CEFR-aligned Multilingual Story Dataset is a citable educational corpus containing 118 publicly available language learning stories spanning German, Spanish, French, Italian, Korean, and Russian. It pairs target-language texts with aligned English translations, and includes contextual vocabulary, comprehension questions, sentence-building exercises, instructional metadata, as well as official links to the original MeloLingua courses.
MeloLingua CEFR分级多语言故事数据集
数据集概况
- 名称:MeloLingua CEFR-Graded Multilingual Stories Dataset
- 版本:1.0.0
- 发布日期:2026年8月27日
- 维护方:MeloLingua
- 内容:118篇公开语言学习故事的教学语料库
- 目标语言:德语、西班牙语、法语、意大利语、韩语、俄语
- 对齐方式:目标语言 ↔ 英语
- CEFR范围:A1、A2、B1、B2
- 数据许可:CC BY-NC 4.0
数据集组成
| 语言 | 代码 | A1 | A2 | B1 | B2 | 合计 |
|---|---|---|---|---|---|---|
| 德语 | de |
6 | 7 | 6 | 6 | 25 |
| 西班牙语 | es |
7 | 5 | 6 | 6 | 24 |
| 法语 | fr |
6 | 6 | 6 | 6 | 24 |
| 意大利语 | it |
6 | 7 | 6 | 6 | 25 |
| 韩语 | ko |
5 | 5 | 0 | 0 | 10 |
| 俄语 | ru |
5 | 5 | 0 | 0 | 10 |
| 合计 | 35 | 36 | 24 | 24 | 118 |
自动化验证器会断言这些计数,确保每次发布具有透明、可复现的组成结构。
每篇故事包含的内容
- 稳定的故事ID、语言、区域设置、文字系统和编辑设定的CEFR等级
- 标题、摘要、主题、背景标签、语法重点和学习成果
- 按顺序排列的目标语言句子与英语翻译一一配对
- 词汇(含词元、含义、句子锚点和示例,如可用)
- 阅读前词汇和可复用的语言注释(如可用)
- 多项选择理解题及参考答案和解释
- 基于已发布故事文本的确定性组句练习
- 规范课程URL、源哈希、导出日期和数据集语义哈希
每个 canonical_url 均链接至 MeloLingua 上面向学习者的源课程,便于教师、研究人员和开发者验证上下文与出处。
数据文件
| 文件 | 单位 | 推荐用途 |
|---|---|---|
data/stories.json |
每篇故事一条嵌套记录 | 完整教学结构、API、检索、定性研究 |
data/stories.csv |
每篇故事一行 | 电子表格、筛选、目录分析 |
data/sentences.csv |
每行一对对齐句子 | 平行文本与翻译实验 |
data/vocabulary.csv |
每行一个词汇项 | 语境词汇分析 |
data/questions.csv |
每行一道理解题 | 教育评估与问答原型 |
schema/story.schema.json |
单篇故事的JSON Schema | 验证与集成 |
加载数据集
Python
python import json
with open("data/stories.json", encoding="utf-8") as handle: stories = json.load(handle)
french_b1 = [ story for story in stories if story["language"]["code"] == "fr" and story["cefr_level"] == "B1" ]
print(len(french_b1)) # 6 print(french_b1[0]["canonical_url"])
JavaScript
js import stories from ./data/stories.json with { type: json };
const koreanA2 = stories.filter( (story) => story.language.code === ko && story.cefr_level === A2, );
console.log(koreanA2.map(({ title, canonical_url }) => ({ title, canonical_url })));
来源与方法论
版本1.0.0是MeloLingua公共学习目录中于2026年8月27日发布的118篇A1–B2故事的结构化快照。故事记录保留了其公开的规范URL和源哈希。该导出规范化了教学结构并创建确定性CSV视图,未重写故事文本或翻译。
相关文档:方法论、数据集数据表、JSON Schema。
CEFR等级
欧洲语言共同参考框架描述了从A1到C2的语言能力。本数据集覆盖A1至B2。其等级为MeloLingua编辑教学标签,并非官方测试成绩或认证。
适用用途
- 课堂阅读活动和非商业课程改编
- 多语言搜索、检索和筛选原型
- 平行文本与翻译界面实验
- 语境词汇分析
- 教育问答原型
- 数字分级读物与学习资源结构研究
- 出处感知教育数据集演示
本数据集不是心理测量学验证的评估工具、统计代表性语言语料库,也不能替代经过验证的能力测试。
验证数据集
建议使用Node.js 22或更新版本。
bash npm run build npm run check
持续集成会验证记录数量、语言和等级覆盖、句子对齐、规范URL、哈希、模式兼容字段以及生成的CSV新鲜度。
许可与署名
数据集内容依据知识共享署名-非商业性使用4.0国际许可协议授权。您可以在署名、提供许可链接并注明更改的情况下,为非商业目的共享和改编材料。验证和转换代码采用MIT许可。
建议署名:
MeloLingua CEFR-Graded Multilingual Stories Dataset, version 1.0.0, MeloLingua, 2026. https://github.com/MeloLingua/melolingua-language-stories-dataset — CC BY-NC 4.0.
相关文件:LICENSE-DATA.md、LICENSE-CODE、docs/ATTRIBUTION.md。
引用
GitHub可从 CITATION.cff 生成引用。在获得带DOI的存档之前,请引用版本1.0.0和仓库URL。
bibtex @dataset{melolingua_stories_2026, author = {{MeloLingua}}, title = {MeloLingua CEFR-Graded Multilingual Stories Dataset}, year = {2026}, version = {1.0.0}, publisher = {MeloLingua}, url = {https://github.com/MeloLingua/melolingua-language-stories-dataset} }
常见问题
数据集涵盖什么内容?
包含六种目标语言的118篇公开分级故事。德语、西班牙语、法语和意大利语覆盖A1–B2;韩语和俄语目前覆盖A1–A2。
英语翻译是否按句子对齐?
是。每个目标语言句子在同一记录中都有对应的英语翻译。对齐为教学性和句子级别,而非词级别。
CEFR标签是否为官方认证?
否。它们是用于组织MeloLingua故事的编辑教学标签,不应用于高风险评估。
是否可以商业使用该数据集?
根据CC BY-NC 4.0,不可商业使用。如需商业许可,请通过MeloLingua联系。
在哪里可以阅读原始课程?
打开任意记录的 canonical_url。每篇故事都链接到MeloLingua上面向学习者的课程。
关于MeloLingua
MeloLingua发布基于故事的语言学习资源。本仓库为教师、研究人员和开发者提供对其公开分级故事目录的结构化、可引用访问。




