Learning-Stories-Benchmark
收藏资源简介:
EleMo-Pedagogy-Bench-DE 是一个用于评估早期儿童教育中学习故事(Learning Stories)的基准数据集,基于 Margaret Carr 方法论构建。该数据集包含 11 个多样化的教育场景,涵盖冲突、冒险游戏、包容性、最小化原始数据等情境。每个场景包含以下内容:教育者的原始观察数据(要点式记录)、EleMo-V2(28B 参数本地专用模型)的输出、Gemini 3.1 Pro(云端通用模型)的输出、通过中立评判者(Llama 3.3 70B)进行的结构化评估,以及用于个人使用的 A/B 比较脚本和批量处理模板。数据集适用于 LLM-as-a-Judge 评估、DPO/RLHF 训练(将 EleMo 输出作为“选中”样本,Gemini 输出作为“拒绝”样本)以及提示工程分析(研究如何避免幻觉、提高“认知纪律”)。所有观察数据均为合成生成或经过深度匿名化,不包含真实儿童的个人身份信息。
EleMo-Pedagogy-Bench-DE is a benchmark dataset for evaluating Learning Stories in early childhood education, built on the Margaret Carr methodology. It contains 11 diverse educational scenarios covering conflict, adventure play, inclusivity, minimal raw data, etc. Each scenario includes: educators raw observation data (bullet-point notes), output of EleMo-V2 (28B parameter local specialized model), output of Gemini 3.1 Pro (cloud general-purpose model), structured evaluation by a neutral judge (Llama 3.3 70B), and A/B comparison scripts and batch processing templates for personal use. The dataset is suitable for LLM-as-a-Judge evaluation, DPO/RLHF training (using EleMo outputs as chosen samples and Gemini outputs as rejected samples), and prompt engineering analysis (studying how to avoid hallucinations and improve cognitive discipline). All observation data are synthetically generated or deeply anonymized, containing no real childrens personally identifiable information.
🧸 EleMo-Pedagogy-Bench-DE 数据集总结
数据集概述
EleMo-Pedagogy-Bench-DE 是一个用于早期儿童教育领域的学习故事(Learning Stories)基准数据集,旨在根据 Margaret Carr 的方法论 对教育性学习故事进行客观评估与比较。该数据集与专门的评估工具捆绑提供,用于系统性分析和比较 AI 生成的教学文本。
基本信息
| 属性 | 值 |
|---|---|
| 许可证 | Apache 2.0(README 英文部分同时标注为 CC BY-NC 4.0) |
| 任务类别 | 文本生成、文本分类 |
| 语言 | 德语、英语 |
| 标签 | 幼儿教育、教育学、基准、Margaret Carr、LLM-as-a-Judge、DPO、学习故事、本地AI等 |
| 发布者 | Sebastian Götz / Kita Digital |
| 发布时间 | 2026年 |
数据集内容
该数据集涵盖 11个多样化的教学场景(包括:冲突处理、冒险游戏(Risky Play)、包容性教育、最小化原始数据等)。每个场景包含以下组成部分:
-
原始观察数据:教育者以要点形式做的观察记录(子弹笔记)。
-
EleMo-V2 的输出:28B 参数的本地专业化模型生成的文本。
-
Gemini 3.1 Pro 的输出:云端通用大模型生成的文本。
-
中立裁判的结构化评估:由 Llama 3.3 70B 对上述两种输出进行比较评判。
-
个人使用脚本:用于按 Carr 方法比较学习故事的 A/B 对比脚本。
-
空白批处理模板:用于大规模批量处理学习故事的 A/B 批量对比模板。
应用场景
- LLM-as-a-Judge 评估:测试其他模型对教学文本的评估能力。
- DPO / RLHF 训练:将 EleMo 的输出作为“已选”(Chosen)响应,Gemini 的输出作为“已拒”(Rejected)响应,训练模型遵循教学护栏。
- 提示工程:分析何种提示能带来更好的“认知纪律”(避免对儿童内在状态的幻觉)。
工具附件说明
- 数据集附带的脚本需要连接到本地硬件上的 LM Studio 才能运行;若使用在线 API,则需使用在线版本。
- 相关脚本可在 GitHub 的 github.com/kita-digital 上获取。
隐私与数据说明
该数据集中所有观察数据均为合成生成或经过强匿名化的示例场景,不包含任何真实的、可识别身份的儿童个人数据。
引用信息
如需引用该数据集,可使用以下 BibTeX 格式:
bibtex @dataset{elemo_pedagogy_bench_de, title = {EleMo-Pedagogy-Bench-DE: A Benchmark Dataset for Evaluating Learning Stories in Early Childhood Education}, author = {Sebastian Götz / Kita Digital}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/Earlychildhoodeducation/EleMo-Pedagogy-Bench-DE-Dataset} }




