遇见数据集

Learning-Stories-Benchmark

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

EleMo-Pedagogy-Bench-DE 是一个用于评估早期儿童教育中学习故事(Learning Stories)的基准数据集,基于 Margaret Carr 方法论构建。该数据集包含 11 个多样化的教育场景,涵盖冲突、冒险游戏、包容性、最小化原始数据等情境。每个场景包含以下内容:教育者的原始观察数据(要点式记录)、EleMo-V2(28B 参数本地专用模型)的输出、Gemini 3.1 Pro(云端通用模型)的输出、通过中立评判者(Llama 3.3 70B)进行的结构化评估,以及用于个人使用的 A/B 比较脚本和批量处理模板。数据集适用于 LLM-as-a-Judge 评估、DPO/RLHF 训练(将 EleMo 输出作为“选中”样本,Gemini 输出作为“拒绝”样本)以及提示工程分析(研究如何避免幻觉、提高“认知纪律”)。所有观察数据均为合成生成或经过深度匿名化,不包含真实儿童的个人身份信息。

EleMo-Pedagogy-Bench-DE is a benchmark dataset for evaluating Learning Stories in early childhood education, built on the Margaret Carr methodology. It contains 11 diverse educational scenarios covering conflict, adventure play, inclusivity, minimal raw data, etc. Each scenario includes: educators raw observation data (bullet-point notes), output of EleMo-V2 (28B parameter local specialized model), output of Gemini 3.1 Pro (cloud general-purpose model), structured evaluation by a neutral judge (Llama 3.3 70B), and A/B comparison scripts and batch processing templates for personal use. The dataset is suitable for LLM-as-a-Judge evaluation, DPO/RLHF training (using EleMo outputs as chosen samples and Gemini outputs as rejected samples), and prompt engineering analysis (studying how to avoid hallucinations and improve cognitive discipline). All observation data are synthetically generated or deeply anonymized, containing no real childrens personally identifiable information.

创建时间:
2026-09-01
原始信息汇总

🧸 EleMo-Pedagogy-Bench-DE 数据集总结

数据集概述

EleMo-Pedagogy-Bench-DE 是一个用于早期儿童教育领域的学习故事(Learning Stories)基准数据集,旨在根据 Margaret Carr 的方法论 对教育性学习故事进行客观评估与比较。该数据集与专门的评估工具捆绑提供,用于系统性分析和比较 AI 生成的教学文本。

基本信息

属性
许可证 Apache 2.0(README 英文部分同时标注为 CC BY-NC 4.0)
任务类别 文本生成、文本分类
语言 德语、英语
标签 幼儿教育、教育学、基准、Margaret Carr、LLM-as-a-Judge、DPO、学习故事、本地AI等
发布者 Sebastian Götz / Kita Digital
发布时间 2026年

数据集内容

该数据集涵盖 11个多样化的教学场景(包括:冲突处理、冒险游戏(Risky Play)、包容性教育、最小化原始数据等)。每个场景包含以下组成部分:

  1. 原始观察数据:教育者以要点形式做的观察记录(子弹笔记)。

  2. EleMo-V2 的输出:28B 参数的本地专业化模型生成的文本。

  3. Gemini 3.1 Pro 的输出:云端通用大模型生成的文本。

  4. 中立裁判的结构化评估:由 Llama 3.3 70B 对上述两种输出进行比较评判。

  5. 个人使用脚本:用于按 Carr 方法比较学习故事的 A/B 对比脚本。

  6. 空白批处理模板:用于大规模批量处理学习故事的 A/B 批量对比模板。


应用场景

  • LLM-as-a-Judge 评估:测试其他模型对教学文本的评估能力。
  • DPO / RLHF 训练:将 EleMo 的输出作为“已选”(Chosen)响应,Gemini 的输出作为“已拒”(Rejected)响应,训练模型遵循教学护栏。
  • 提示工程:分析何种提示能带来更好的“认知纪律”(避免对儿童内在状态的幻觉)。

工具附件说明

  • 数据集附带的脚本需要连接到本地硬件上的 LM Studio 才能运行;若使用在线 API,则需使用在线版本。
  • 相关脚本可在 GitHub 的 github.com/kita-digital 上获取。

隐私与数据说明

该数据集中所有观察数据均为合成生成或经过强匿名化的示例场景,不包含任何真实的、可识别身份的儿童个人数据。


引用信息

如需引用该数据集,可使用以下 BibTeX 格式:

bibtex @dataset{elemo_pedagogy_bench_de, title = {EleMo-Pedagogy-Bench-DE: A Benchmark Dataset for Evaluating Learning Stories in Early Childhood Education}, author = {Sebastian Götz / Kita Digital}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/Earlychildhoodeducation/EleMo-Pedagogy-Bench-DE-Dataset} }

搜集汇总
数据集介绍
Learning-Stories-Benchmark 数据集图片
构建方式
该数据集系为早期教育领域量身打造的基准测试资源,其构建根植于Margaret Carr的学习故事方法论,旨在系统评估与对比AI生成的儿童教育叙事文本。数据集精心设计了11个多元且典型的幼儿教育场景,覆盖冲突处理、风险游戏、融合教育及数据稀疏等情境,每个场景均包含教育者的原始观察记录、经本地微调模型EleMo-V2与云端通用模型Gemini 3.1 Pro生成的对照文本,以及由中立评判模型Llama 3.3 70B依据Carr标准进行的结构化评价。同时整合了用于交互式对比的脚本与支持批量处理的模板,构成了一个完整、严谨的评测体系。
特点
该数据集的核心特色在于其双层比较架构与教育学导向性。通过内置本地专用模型与云端通用模型的成对输出,它为研究模型规模与专业化程度对输出质量的影响提供了独特视角,实证表明专用小模型在评价任务中可超越超大模型。其评价体系纳入LLM-as-a-Judge机制,聚焦文本的“认知纪律”,即对儿童内在状态推测的准确性,从而有效倡导反幻觉与专业伦理。此外,所有底层观察数据均经过合成或深度匿名化处理,严格规避隐私风险,同时涵盖从单一叙事深度剖析到大规模批量评估的多层级应用,兼具科研严谨性与实际可用性。
使用方法
该数据集适用于多种前沿研究路径。在模型对齐方面,研究者可利用其中EleMo与Gemini的输出分别作为DPO训练中的优选与次选样本,以强化模型遵循教育学规范的能力。亦可用于评测其他LLM作为裁判的公正性与准确性,或通过分析不同提示词结构对生成文本认知纪律的影响,开展系统的提示工程探索。数据集中附带的可执行脚本支持对自有学习故事进行Carr框架下的A/B对比,要求环境预先配置LM Studio以连接本地大模型,而在线API用户则应寻用相应兼容版本。这一工具链在兼顾数据伦理的前提下,为早期教育领域AI应用的质量保障提供了实践路径。
背景与挑战
背景概述
该数据集名为Learning-Stories-Benchmark,由Sebastian Götz及其团队于2026年创建并发布在Hugging Face平台上,隶属于Kita Digital项目。其核心研究问题在于,随着人工智能技术向幼儿教育领域的渗透,如何确保AI生成的教学文档(如学习故事)符合Margaret Carr提出的教育学方法论,并维持专业标准、遏制幻觉现象。该基准工具通过对比本地专业化模型EleMo-V2与云端通用模型Gemini 3.1 Pro的产出,揭示了模型规模并非决定输出质量的唯一因素,为教育人工智能的评估提供了全新视角。该数据集对相关领域的影响力体现在:它不仅为教育工作者提供了客观的A/B比较与批处理评估工具,还支持了LLM-as-a-Judge、DPO/RLHF训练及提示工程等前沿研究方向,推动了幼儿教育中AI应用的透明化与规范化进程。
当前挑战
该数据集面临的挑战首先源于其所属领域的内在复杂性:幼儿教育情境高度依赖具体语境,学习故事需捕捉儿童的细微行为线索,而AI模型常常难以准确解读儿童的内在状态,导致生成内容易出现认知越界或幻觉,这构成了对模型‘认知纪律’的严峻考验。其次,在数据集构建过程中,研究者需在真实性与隐私保护间取得平衡,所有观测数据均采用合成或深度匿名化处理,但此类策略可能削弱数据的生态效度;同时,场景多样性(涵盖冲突、风险游戏、包容性及最小原始数据等11个维度)对标注的一致性与评判的公平性提出了极高要求,而本地评判模型(Llama 3.3 70B)的可靠性亦需反复验证,以确保基准工具的鲁棒性。
常用场景
经典使用场景
在幼教领域,学习故事作为记录幼儿学习过程的叙事性评价工具,其质量直接关乎教育决策的科学性。本数据集为评估与对比此类叙事文本提供了标准化基准,其经典用途在于支持LLM-as-a-Judge模式的系统评测。研究者可借助数据集内置的11个多样化教学情境(涵盖冲突、风险游戏、包容性等),对不同模型输出的学习故事进行结构化比对,客观衡量其是否符合Carr方法论中的学习倾向性指标。
实际应用
在实际应用场景中,本数据集成为连接AI技术与幼儿教育实践的桥梁。它既可直接服务于教育机构,运用配套脚本对教育者撰写的学习故事进行批量质检与同行评审,也可辅助开发园本培训资源,通过优质范例学习提升教师的观察记录能力。此外,其作为模型微调语料的潜力,亦为构建响应更精准、更契合教育伦理的专属AI助教(如EleMo系统)铺设了数据基石。
衍生相关工作
该基准的出现,催生了若干值得瞩目的学术延伸。其一,它为偏好优化(如DPO)与RLHF训练提供了天然的对照语料,即以EleMo与Gemini的输出分别作为正负样本,进而锻造具有教育护栏的对话模型;其二,有关提示工程的探究亦因此展开,旨在发掘能驱动模型恪守事实描述、规避臆断的指令模式;其三,EleMo模型“专精制胜”的实例与云端通用巨头的性能对比,为教育领域本地化小模型的适配研究开辟了全新视界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务