celarai_early_literacy_public_gpt41_mini
收藏资源简介:
Celarai Early Literacy Public Gpt41 Mini 是一个专为早期识字教育设计的开源数据集,通过YourBench框架(v0.9.0)生成。该数据集包含经过多阶段处理的文档材料:原始文档摄入、分层摘要生成、文本分块处理,以及针对1-2年级学生设计的单跳和多跳问题生成。数据集包含六个配置版本:chunked(分块文本)、ingested(原始文档)、summarized(摘要文本)、single_hop_questions(单跳问题)、multi_hop_questions(多跳问题)和prepared_lighteval(评估准备格式)。问题生成严格遵循儿童友好原则,使用简短句子和基础词汇,包含字面理解、推理和联系生活三类问题。数据规模从2个样本(原始文档)到36个样本(评估格式)不等,适用于早期识字能力评估、教育问答系统开发等应用场景。
Celarai Early Literacy Public Gpt41 Mini is an open-source dataset designed specifically for early literacy education, generated using the YourBench framework (v0.9.0). This dataset includes multi-stage processed document materials: raw document ingestion, hierarchical summary generation, text chunking, and single-hop and multi-hop question generation tailored for students in grades 1 to 2. The dataset offers six configuration variants: chunked (chunked text), ingested (raw document), summarized (summary text), single_hop_questions (single-hop questions), multi_hop_questions (multi-hop questions), and prepared_lighteval (evaluation-ready format). The question generation strictly adheres to child-friendly principles, using short sentences and basic vocabulary, covering three types of questions: literal comprehension, reasoning, and real-life connection. The dataset size ranges from 2 samples (raw documents) to 36 samples (evaluation-ready format), and is applicable to scenarios including early literacy ability assessment and educational question answering system development.



