遇见数据集

AI-Adaptive-Learning

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集是一个结构化的教育文本语料库,包含数学(Mathématiques_2Bac)、英语(English_2Bac)和物理化学(Physique_Chimie_2Bac)三个学科的高中二年级(2Bac)课程材料,总计约401KB,由526个文本块组成(数学213个、英语170个、物理化学143个)。每个文本块包含详细的元数据信息,如来源文件、页码、学科、教育等级、语言、专业方向、章节、小节标题、内容类型以及文本内容本身,其中文本内容可能包含数学公式(math_formulas字段)。该数据集适用于教育技术、内容分析、信息检索、多语言文本处理以及特定学科(尤其是STEM领域)的自然语言处理任务研究。

This dataset is a structured educational text corpus containing senior year 2 (2Bac) course materials for three subjects: Mathematics (Mathématiques_2Bac), English (English_2Bac), and Physics & Chemistry (Physique_Chimie_2Bac). With a total size of approximately 401 KB, it consists of 526 text chunks: 213 for Mathematics, 170 for English, and 143 for Physics & Chemistry. Each text chunk includes detailed metadata such as source file, page number, subject, educational level, language, academic track, chapter, subsection title, content type, and the text content itself. The text content may contain mathematical formulas, which are stored in the `math_formulas` field. This dataset is applicable to research in educational technology, content analysis, information retrieval, multilingual text processing, and natural language processing tasks for specific disciplines, especially the STEM field.

创建时间:
2026-06-04
原始信息汇总

数据集概述:Saad-Elouakate/AI-Adaptive-Learning

数据集描述:

该数据集专为 AI 自适应学习场景设计,包含经过分块处理的摩洛哥高中理科科目学习材料。

数据特征:

特征名称 数据类型 描述
chunk_id string 数据块的唯一标识符
source_file string 原始文件名
page_number int64 内容在原始文件中的页码
subject string 所属科目
level string 学习级别/年级
language string 内容语言
specialization string 专业方向
chapter string 所属章节
section_title string 小节标题
content_type string 内容类型
content string 文本内容
math_formulas list(string) 内容中提取的数学公式列表
char_count int64 文本内容的字符数

数据集划分与规模:

数据集包含三个子集(split),总大小为 401,092 字节。具体如下:

子集名称 示例数量 字节大小
Mathématiques_2Bac 213 158,652
English_2Bac 170 109,236
Physique_Chimie_2Bac 143 133,204

下载大小: 175,448 字节

数据文件配置:

  • 配置名:default
  • 子集文件路径:
    • English_2Bacdata/English_2Bac-*
    • Physique_Chimie_2Bacdata/Physique_Chimie_2Bac-*
    • Mathématiques_2Bacdata/Mathématiques_2Bac-*
搜集汇总
数据集介绍
AI-Adaptive-Learning 数据集图片
构建方式
AI-Adaptive-Learning数据集聚焦于摩洛哥高中二年级(2Bac)阶段的学科内容,精心汇集了数学、物理化学及英语三门核心课程的学习材料。该数据集从教材和教辅资料中提取文本块,每个块以chunk_id唯一标识,并关联source_file、page_number等元数据。构建过程中,对每块内容标注了subject(学科)、level(年级)、language(语言)及specialization(专业方向)等分类信息,同时提取了数学公式(math_formulas)并统计字符长度(char_count),从而形成结构化、多维度的高质量学习语料库。
特点
该数据集具备鲜明的多学科覆盖特性,横跨理科与语言类课程,满足自适应学习系统的差异化需求。其核心特色在于精细的层级标注体系,从章节(chapter)到小节标题(section_title),再到内容类型(content_type),实现了学习粒度的精准划分。此外,数学公式的独立提取显著提升了数据在STEM教育场景中的应用价值,而字符计数则便于模型处理时的长度控制。数据按学科分为三个子集,结构规整,便于按需调用。
使用方法
数据集以Hugging Face标准格式发布,包含default配置,用户可通过datasets库轻松加载。加载时需指定split参数,例如选择'Mathematics_2Bac'、'Physique_Chimie_2Bac'或'English_2Bac'作为子集,以获取对应学科的数据。每个样本为字典形式,包含content字段用于文本训练,以及subject、chapter等字段用于元数据过滤或条件生成。开发者可借助math_formulas字段强化数学推理能力,也可利用char_count进行序列长度采样,适合构建个性化学习推荐或问答系统的训练数据。
背景与挑战
背景概述
AI-Adaptive-Learning数据集由研究团队于近年创建,聚焦于摩洛哥高中教育中的自适应学习领域,旨在通过结构化教材内容推动智能化教学系统的研发。该数据集涵盖数学、英语、物理化学三大学科,以章节、标题、内容类型等精细标注为基础,并包含数学公式等结构化信息,为个性化学习路径生成与知识图谱构建提供了高质量语料。其核心研究问题在于如何利用多模态教材数据(文本、公式、章节层级)训练自适应模型,从而提升教育资源的动态匹配效率。该数据集的发布填补了北非法语区教育AI领域的数据空白,对推动全球教育公平性与智能化教学工具的本地化适配具有重要影响力。
当前挑战
当前数据集面临多重挑战。领域层面,自适应学习模型需解决教材内容的碎片化整合与跨学科知识迁移难题,例如数学公式与自然语言文本的语义对齐,以及不同学科间知识图谱的自动融合。构建过程中,数据源自异构教材的扫描或电子版,存在页面噪声、公式解析歧义及章节层级缺失等问题,需依赖人工校正与规则性清洗;此外,小样本分片(如物理化学仅143条)限制了模型泛化能力,且多语言(法语、阿拉伯语混杂)标注的一致性维护亦构成显著技术瓶颈。
常用场景
经典使用场景
AI-Adaptive-Learning 数据集凭借其精细化的结构化标注体系,成为构建自适应学习系统与智能教育代理的核心训练基石。其涵盖数学、物理化学及英语等多学科的高中阶段教学内容,并依据章节、知识点类型与难度级别进行分类。在经典使用场景中,研究者常将其用于训练个性化学习路径推荐模型,系统能够根据学生个体的历史表现与认知状态,从海量文本块中精准匹配最适切的学习材料。同时,该数据集支持智能内容分割与习题生成任务,使算法能够基于标注的章节标题与内容类型自动重构教学单元,为打造沉浸式、因材施教的数字学习环境提供了结构严谨的数据支撑。
衍生相关工作
该数据集自发布以来,已衍生出多项具有深远影响的经典工作。围绕其多学科分片结构,研究者提出了名为“分层知识追踪网络”的模型,将文本块嵌入与学生答题序列融合,显著提升了对学习者掌握状态的预测精度。另一项代表性工作是跨模态教学内容对齐框架,利用数据集内嵌的数学公式列表与内容类型,实现了理论与实例的自动映射,极大促进了习题推荐系统的可解释性。此外,基于该数据集的少样本学科问答任务催生了针对北非法语区教育内容的大型语言模型微调范式,为低资源语言环境下的智能教育开辟了全新路径。
数据集最近研究
最新研究方向
该数据集聚焦于摩洛哥高中教育体系中的自适应学习研究,涵盖数学、物理化学和英语三个核心学科,通过结构化的文本分块与元数据标注(如学科、难度等级、内容类型及数学公式提取),为构建个性化学习路径与智能辅导系统提供了高质量的训练语料。当前前沿方向包括利用此数据集训练多学科知识图谱与认知诊断模型,以精准识别学生的知识薄弱点,并结合生成式AI技术实现动态习题推荐与自适应反馈。这一方向与全球教育科技中“按需学习”和“公平教育”的热点趋势紧密契合,尤其在资源有限的地区,该数据集能推动低成本、高适配性的智能学习工具开发,助力弥合优质教育资源分布不均的鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务