遇见数据集

mgor/EDNet

收藏
Hugging Face2025-10-14 更新2025-10-25 收录
官方服务:

资源简介:

--- dataset_info: - config_name: kt1 features: - name: timestamp dtype: int64 - name: solving_id dtype: int64 - name: question_id dtype: string - name: user_answer dtype: string - name: elapsed_time dtype: int64 - name: subject_id dtype: string - name: correct_answer dtype: string - name: is_correct dtype: bool splits: - name: train num_bytes: 5113297667 num_examples: 95292768 download_size: 1879054279 dataset_size: 5113297667 - config_name: kt2 features: - name: timestamp dtype: int64 - name: action_type dtype: string - name: item_id dtype: string - name: source dtype: string - name: user_answer dtype: string - name: platform dtype: string - name: subject_id dtype: string - name: correct_answer dtype: string - name: is_correct dtype: bool splits: - name: train num_bytes: 3761674319 num_examples: 56359194 download_size: 777077035 dataset_size: 3761674319 - config_name: kt3 features: - name: timestamp dtype: int64 - name: action_type dtype: string - name: item_id dtype: string - name: source dtype: string - name: user_answer dtype: string - name: platform dtype: string - name: subject_id dtype: string - name: correct_answer dtype: string - name: is_correct dtype: bool splits: - name: train num_bytes: 5872301613 num_examples: 89268522 download_size: 1170390355 dataset_size: 5872301613 - config_name: kt4 features: - name: timestamp dtype: int64 - name: action_type dtype: string - name: item_id dtype: string - name: cursor_time dtype: float64 - name: source dtype: string - name: user_answer dtype: string - name: platform dtype: string - name: subject_id dtype: string - name: correct_answer dtype: string - name: is_correct dtype: bool splits: - name: train num_bytes: 9937765689 num_examples: 131441538 download_size: 1796107698 dataset_size: 9937765689 - config_name: lectures features: - name: lecture_id dtype: string - name: part dtype: int64 - name: tags dtype: int64 - name: video_length dtype: int64 - name: deployed_at dtype: int64 splits: - name: train num_bytes: 40826 num_examples: 1021 download_size: 17293 dataset_size: 40826 - config_name: questions features: - name: question_id dtype: string - name: bundle_id dtype: string - name: explanation_id dtype: string - name: correct_answer dtype: string - name: part dtype: int64 - name: tags dtype: string - name: deployed_at dtype: int64 splits: - name: train num_bytes: 774858 num_examples: 13169 download_size: 311363 dataset_size: 774858 configs: - config_name: kt1 data_files: - split: train path: kt1/train-* - config_name: kt2 data_files: - split: train path: kt2/train-* - config_name: kt3 data_files: - split: train path: kt3/train-* - config_name: kt4 data_files: - split: train path: kt4/train-* - config_name: lectures data_files: - split: train path: lectures/train-* - config_name: questions data_files: - split: train path: questions/train-* ---

The dataset consists of multiple sections, each targeting different educational data scenarios. It includes: student answer records, video lecture information, and question information. Student answer records detail the timestamp, question ID, user answers, correct answers, etc.; video lecture information includes lecture ID, video length, etc.; question information contains question ID, correct answer, tags, etc. All data are provided in the form of training sets.

提供机构:
mgor
搜集汇总
数据集介绍
构建方式
在智慧教育蓬勃发展的时代背景下,知识追踪(Knowledge Tracing)任务旨在通过建模学习者的历史交互行为来动态评估其知识状态。mgor/EDNet数据集正是为此领域量身打造的大规模教育交互数据集,其构建过程精细而严谨。该数据集包含六个子配置:四个核心交互数据集(kt1至kt4)以及两个辅助数据集(lectures和questions)。kt1至kt4分别记录了不同粒度与来源的学习行为,如时间戳、作答内容、正确性等,且每个子集均以单一训练集形式呈现。辅助数据集则提供了教学视频与试题的元信息,如视频时长、试题标签等,从而支持多维度的知识追踪建模。数据总量超过3.7亿条交互记录,为深度学习模型提供了坚实的数据基础。
特点
该数据集最显著的特点在于其规模宏大与结构丰富。kt1至kt4四个交互子集各自拥有数千万至逾亿条样本,总样本量达3.72亿,覆盖了广泛的学习者行为模式。每个子集均包含时间戳、用户答案、正确答案及是否正确等核心字段,而kt2至kt4还额外引入了动作类型、平台来源等上下文信息,kt4更增添了光标时间这一精细行为指标。这种层次化的设计使得研究者既能进行基础的知识追踪实验,又能探索行为序列中的细粒度特征。此外,lectures与questions子集提供了教学资源与试题的本体信息,便于构建知识图谱或进行特征增强,极大提升了数据集的适用性与研究深度。
使用方法
使用mgor/EDNet数据集时,研究者可通过HuggingFace Datasets库便捷加载。首先需指定配置名称,例如'datasets.load_dataset("mgor/EDNet", "kt1")'以获取kt1子集,其余kt2至kt4及辅助子集同理。数据均以训练集形式提供,可直接用于模型训练。对于知识追踪任务,建议优先选用kt1或kt2子集进行基准实验,而kt4因其包含光标时间等精细特征,适合探索注意力机制或时序建模。lectures与questions子集可作为外部知识源,通过试题ID或讲座ID与交互数据进行关联,从而构建更丰富的输入表示。数据格式为标准的列式结构,便于与PyTorch、TensorFlow等框架无缝集成。
背景与挑战
背景概述
在智能教育系统蓬勃发展的今天,知识追踪(Knowledge Tracing)作为自适应学习技术的核心任务,致力于通过分析学习者的历史交互行为,动态建模其知识状态演变过程。由研究团队构建的mgor/EDNet数据集,是一个大规模、多来源的教育交互数据集,收录了来自多个学习平台的海量用户答题与学习行为记录。该数据集包含四个核心子集(kt1至kt4),覆盖了逾3.7亿条交互样本,并辅以课程与题目元数据,为知识追踪模型的训练与评估提供了前所未有的数据规模与多样性。EDNet的发布,不仅推动了深度学习在知识状态推断中的前沿探索,更成为连接教育数据挖掘与个性化学习系统的重要桥梁,对智能教育领域产生了深远影响。
当前挑战
EDNet数据集所面临的挑战首先体现在知识追踪任务本身的复杂性上:如何从稀疏且噪声丰富的交互序列中,准确推断学习者对数千个知识点的掌握程度,并预测其未来表现,仍是亟待突破的难题。此外,数据构建过程中亦存在显著挑战:不同平台、设备与交互类型(如视频观看、答题)带来的异构数据融合问题,以及时间戳、作答时长等特征中的缺失与异常值处理,均增加了数据清洗与标准化难度。同时,超大规模数据(单个子集样本量逾1.3亿)对存储、计算效率与模型泛化能力提出了严苛要求,如何在保持数据真实性的前提下实现高效处理,是EDNet持续赋能教育研究的关键所在。
常用场景
经典使用场景
EDNet数据集在智能教育领域扮演着基石角色,尤其适用于构建与评估知识追踪(Knowledge Tracing)模型。该数据集通过记录学习者与教育内容的交互行为,如答题时间、作答结果与题目属性,为深度学习模型提供了大规模、细粒度的时序学习轨迹。研究者常利用其四个子集(kt1至kt4)来训练深度知识追踪架构,以捕捉学生知识状态随时间演变的动态规律,进而实现个性化学习路径的精准建模。
实际应用
在实际教育场景中,EDNet支撑了自适应学习系统的核心功能模块。基于该数据集训练的模型可实时预测学习者的知识掌握水平,并据此动态调整习题推送策略,实现因材施教。此外,其包含的答题时间与平台信息可用于识别学习倦怠与作弊行为,辅助教师进行教学干预。多家在线教育平台已借鉴EDNet的数据结构,构建了自身的智能辅导与学情预警系统。
衍生相关工作
EDNet的发布催生了一系列经典工作。其中,基于Transformer架构的深度知识追踪模型(如SAKT、DKVMN)在该数据集上进行了系统性验证,揭示了注意力机制在捕获长期学习依赖中的优势。后续研究进一步引入了图神经网络与对比学习范式,利用EDNet的学科标签与题目关联信息构建知识图谱,显著提升了冷启动场景下的预测精度。这些工作共同构成了现代智能教育研究的理论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务