遇见数据集

VLE

收藏
arXiv2022-06-22 更新2024-06-21 收录
官方服务:

资源简介:

VLE数据集是一个包含约12,000个科学视频讲座的新型数据集,由伦敦大学学院人工智能中心创建。该数据集涵盖了计算机科学、人工智能和数据科学等领域的讲座,提供了丰富的文本和视频特定特征,以及与学习者参与度相关的隐式和显式信号。数据集的创建旨在解决大规模学习资源集合中的冷启动问题,特别是在电子学习和MOOC环境中。通过使用VLE数据集,研究人员能够构建和验证无上下文参与度预测模型,这些模型在性能上显著优于基于先前数据集的模型。此外,数据集还支持多种任务,如质量保证和教育推荐系统的改进,特别是在处理新用户或新内容时的冷启动问题。

The VLE dataset is a novel dataset consisting of approximately 12,000 scientific video lectures, created by the Artificial Intelligence Centre at University College London. This dataset covers lectures across computer science, artificial intelligence, and data science, and provides abundant text and video-specific features, as well as implicit and explicit signals related to learner engagement. The dataset was developed to address the cold start problem in large-scale learning resource collections, particularly in e-learning and MOOC environments. By using the VLE dataset, researchers can construct and validate context-free engagement prediction models, which significantly outperform models based on prior datasets. Furthermore, the dataset supports multiple tasks such as quality assurance and the improvement of educational recommendation systems, especially in resolving cold start issues when dealing with new users or new content.

创建时间:
2022-06-22
搜集汇总
数据集介绍
VLE 数据集图片
构建方式
VLE数据集源自广受欢迎的开源教育资源库VideoLectures.NET,汇集了约12,000个经过同行评审的科学视频讲座。构建过程首先对视频元数据与英文转录文本进行多模态特征提取,涵盖基于内容的文本特征(如词频、可读性、语言风格)、基于Wikipedia的专题特征(通过Wikifier实体链接提取权威性与覆盖性主题),以及视频专属特征(如时长、语速、沉默率)。随后,从超过110万用户的行为日志中聚合出显式(星级评分)与隐式(归一化观看时长)的参与度标签,并采用k-匿名化、高斯噪声注入等隐私保护技术处理数据,最终形成包含11,548个视频样本的综合性数据集。
特点
该数据集最显著的特点在于其规模与多样性,是目前公开可用的最大教育视频参与度预测资源。它涵盖了从研究演讲、教程到小组讨论等14种讲座类型,主题以计算机科学、人工智能和数据科学为主导,同时包含跨模态的易计算特征,使模型无需依赖复杂深度学习即可高效训练。独特的Wikipedia主题特征提供了可解释的知识结构,而多维度参与度标签(如饱和归一化参与时间、标准差)允许研究者比较隐式与显式信号。此外,数据集对冷启动问题的针对性设计——通过群体级参与度预测补充个性化推荐——使其在教育推荐系统领域具有不可替代的价值。
使用方法
研究者可将VLE数据集用于两项核心监督学习任务:回归任务预测视频的群体级参与度,排序任务根据参与度对视频进行全局排名。推荐使用随机森林作为基线模型,并以均方根误差和斯皮尔曼秩相关系数作为评估指标,数据集已预划分5折交叉验证以确保可复现性。此外,该数据集支持特征重要性分析、隐式与显式标签对比,以及通过Wikipedia主题进行知识结构推断等探索性研究。结合个性化算法(如TrueLearn)时,群体级模型可有效缓解用户与物品冷启动问题,首次事件预测的准确率与精确度可获显著提升。
背景与挑战
背景概述
在开放式教育资源与大规模开放在线课程迅猛发展的背景下,如何在海量教育视频中预测学习者的参与度并缓解冷启动问题,已成为教育推荐系统领域的关键挑战。为应对这一需求,由伦敦大学学院人工智能中心的Sahan Bulathwela、Meghana Verma、María Pérez-Ortiz、Emine Yilmaz与John Shawe-Taylor等研究人员于2022年共同创建了VLE(Video Lecture Engagement)数据集。该数据集基于知名开放教育资源库VideoLectures.NET,收录了约12,000个经同行评审的科学视频讲座,涵盖计算机科学、人工智能及数据科学等核心领域,并提取了基于文本、维基百科主题及视频本身的丰富特征。VLE数据集是当前公开可用的最大且最多样化的学习者参与度预测数据集,其核心研究问题在于利用基于群体的参与度预测模型,实现无上下文依赖的参与度估计,从而为教育推荐系统提供稳健的冷启动解决方案。该数据集的发布显著推动了人工智能赋能教育领域的研究,尤其为大规模个性化学习资源的推荐与质量保障奠定了重要基础。
当前挑战
VLE数据集所面临的挑战主要体现在两个层面。在领域问题层面,其核心挑战在于解决教育推荐系统中普遍存在的冷启动问题,即当新用户加入或新教学内容上线时,系统因缺乏历史交互数据而难以准确预测学习者参与度。传统个性化模型在冷启动阶段表现乏力,而基于群体的无上下文参与度预测虽能提供先验基线,却难以完全捕捉个体学习者的动态偏好与情境差异。在数据集构建层面,挑战包括:一、特征提取的跨模态整合难度,需从视频转录、元数据及维基百科实体链接中协调文本、主题与视听信息;二、用户隐私保护与数据匿名化,需在公开发布聚合标签的同时避免个人身份泄露;三、标签多样性与噪声控制,显式评分与隐式观看时间等信号需统一量化,且来自110万用户的行为数据存在分布偏差;四、领域与语言局限性,数据集以英语计算机科学内容为主,限制了其跨学科与非英语场景的泛化能力。
常用场景
经典使用场景
在开放教育资源与大规模在线课程蓬勃发展的时代背景下,VLE数据集为研究者提供了一个独特而丰饶的土壤,用以探索视频讲座的群体性参与度预测。该数据集最经典的使用场景在于构建去情境化的参与度预测模型,即基于视频讲座的内容特征、维基百科主题特征及视频特有特征,对学习者的平均参与水平进行回归或排序。研究者可以利用其中超过11,500个经同行评议的科学视频讲座,涵盖从研究演讲到MOOC式教程的多种类型,结合来自逾百万用户的隐式与显式反馈标签,训练出能够泛化至新视频的预测器。这一场景尤其适用于那些缺乏用户历史交互数据的冷启动环境,为教育推荐系统提供稳健的基线先验。
衍生相关工作
VLE数据集的发布催生了一系列富有影响力的衍生工作。最直接的继承者是TrueLearn++算法,它巧妙地将基于VLE训练的去情境化参与度模型与个性化贝叶斯推荐器TrueLearn相结合,通过切换策略显著改善了用户首次交互时的预测准确率与精确度。此外,研究者基于该数据集进一步探索了维基百科语义图在特征工程中的应用,利用实体链接与主题权威性得分构建更具解释力的预测因子。在更广阔的学术版图中,VLE数据集还启发了关于知识结构推断的研究,即通过分析视频中维基百科话题的共现模式,揭示学科间的内在关联。同时,该数据集成为对比不同隐式与显式参与度标签效用的基准平台,推动了教育数据挖掘领域对多模态参与度量化的深入讨论。
数据集最近研究
最新研究方向
在开放教育资源与大规模在线课程迅猛发展的背景下,VLE数据集聚焦于解决教育推荐系统中普遍存在的冷启动问题,通过构建基于群体参与的上下文无关型学习投入预测模型,为个性化推荐提供稳健的先验知识。该数据集汇集了来自VideoLectures.NET的约12,000个同行评审科学视频讲座,整合了基于内容、维基百科主题及视频特定特征的多模态特征,并首次提供了超过110万用户生成的显式与隐式投入标签。前沿研究正利用VLE数据集探索如何将群体层面的投入预测与个性化算法深度融合,例如通过混合推荐系统显著提升冷启动场景下的预测准确率与精度,同时验证了其在人工智能与计算机科学教育、慕课场景中的卓越泛化能力。这一资源不仅推动了可扩展的教育内容质量保障研究,还为理解知识结构、设计更公平的学习体验开辟了新路径。
相关研究论文
  • 1
    Can Population-based Engagement Improve Personalisation? A Novel Dataset and Experiments伦敦大学学院人工智能中心 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务