NUS MOOC Transacts Corpus
收藏资源简介:
这是一个大规模开放在线课程讨论论坛线程的注释语料库,注释基于教学法为基础的论述框架,简化了Berkowitz和Gibbs提出的教学/心理学编码方案,用于MOOC讨论论坛中的教师帖子和回复。
This is a large-scale annotated corpus of discussion forum threads from massive open online courses (MOOCs). The annotations are based on a pedagogy-oriented discourse framework, which simplifies the teaching/psychological coding scheme proposed by Berkowitz and Gibbs, and is applied to instructor posts and replies in MOOC discussion forums.
数据集概述
数据集名称
NUS MOOC Transacts Corpus
数据集描述
这是一个注释的讨论论坛线程语料库,源自大规模开放在线课程(MOOCs)。注释基于教学话语框架,该框架改编自Berkowitz和Gibbs(1983)提出的“transactivity”概念。此数据集简化了他们的教学/心理学编码方案,用于MOOC讨论论坛中的教师帖子和回复。
数据集任务
- 标记任务:将教师帖子与之前的学员帖子链接,这些学员帖子是教师帖子的回复或评论。
- 分类任务:将识别的帖子对分类为预定义的讨论类型之一。此任务进一步分为两个子任务:
- 子任务1:将帖子对分类为顶级类别。
- 子任务2:在选定的顶级类别下,进一步分类为子类别。
注释类别
数据集定义了多个注释类别,包括顶级和低级类别,以及是否为“transactive”。
文件格式
数据以加密的ZIP文件形式提供,每个文件代表一个课程的论坛,并按任务类型组织在不同的目录中。
文件结构
--|__ Task1-Marking_Task |__ Task2-Categorisation_Task_low_lvl |__ Task2-Categorisation_Task_top_lvl
文件内容
- Task1-Marking_Task:包含帖子是否被标记的信息。
- Task2-Categorisation_Task_top_lvl:包含顶级讨论类别的信息。
- Task2-Categorisation_Task_low_lvl:包含低级讨论类别的信息。
注释者
所有注释者均为Amazon MTurk平台的众包工作者,每个线程由7名工作者注释。
引用信息
若使用此数据集,请引用以下博士论文: @phdthesis{Chandrasekaranthesis2019, author = {MUTHU KUMAR CHANDRASEKARAN}, school = {National University of Singapore}, title = {A DISCOURSE CENTRIC FRAMEWORK FOR FACILITATING INSTRUCTOR INTERVENTION IN MOOC DISCUSSION FORUMS}, year = {2019}, }




