遇见数据集

TeachObs

收藏
arXiv2026-05-29 更新2026-06-02 收录
官方服务:

资源简介:

TeachObs是由多国研究机构联合构建的一个经过人工验证的多模态教学观察基准数据集,旨在支持课堂教学视频的细粒度分析与整体评估。该数据集包含来自八个国家、涵盖九个学科领域的30个公开K-12课堂视频,被分割为5,158个固定15秒的场景片段,并由七名研究人员基于包含39个观察代码(20个视觉代码和19个非视觉代码)的标注方案进行独立标注,最终通过基于Krippendorff's alpha的可靠性共识规则生成黄金标注层。数据集的创建过程首先从TIMSS 1999视频研究档案、马萨诸塞州教育部门校准视频资源及韩国公开课堂视频三个来源收集原始视频,经过自动化预处理后由人工完成多轮独立编码与校验,确保了标注的严谨性与一致性。该数据集主要应用于教育人工智能领域,特别是多模态大语言模型在教学行为识别、课堂质量评估等方面的性能评测,旨在解决现有课堂视频资源在细粒度教学行为标注与整体课程质量专家评价结合不足的问题,为AI辅助教学分析提供可靠的基准测试平台。

TeachObs is a manually validated multimodal teaching observation benchmark dataset jointly constructed by multinational research institutions, aiming to support fine-grained analysis and holistic evaluation of classroom teaching videos. This dataset contains 30 publicly available K-12 classroom videos from 8 countries spanning 9 academic disciplines, which are segmented into 5,158 fixed 15-second scene clips. Seven researchers performed independent annotation based on an annotation scheme consisting of 39 observation codes (20 visual codes and 19 non-visual codes), and the gold standard annotation layer was finally generated via reliability consensus rules based on Krippendorff's alpha. The dataset was initially constructed by collecting raw videos from three sources: the TIMSS 1999 Video Study Archive, the calibrated video resources from the Massachusetts Department of Education, and public classroom videos from South Korea. After automated preprocessing, manual multiple rounds of independent coding and verification were conducted to ensure the rigor and consistency of annotations. This dataset is primarily applied in the field of Educational AI, particularly for performance evaluation of multimodal large language models (LLMs) in tasks such as teaching behavior recognition and classroom quality assessment. It aims to address the gap that existing classroom video resources lack sufficient integration of fine-grained teaching behavior annotations and expert evaluations of overall course quality, providing a reliable benchmark testing platform for AI-assisted teaching analysis.

创建时间:
2026-05-29
原始信息汇总

TeachObs Benchmark 数据集详情

数据集结构

该数据集包含两个评估赛道,以独立文件夹形式发布:

  • Track A (data/track_a/):片段级39个编码预测
  • Track B (data/track_b/):基于LLM评判的课程级覆盖评估

数据文件布局

data/ lessons.csv # 30门课程 + YouTube链接 + 数据划分(train/test) track_a/ coding_scheme.json # 39个编码,含视觉/非视觉分组 gold/test/{ID}.jsonl # 7个测试课程,每片段39个二值编码 gold/train/{ID}.jsonl # 23个训练课程 splits/{test,train}_ids.txt # ID列表 track_b/ evaluation_categories.json # 10个课程级类别模式 rater_narratives/test/{ID}.jsonl # 评分者叙述(英文,保留narrative_ko) rater_narratives/train/{ID}.jsonl reference_gold/test/{ID}.jsonl # 原子声明参考(Track B金标准) reference_gold/train/{ID}.jsonl prompts/ # 冻结的分解器/评判提示 decomposer.md equivalence_judge.md coverage_judge.md splits/{test,train}_ids.txt

数据划分

  • 测试集:S2, S4, S5, S19, S24, S28, S30(7门课程,约占片段数的23%)
  • 训练集:其余23门课程
  • 两个赛道共享相同的划分
  • 测试集包含语料库中所有仅出现1次的教师和仅出现1次的学校等级

数据来源与处理

  • 原始视频未在此仓库中重新分发,需通过提供的下载脚本从原始YouTube URL获取
  • 推荐使用YouTube自有字幕,generate_subs.py通过yt-dlp获取
  • Whisper.cpp作为可选回退方案(仅当字幕缺失或不可用时)

预期用途

TeachObs是一个用于课堂视频理解的人工智能评估基准,不用于评估个体教师。

代码工具

scripts/目录包含以下主要脚本:

脚本 功能
download_videos.py CSV转mp4(通过yt-dlp)
generate_subs.py 获取YouTube字幕/Whisper转录翻译
extract_scenes.py 从mp4+片段金标准生成每片段资源
evaluate_track_a.py Track A F1评估
evaluate_track_b.py Track B覆盖率评估
build_reference.py 从评分者叙述构建Track B参考金标准
run_pipeline.sh 端到端流程:下载→字幕→场景
搜集汇总
数据集介绍
TeachObs 数据集图片
构建方式
在课堂视频分析领域,现有资源多聚焦于通用动作或对话文本,缺乏对教师教学行为视觉与非视觉信号的系统标注。为此,TeachObs基准数据集基于来自8个国家的30节公开K-12课堂视频构建,每段视频被分割为固定15秒的场景,共计5158个场景。七名研究者采用包含20个视觉代码与19个非视觉代码的39项二元观察编码方案,对每个场景进行独立标注。最终通过基于Krippendorff's alpha的信度与发生率感知聚合规则,生成场景级别的金标准标签,同时由三位专家对30节课提供课程级别的定性评价与评分。
特点
TeachObs的核心特点在于其双层次标注架构。在场景层面,数据集提供细粒度的多标签标注,涵盖手势、板书、指向等可视化教学信号以及指令、监控、提问等非视觉教学功能,真实反映了课堂中多种教学行为共存的复杂性。在课程层面,三位专家评阅者提供了涵盖教学设计、实施、学生回应等十个维度的定性叙事评价,将微观行为与宏观教学质量评估在同一语料上关联。此外,数据集保留了每位编码者的原始标注文件与信度统计,透明地呈现了编码过程的不确定性。
使用方法
该数据集支持三类评估任务:文本场景编码、文本与图像场景编码以及课程级覆盖评分。研究者可使用场景转录文本或附加场景中部帧作为视觉令牌,评估前沿多模态大语言模型对39个教学观察代码的识别能力(采用宏F1与微F1指标)。在课程级别,可要求模型生成八类评价维度的叙事,并通过LLM-as-judge协议与人工专家拆解的原于级主张进行覆盖度比对。数据集附带聚合规则、信度统计及评分脚本,便于复现与扩展分析。
背景与挑战
背景概述
课堂观察是教育研究与实践中的核心环节,旨在通过分析教师行为、师生互动及教学材料等信号,评估教学质量并促进专业发展。然而,现有的课堂视频数据集或局限于通用动作识别,或仅聚焦于对话文本,难以同时捕捉细粒度的视觉化教学行为(如手势、板书)与宏观的课堂整体评价。为弥合这一鸿沟,Yeil Jeong等研究者于2026年发布了TeachObs数据集,该工作由印第安纳大学伯明顿分校、韩国高丽大学等机构联合完成。TeachObs基于来自八个国家的30节公开K-12课程视频构建,包含5,158个15秒长的片段,由七名研究者依据包含39个二元观察编码(20个视觉编码与19个非视觉编码)的方案进行标注,并引入了基于信度与流行度的金标聚合策略。此外,三位专家评阅人还为每节课提供了十类别的定性叙事评价。该数据集的核心研究问题在于构建一个融合局部精准行为识别与整体课堂质量评判的多模态基准,以系统评估前沿大语言模型在课堂视频理解中的能力边界。其发布填补了教育人工智能领域缺乏双粒度、人工验证的课堂观察基准的空白,对推动AI辅助教学分析的研究具有里程碑意义。
当前挑战
TeachObs数据集所应对的领域挑战首先源于课堂观察本身的复杂性:一堂课的教学信号是多模态且交织的,如教师在同一瞬间可能同时进行板书、指点、提问与巡视,这要求模型能够处理高密度的多标签分类与跨模态融合问题。其次,现有数据集在颗粒度上普遍失配——要么缺失视觉通道的精细编码,要么缺少专家层级的整体评价,导致AI系统难以在“局部动作检测”与“整堂课质量评估”之间建立关联。在数据集构建过程中,研究团队面临两大核心挑战:一是标注方案的设计需平衡编码的覆盖度与可操作性,39个编码涉及视觉证据、教师非语言行为与教学话语功能等多维度,不同编码的流行度与观察难度差异悬殊(如“评估”类编码在金标中仅占1.0%的片段);二是金标标签的聚合需兼顾不同编码的信度与流行度特征,简单的多数投票会抹去低频率但教育意义重大的事件(如反思性教学行为),因此研究者设计了一套基于Krippendorff’s alpha与流行度的分条件聚合规则,分别针对低流行度、高流行度高信度、高流行度低信度动作类与非动作类编码采取不同的共识标准。这一精心架构的标注流程确保了数据集的生态效度,但也揭示了当前前沿多模态大语言模型在课堂视频理解中的薄弱环节——文本驱动的过度归因、视觉线索导致的误报激增,以及对流程化课程的系统性高估。
常用场景
经典使用场景
TeachObs最经典的使用场景在于评估多模态大语言模型对课堂教学视频的细粒度理解能力。通过将30节K-12课程视频分割为5158个15秒片段,并为每一片段标注39项二元教学观察编码(涵盖手势、板书、提问等视觉与非视觉要素),该数据集为模型提供了从局部行为识别到全局教学评价的多层次基准。研究者可在此框架下比较不同模型在纯文本、文本加单帧图像及整课叙事生成三条评测轨道上的表现,从而揭示模型在课堂视频分析中的优势与局限。
衍生相关工作
TeachObs催生了一系列围绕课堂视频智能分析的开创性工作。例如,研究者基于其多标签编码体系构建了教学动作检测框架,将板书书写、教师移动等视觉线索与提问、反馈等话语功能进行跨模态融合建模。在模型评估层面,该数据集启发了面向课堂场景的对抗性测试路线,通过注入视觉干扰或删除关键帧来检验模型的鲁棒性。此外,其原子化叙事分解方法已被迁移至其他教育视频数据集,形成了课堂质性评价的标准化评测协议,进一步拓展了人工智能在教育观察领域的应用边界。
数据集最近研究
最新研究方向
在课堂视频分析领域,TeachObs的出现锚定了教学观察与模型评估的交汇前沿。该基准聚焦于解析课堂中精细可观测的教学行为与整课定性判断之间的鸿沟,当前研究热点集中于多模态大型语言模型在课堂视频上的感知与推理能力分离现象。前沿探索尤为核心的是三轨并行评估框架:纯文本段编码、文本加单帧图像段编码以及整课级别叙事覆盖,揭示出前沿模型在视觉通道下对教学行为归因的膨胀效应、对教育话语代码的过度延伸,以及程序清晰型课程的高估偏差。这一进展推动学界重新校准AI在课堂视频分析中的助益边界,强调专家定性判断在评估深层教学设计与学习者卷入方面不可替代的洞察价值。
相关研究论文
  • 1
    TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation印第安纳大学布卢明顿分校; 培材大学; 首尔大学; 梨花女子大学; 伍尔弗汉普顿大学; 高丽大学世宗校区 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务