遇见数据集

KnowVis Dataset

收藏
arXiv2026-09-03 更新2026-09-05 收录
数据链接:
官方服务:

资源简介:

KnowVis数据集是一个为视频讲座视觉摘要研究精心构建的多模态资源,由香港城市大学与苏黎世联邦理工学院联合创建。该数据集包含125个横跨10个学术学科(如物理、数学、生物学等)的教育视频,并配对1,079个由KnowVis框架生成的视觉摘要,每个摘要均附有原始转录文本、幻灯片帧及概念图。数据集通过从OER Commons和YouTube等开放平台采集视频,并经由KnowVis框架自动提取概念图、识别关键与挑战性概念后生成结构化知识单元,进而合成具有教学意义的视觉叙事。该数据集旨在解决线性视频呈现与人类非线性认知学习之间的根本性不匹配问题,为降低初学者认知负荷、提升学习效果与知识保留率提供高质量基准,可广泛应用于教育视频理解、视觉摘要生成及认知负荷理论研究。

The KnowVis Dataset is a meticulously constructed multimodal resource tailored for research on visual summarization of video lectures, jointly created by City University of Hong Kong and ETH Zurich. This dataset includes 125 educational videos spanning 10 academic disciplines (e.g., physics, mathematics, biology, etc.), paired with 1,079 visual summaries generated by the KnowVis framework. Each summary is accompanied by original transcripts, slide frames, and concept maps. The dataset is compiled by collecting videos from open platforms such as OER Commons and YouTube, then leveraging the KnowVis framework to automatically extract concept maps, identify key and challenging concepts to generate structured knowledge units, and finally synthesize pedagogically meaningful visual narratives. This dataset aims to address the fundamental mismatch between linear video presentation and humans' nonlinear cognitive learning. It serves as a high-quality benchmark for reducing cognitive load for novice learners, enhancing learning outcomes and knowledge retention, and can be widely applied to educational video understanding, visual summarization generation, and cognitive load theory research.

创建时间:
2026-09-03
原始信息汇总

数据集概述

KnowVis数据集是一个面向视频讲座的知识中心化视觉摘要数据集,旨在将视频讲座转化为具有教学基础的视觉叙事框架。该数据集通过Hugging Face平台公开发布和下载。

数据规模与来源

  • 视频讲座数量:共收集了 125个视频讲座,来源包括OER Commons和YouTube。
  • 学科覆盖:涵盖 10个不同的学术学科领域

数据内容与生成

  • 基于多模态输入,利用KnowVis框架生成了 1,079个具备教学结构的视觉摘要
  • 每个视觉摘要均配有对应的 源讲座转录文本幻灯片帧概念子图

数据获取

补充说明

  • 该项目的完整代码库及详细使用说明将在后续更新发布,目前数据集已可供使用。
搜集汇总
数据集介绍
KnowVis Dataset 数据集图片
构建方式
该数据集的构建源于对视频讲座学习困境的深刻洞察,旨在弥合线性视频呈现与非线性认知加工之间的鸿沟。研究者从OER Commons及YouTube等开放平台,依据OpenStax课程体系精心甄选125段涵盖10个学科领域的教育视频。在此基础上,运用KnowVis框架进行系统化处理:首先借助多模态大语言模型从视频的转录文本与幻灯片帧中抽取细粒度概念图谱,并依据阈值概念理论辨识重要且具挑战性的关键概念;其次,通过标签传播机制聚合关联概念,构建结构化知识单元,并检索与之语义对齐的文本片段与视觉帧;最终,将知识单元转化为叙事性故事板,经由文本至图像生成模型合成可视化摘要,辅以自动校验环节确保教育内容的高保真度,从而生成1,079幅配以源转录、幻灯片及概念图的教学视觉总结。
特点
该数据集的核心特色在于其教学导向的多模态架构与跨学科覆盖广度。它创新性地融合了认知负荷理论与多媒体学习理论,以概念图谱的非线性结构映射知识内在关联,突破了传统文本摘要的线性局限。数据集中的每份视觉总结均基于阈值概念精心锚定,不仅优先呈现结构举足轻重且认知负荷较高的核心知识点,而且经由叙事化故事板的桥接,将抽象关系转化为直观的视觉隐喻与空间布局,确保信息密度与认知负荷的最优平衡。此外,数据集的开放许可协议及涵盖STEM与人文学科的广泛领域,为其在多样化的教育技术研究中提供了高度可泛化与可复现的基准资源。
使用方法
研究人员可借助该数据集训练与评估从视频讲座生成教学视觉摘要的模型。具体而言,数据集中每一视觉总结均与源视频的转录文本、幻灯片帧及概念图谱相对应,支持多模态学习任务的开发,诸如概念抽取、知识单元合成或视觉叙事生成。自动化评估者可利用配套的GPT-5.4评分体系,从准确性、清晰度、信息密度与心智负荷四个维度衡量生成结果的教学质量。该数据集亦适用于人机交互研究,通过对比学习者使用不同视觉摘要的学习成效保留度与知识迁移能力,探索降低认知负荷的有效界面设计。
背景与挑战
背景概述
KnowVis数据集由香港城市大学与苏黎世联邦理工学院的研究人员于2026年构建,旨在应对视频讲座学习中线性信息呈现与非线性认知加工之间的根本性错配。该数据集包含10个学科领域的125个教育视频,并配以1,079个基于教学法设计的视觉摘要,这些摘要由KnowVis框架自动生成,该框架通过提取概念图、识别关键与挑战性概念、构建知识单元并最终合成叙事性视觉摘要,显著降低了初学者的认知负荷。其影响力体现在为多媒体学习与生成式AI的交叉领域提供了首个大规模、跨学科的基准资源,为教育视频的智能摘要与可视化开辟了新范式。
当前挑战
数据集构建面临多重挑战。领域层面,传统视频摘要方法往往产出线性、文本密集的概要,未能解决学习者因缺乏先验知识而面临的高内在与外在认知负荷问题,且难以在开放域教育讲座中泛化。构建过程中,需处理多模态内容中概念提取的实体重复、大语言模型的幻觉现象,以及视觉生成模型可能产生的排版错误与空间伪影。此外,跨学科差异显著,非STEM领域的抽象概念难以映射为直观视觉隐喻,而模型对专有系统的依赖也带来了可复现性与适应性方面的挑战。
常用场景
经典使用场景
KnowVis数据集作为首个面向教育视频的视觉摘要多模态资源,其经典使用场景在于驱动知识中心的可视化叙事生成研究。该数据集涵盖125段跨10个学科的教育讲座视频,并配套1,079幅由KnowVis框架生成的视觉摘要,每一摘要均锚定于源视频的概念图谱、字幕文本与幻灯片帧。研究者可借此开展从线性视频内容到非线性知识结构的转化实验,评估不同生成策略在精确性、清晰度与认知负荷上的表现,进而推动可视化教学材料自动合成领域的方法论创新。
衍生相关工作
KnowVis数据集衍生了丰富的后续研究工作,一方面催生了基于多模态大语言模型的讲座概念图谱自动构建与实体消歧技术,推动了教育内容的结构化表示研究;另一方面,其关涉的叙事可视化与故事板生成策略,激发了针对多领域开放域视觉摘要生成及领域自适应提示方法的新探索。基于该数据集的自动化评估与人类判分实验框架,亦被复用至其他教育视觉生成任务,如数学问题图解、医学卡片生成等,形成了以知识锚点与认知优化为中心的生成式教育AI研究脉络。
数据集最近研究
最新研究方向
当前教育视频领域的前沿研究正聚焦于如何借助多模态大语言模型与生成式视觉技术,将线性、高密度的视频讲座转化为符合人类认知结构的知识图谱与可视化叙事。针对视频媒介的瞬时信息传递与学习者非线性认知建构间的根本矛盾,研究者致力于通过自动提取概念图、识别关键及疑难阈值概念,并构造结构化知识单元,从而生成兼具准确性、清晰度与低认知负荷的视觉摘要。该方向不仅涉及多模态内容理解与实体消歧等基础问题,还深入探索叙事可视化在开放域教育场景中的泛化能力,以缓解初学者的认知过载,促进知识保持与迁移。相关成果对推动个性化与自导式学习的落地,构建更友好的教育技术生态具有重要的现实意义与示范价值。
相关研究论文
  • 1
    KnowVis: Knowledge-Centric Visual Summarization for Video Lectures香港城市大学; 苏黎世联邦理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务