遇见数据集

VideoChat3-Academic2M, VideoChat3-LV116K, VideoChat3-OL617K

收藏
arXiv2026-07-16 更新2026-07-18 收录
官方服务:

资源简介:

VideoChat3数据集是由南京大学、上海人工智能实验室等机构联合构建的高质量多模态指令数据集,旨在推动通用视频理解模型的发展。该数据集包含VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K三个子集,总计300万条样本,覆盖通用视频、长视频和流式视频场景,数据来源于合成与筛选相结合的大规模多模态管道。其创建过程通过可扩展的数据合成流程实现,确保了多样性和高质量标注。该数据集主要应用于视频多模态大语言模型的训练,旨在解决模型在跨视频类型泛化、计算效率及可复现性方面的挑战,为现实世界视频理解系统提供开源基础。

The VideoChat3 dataset is a high-quality multimodal instruction dataset jointly constructed by Nanjing University, Shanghai AI Laboratory and other institutions, aiming to advance the development of general-purpose video understanding models. It comprises three subsets: VideoChat3-Academic2M, VideoChat3-LV116K and VideoChat3-OL617K, with a total of 3 million samples covering general video, long-form video and streaming video scenarios. The dataset is derived from a large-scale multimodal pipeline that integrates data synthesis and filtering. Its construction is implemented via a scalable data synthesis workflow, ensuring data diversity and high-quality annotations. This dataset is primarily applied to the training of video multimodal large language models (LLMs), with the purpose of addressing the challenges of cross-video-type generalization, computational efficiency and reproducibility, and providing an open-source foundation for real-world video understanding systems.

创建时间:
2026-07-16
搜集汇总
数据集介绍
VideoChat3-Academic2M, VideoChat3-LV116K, VideoChat3-OL617K 数据集图片
构建方式
VideoChat3系列数据集通过一套可扩展的多模态数据合成与精选流程构建,涵盖离线和在线流式视频理解任务。VideoChat3-Academic2M聚合了来自LLaVA-Video、Spoken-MIT、Vript等六个学术来源的公开数据集,并利用Qwen3-VL-235B-A22B模型对原始稀疏标注进行证据增强改写,同时通过一致性验证过滤错误,将简短的选项或短语答案转化为包含显性视觉证据和推理过程的丰富指令。VideoChat3-LV116K针对长视频场景,收集外部长视频源,经过边界感知的时间分割、片段级详细描述生成与质量审查,再通过前沿大模型合成时间定位、时间线描述和跨段问答等任务标注。VideoChat3-OL617K则将高质量视频问答对转化为流式在线样本,通过视觉线索定位与验证,确定关键证据的时间区间,并构建包含沉默、待命和响应状态令牌的因果训练序列。
使用方法
该数据集的使用遵循四阶段课程学习策略。阶段0进行视觉分词器预训练,使用图像-文本和视频-文本对训练I3D-ViT,先冻结投影器预热再全参数微调。阶段1完成视觉-语言对齐,将预训练的视觉分词器与目标语言模型集成,先在冻结状态下调整投影器,再联合微调整个视觉语言通路。阶段2进行通用视频指令微调,解冻所有参数,在平衡的图像与视频问答/描述数据集上训练模型掌握问题条件性证据选择与开放域应答。阶段3专门用于长视频与流式视频指令微调,采用较小学习率和扩展上下文窗口,在长视频和流式样本的混合课程上训练,使模型学会在处理渐进式视觉输入时维持时间记忆并及时产生主动响应。
背景与挑战
背景概述
VideoChat3系列数据集(含VideoChat3-Academic2M、VideoChat3-LV116K与VideoChat3-OL617K)诞生于2025至2026年间,由南京大学、上海人工智能实验室、南洋理工大学及北京大学的研究团队联合构建。该数据集旨在解决现有视频多模态大语言模型在泛化能力、计算效率与完全开源方面的三重困境。VideoChat3-Academic2M汇聚了来自LLaVA-Video、Spoken-MIT等六个学术来源的227万条高质量标注,并通过增强推理与证据锚定机制填补了原标注稀疏的缺陷;VideoChat3-LV116K则针对长视频场景,借助场景分割、片段级标注与装配式合成流水线,自主构建了11.6万条包含时间定位与跨段推理的实例;VideoChat3-OL617K进一步拓展至在线流媒体场景,将离线问答转化为携带静默、待命与应答状态令牌的流式监督序列。这三个子集共同构成了覆盖通用、长视频与实时交互的全面训练体系,为高效通用型视频理解模型的训练奠定了坚实的数据基础。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,现有模型通常难以在不同视频类型(如短视频、长视频与流媒体)间泛化,且缺乏对细粒度时间动态与因果演化的感知能力;同时,视频理解固有的高计算需求导致长视频与实时推理成本高昂。在构建过程中,首要挑战在于学术数据标注稀疏与监督信号不匹配——大多数学术源仅提供类别标签或短短语,难以支撑密集的视觉证据引导;其次,长视频场景中关键信息稀疏分布于数十分钟乃至数小时的上下文中,事件间的延迟依赖与跨段聚合极难捕获;此外,流媒体监督需同时应答时机与视觉预算的动态分配,传统离线数据无法直接转化。为解决这些问题,研究团队开发了证据增强重写与一致性验证机制,设计了边界感知的时间分割与片段级标注流水线,并创新性地引入状态转移掩码与自适应帧分辨率策略,从而确保证据稠密、时序精准且推理可回溯。
常用场景
经典使用场景
在视频多模态大语言模型的研究领域,VideoChat3系列数据集为构建高效率、强泛化能力的视频理解模型提供了关键的训练资源。该数据集体系涵盖三大子集:VideoChat3-Academic2M汇聚约227万条经过证据增强标注的学术视频指令样本,覆盖视频字幕、问答及细粒度运动感知任务;VideoChat3-LV116K包含约11.6万条长视频结构化标注,针对跨时段证据聚合与事件级推理场景设计;VideoChat3-OL617K则提供约61.7万条在线流式问答样本,赋予模型实时感知与主动响应能力。三者协同工作,使模型能在4B参数量下同时驾驭短视频精细运动理解、长视频时序定位与流式视频交互等多种经典场景。
解决学术问题
该数据集集针对视频多模态大语言模型领域三个核心学术难题提供了有效的解决方案。首先,现有模型往往在特定视频类型上表现良好但缺乏跨域泛化能力,VideoChat3-Academic2M通过重构多个学术数据集为紧密耦合视觉证据的自然语言回答,弥合了原始标注稀疏性与模型训练需求之间的监督鸿沟。其次,长视频理解中证据稀疏、事件依赖跨度大的挑战被VideoChat3-LV116K的系统化合成管道所突破,该管道通过边界感知时序分割、片段级质量验证与全视频标注装配,实现了对稀疏证据的长程聚合与精确时序定位。最后,VideoChat3-OL617K解决了流式场景中模型需主动判断响应时机的问题,通过视觉线索定位与状态转移掩码训练策略,使模型学会在持续监控中识别关键证据并适时应答。
实际应用
在实际应用层面,VideoChat3数据集训练出的模型展现出广泛的部署潜力。在智能视频监控场景中,模型能够实时分析流式视频流,对异常事件保持静默监控并在安全威胁出现时主动预警,显著降低人工值守压力。在自动驾驶领域,模型可处理长时段行车记录,准确描述道路场景变化、交通标志及行人行为,支持环境感知与决策辅助。在智能教育与内容创作领域,模型可对教学视频、体育赛事进行自动摘要与时序标注,生成结构化的旁白或关键事件时间线。在直播互动场景中,模型能够实时捕捉主播动作或屏幕内容变化,在用户提问时提供基于当前画面证据的准确回答,提升人机交互的自然性与即时性。
数据集最近研究
最新研究方向
当前VideoChat3系列数据集的研究前沿聚焦于构建完全开源、高效且具备通用能力的视频多模态大语言模型。在时序感知方面,研究突破了传统稀疏帧采样的局限,通过膨胀3D视觉Transformer架构实现时空联合建模与早期冗余压缩,显著提升了对细粒度运动、长程依赖和流式交互的建模效率。数据集体系覆盖通用短视频、长视频及在线流式三大场景,其核心创新在于利用数据合成管线对学术标注进行证据增强与一致性校验,将稀疏标签转化为包含显式视觉推理链条的稠密监督信号,从而弥合了静态图像先验与动态视频理解之间的语义鸿沟。这一研究范式推动了视频MLLM从领域特化向通用泛化的跃迁,为可复现的开放研究提供了坚实的数据底座与基准支撑。
相关研究论文
  • 1
    VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding南京大学; 上海人工智能实验室; 南洋理工大学; 北京大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务