遇见数据集

OmniVideo-100K

收藏
github2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

OmniVideo-100K 是一个用于通过结构化脚本和证据链进行音频-视觉推理的大规模指令调优数据集,旨在解决当前视频-字幕-问答流程中的模态偏差、时间错位和叙事不连贯等问题。数据集基于全面的认知框架设计,涵盖10个任务,包括对齐(如细粒度感知、场景转换检测)、理解(如上下文理解、比较、情感分析)和推理(如因果推理、未来预测、假设推理)三个层次。

OmniVideo-100K is a large-scale instruction-tuning dataset for audio-visual reasoning via structured scripts and evidence chains, aiming to address issues including modal bias, temporal misalignment and narrative incoherence in current video-caption-question answering pipelines. Designed based on a comprehensive cognitive framework, the dataset covers 10 tasks spanning three levels: alignment (e.g., fine-grained perception, scene transition detection), understanding (e.g., contextual understanding, comparison, sentiment analysis), and reasoning (e.g., causal reasoning, future prediction, hypothetical reasoning).

创建时间:
2026-06-09
原始信息汇总

数据集概述:OmniVideo-100K

OmniVideo-100K 是一个用于音视频推理的大规模指令微调数据集,旨在通过结构化脚本和证据链解决传统“视频-字幕-问答”流程中的模态偏差、时间对齐和叙事不连贯问题。

核心框架

该数据集基于一个自动化的数据合成引擎,包含两个核心机制:

  1. 实体锚定视频脚本化:将原始视频转换为结构化的脚本文本,包含摘要、主要实体列表以及带有时间戳的逐段音视频描述,确保跨段引用的一致性和声源关联的准确性。
  2. 线索引导的问答生成:引导多模态大语言模型从脚本中挖掘跨段和跨模态线索,进而生成具有长时跨度与深度跨模态依赖的复杂问答对。

数据集构成

  • OmniVideo-100K:大规模指令微调数据集。
  • OmniVideo-Test:人工验证的测试集。
  • 认知框架:数据集基于一个三层认知框架设计,涵盖10项任务:
    • 对齐:细粒度感知、场景变换检测。
    • 理解:上下文理解、对比、情感分析、事件序列排序、摘要。
    • 推理:因果推理、未来预测、假设推理。

文件与目录结构

数据集和合成脚本所需的标准目录结构如下: text <root_path>/ ├── videos/ │ └── ori/ # 原始视频 (.mp4) ├── pre_files/ │ └── final_videos_list.jsonl # 过滤后的视频列表(含时长和路径) ├── script_files/ # 中间生成的脚本 ├── script.jsonl # 最终整合的结构化脚本 └── qa_files/ # 生成的开放式问答 & 多项选择问答对

数据集来源与合成

数据集提供了一套完整的自动化数据合成流程,用户可运行该流程为自己的视频合成结构化脚本和问答对。

  • 脚本生成步骤:包括音视频分离与下采样、提取多模态信息、添加说话人标签和全局摘要、整合片段生成视觉描述、最终格式检查。
  • 问答生成步骤:可分别生成开放式问答和多项选择问答。

模型微调

数据集支持在多个模型上进行全参数微调,官方实验在以下模型上进行:

  • VITA-1.5 (8B)
  • Qwen2.5-Omni-7B
  • Qwen3-Omni-30B

微调使用了 LLaMA-Factory 框架和 DeepSpeed Zero-3。

评估结果

OmniVideo-Test 测试集上,微调后的模型在对齐、理解、推理三大类任务上均取得了显著提升。关键结果如下:

模型 参数量 总体准确率 对齐 理解 推理
Ours (Qwen3-Omni) 30B 63.56% 60.34% 67.05% 59.54%
Ours (VITA-1.5) 8B 61.58% 59.48% 63.18% 60.31%
Ours (Qwen2.5-Omni) 7B 60.59% 62.93% 62.40% 54.96%

许可与引用

  • 许可协议:Apache 2.0。
  • 论文引用:请参考官方仓库提供的 BibTeX 格式。
搜集汇总
数据集介绍
OmniVideo-100K 数据集图片
构建方式
OmniVideo-100K数据集依托一套创新的自动化数据合成引擎构建而成。该引擎首先通过实体锚定视频脚本机制,将原始视频转化为包含摘要、主体实体列表以及带时间戳的片段级视听描述的脚本式结构化文本,确保跨片段指代一致性与声源关联准确性。随后,基于线索引导的问答生成机制,驱动多模态大语言模型从脚本中挖掘跨片段、跨模态线索,进而生成兼具长时跨度和深层跨模态依赖的复杂问答对。整个流程涵盖脚本生成与问答合成两阶段,涉及音视频分离、多模态信息提取、说话人标注、全局摘要整合、片段视觉描述生成、格式化校验以及开放式和多选问答对的生成与解析。
特点
该数据集基于一个涵盖对齐、理解与推理三个层次的全面认知框架设计,囊括细粒度感知、场景变换检测、语境理解、比较、情感分析、事件序列排序、摘要、因果推理、未来预测及假设性推理等十项任务,层次分明、结构完整。其突出特点在于通过结构化脚本与证据链机制,有效克服了传统视频-字幕-问答流程中存在的模态偏差、时间错位与叙述不连贯等顽疾,实现了跨片段、跨模态的深层语义关联。此外,数据集还配套提供了人工验证的测试集OmniVideo-Test,为视听推理任务的评估提供了可靠基准。
使用方法
使用OmniVideo-100K数据集时,首先需按照指定目录结构准备原始视频及过滤后的视频列表。用户可依托自动化数据处理引擎,运行脚本生成与问答合成两阶段流程。脚本生成阶段包括音视频分离与降采样、多模态信息提取(需配置API密钥)、说话人标签添加、全局摘要生成、片段整合与视觉描述、最终格式化校验等步骤,最终输出结构化脚本文件。问答生成阶段则可选择性地为特定任务生成开放式或多选问答对。对于模型微调,建议采用全参数微调策略,并基于LLaMA-Factory框架配置超参数,同时利用DeepSpeed Zero-3等技术进行高效训练,最后通过提供的评估脚本在OmniVideo-Test测试集上进行性能验证。
背景与挑战
背景概述
多模态视频理解领域长期受困于数据集中存在的模态偏置、时间错位及叙事不连贯等问题,严重制约了模型对跨模态、长时序复杂事件的推理能力。2026年,由南京大学研究者蔡欣悦、付朝友、张一帆、赫然、山财峰等人联合提出的OmniVideo-100K数据集应运而生,其核心研究问题在于如何通过结构化脚本与证据链机制,系统性地构建高质量的音视频推理指令数据。该数据集依托一个自动化数据合成引擎,创新性地采用实体锚定视频脚本化与线索引导的问答生成两大核心策略,覆盖细粒度感知、场景转换检测、因果推理等10项认知层级任务。OmniVideo-100K的问世,为多模态大模型在复杂音视频推理领域的训练与评测提供了关键基准,显著推动了相关研究边界。
当前挑战
OmniVideo-100K所致力于解决的领域挑战在于,现有视频-文本数据生成范式普遍存在模态间关联微弱、长时序依赖建模困难以及问答对叙事逻辑断裂等缺陷,模型难以实现精准的跨模态对齐与深层次因果推理。在数据集构建过程中,面临的挑战尤为艰巨:首先,需要从原始视频中高效提取并整合音视频多模态信息,包括非语音音频事件、对话转录及视觉片段描述,这一过程要求精确的时间戳对齐与实体关联。其次,为生成高质量的复杂问答对,必须依赖多模态大模型从结构化脚本中挖掘跨片段、跨模态的线索,同时确保推理链条的完整性与多样性。此外,在自动化合成流程中,还需克服视频压缩、API调用负载及大规模数据一致性校验等技术难题,方能构建出十万量级的高质量指令数据集。
常用场景
经典使用场景
在视听推理领域,传统视频问答数据集常受限于模态偏差与时间错位,难以支撑复杂的跨模态认知任务。OmniVideo-100K凭借实体锚定视频脚本与线索引导的问答生成机制,成为多模态大语言模型(MLLM)在细粒度感知、场景变换检测、因果推理及未来预测等十项核心任务上的理想训练与评测基准。其结构化脚本保留了跨片段与跨模态的语义线索,使得模型能够从长时程视频中学习深度依赖关系,并显著提升对齐、理解与推理三大认知层级的表现。该数据集尤其适用于探究音频与视频信息深度融合的学术场景,为构建真正具备时空连贯性的听觉-视觉智能系统奠定了基础。
实际应用
在实际应用层面,OmniVideo-100K赋能了一系列需要实时音频-视频联合解析的智能系统,如自动驾驶环境感知、智能监控异常检测与多媒体内容审核。由于其覆盖了从短时到长时程(0至5分钟)的多样化视频片段,该数据集可直接用于训练能够理解会议录像、教学视频与影视片段的通用AI助手。此外,其结构化脚本生成技术为视频摘要制作、辅助视障人士场景理解等无障碍应用提供了便捷的数据支撑。通过与Qwen2.5-Omni等先进模型结合,微调后的系统在精准定位事件时序与跨模态对齐方面展现了巨大潜力,极大地提升了人机交互的自然度与智能水平。
衍生相关工作
OmniVideo-100K的开源生态催生了一系列具有启发意义的衍生工作。其自动化数据合成引擎被后续研究广泛借鉴,推动了视频脚本生成与多步推理链构建技术的发展。研究者基于该数据集在VITA-1.5、Qwen2.5-Omni与Qwen3-Omni等模型上开展的全参数微调实验,不仅验证了结构化脚本在提升视听推理能力上的有效性,还衍生出针对长视频问答与复杂事件排序的新评估范式。此外,其提供的测试集OmniVideo-Test已成为检验多模态大模型在十项认知任务上综合表现的权威标尺,激励着更多学者探索跨模态证据追踪与因果推断的前沿课题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务