遇见数据集

OmniVideo-100K

收藏
arXiv2026-06-13 更新2026-06-16 收录
官方服务:

资源简介:

OmniVideo-100K是由南京大学与中国科学院自动化研究所联合构建的大规模音频-视觉指令调优数据集,旨在通过结构化脚本与证据链促进跨模态深度推理。该数据集包含10万对自动生成的问答样本,源自5214个经过筛选的英文视频,涵盖vlog、新闻、卡通等七类真实场景,视频时长集中于1至3分钟,并均衡包含开放式与多项选择题型。其构建过程创新性地采用实体锚定脚本化与线索引导的问答生成两阶段自动化流程,首先将视频转化为包含摘要、实体列表及分段描述的结构化文本以保障叙事连贯性与声源关联,继而基于跨片段多模态线索生成具有长期时序依赖的复杂问答。该数据集主要应用于训练与评估多模态大语言模型在细粒度对齐、语义理解及因果推理等十类音频-视觉任务上的性能,致力于解决传统方法中存在的模态割裂、实体描述不一致及跨模态推理能力不足等核心问题。

OmniVideo-100K is a large-scale audio-visual instruction-tuning dataset jointly constructed by Nanjing University and the Institute of Automation, Chinese Academy of Sciences, aiming to promote cross-modal deep reasoning through structured scripts and evidence chains. This dataset comprises 100,000 automatically generated question-answer (QA) pairs, derived from 5,214 filtered English videos spanning seven real-world scenarios including vlogs, news, cartoons, etc. The video durations primarily range from 1 to 3 minutes, and the dataset evenly includes both open-ended and multiple-choice question types. Its construction innovatively adopts a two-stage automated pipeline: entity-anchored scripting and cue-guided QA generation. First, videos are converted into structured text containing summaries, entity lists and segmented descriptions to ensure narrative coherence and sound-source association. Subsequently, complex QA pairs with long-term temporal dependencies are generated based on cross-segment multimodal cues. This dataset is primarily used for training and evaluating multimodal large language models (LLMs) across ten categories of audio-visual tasks such as fine-grained alignment, semantic understanding and causal reasoning, and is dedicated to addressing core limitations of traditional methods, including modal disconnection, inconsistent entity descriptions and insufficient cross-modal reasoning capabilities.

创建时间:
2026-06-13
原始信息汇总

数据集概述:OmniVideo-100K

OmniVideo-100K 是一个面向音视频推理的大规模指令微调数据集,旨在解决现有“视频-字幕-问答”流程中存在的模态偏差、时间错位和叙事不连贯问题。该数据集由论文 "OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains" 提出。

核心机制

数据集构建基于一个全自动数据合成引擎,包含两个核心机制:

  1. 实体锚定视频脚本化:将原始视频转化为结构化的脚本式文本,包括摘要、主要实体列表以及带时间戳的分段音视频描述,确保跨段引用一致性和声源关联。
  2. 线索引导的问答生成:引导多模态大模型(MLLMs)首先从脚本中挖掘跨段和跨模态线索,然后生成具有长时间跨度和深度跨模态依赖的复杂问答对。

数据集构成

  • OmniVideo-100K:大规模指令微调数据集。
  • OmniVideo-Test:人工验证的测试集。

任务体系

数据集基于一个全面的认知框架设计,涵盖三个级别的 10 种 任务:

  • 对齐:细粒度感知(FGP)、场景变换检测(STD)
  • 理解:上下文理解(CU)、比较(CP)、情感分析(SA)、事件序列排序(ESO)、总结(SM)
  • 推理:因果推理(CR)、未来预测(FP)、假设推理(HR)

目录结构要求

数据集(以 <root_path> 为根目录)的标准结构如下:

<root_path>/ ├── videos/ │ └── ori/ # 原始视频文件 (.mp4) ├── pre_files/ │ └── final_videos_list.jsonl # 经过筛选的视频列表(含时长与路径) ├── script_files/ # 中间生成的脚本文件 ├── script.jsonl # 最终整合的结构化脚本 └── qa_files/ # 生成的开放型与多选题问答对

基准测试性能

在 OmniVideo-100K 上微调的模型在外部音视频基准(如 Daily-Omni, JointAVBench)上表现出一致的性能提升,同时在通用视频基准(如 Video-MME)上保持了原有能力。

在 OmniVideo-Test 上的主要结果

模型 参数量 总体 对齐 理解 推理 (0, 2]分钟 (2, 5]分钟
Ours (Qwen3-Omni) 30B 63.56% 60.34% 67.05% 59.54% 62.11% 64.24%
Ours (VITA-1.5) 8B 61.58% 59.48% 63.18% 60.31% 59.01% 62.79%
Ours (Qwen2.5-Omni) 7B 60.59% 62.93% 62.40% 54.96% 54.66% 63.37%

数据获取与许可

搜集汇总
数据集介绍
OmniVideo-100K 数据集图片
构建方式
OmniVideo-100K的构建依托于一种全自动化的数据处理引擎,该引擎由两大核心机制构成。首先,通过实体锚定视频脚本机制,将原始视频转化为包含摘要、主实体列表及分段视听描述的结构化脚本。主实体列表作为全局先验,确保跨片段描述的指代一致性,并重建音视频之间的内在关联。其次,线索引导的问答生成机制促使模型从脚本中预先挖掘跨片段、跨模态的高价值线索,再基于这些线索生成问答对,从而保证问题具备长时间跨度和深度跨模态推理特性。最终,该流程从5214个视频中自动生成了10万个涵盖开放与选择两种格式的问答对。
特点
OmniVideo-100K数据集相较于现有同类数据集展现出三个显著特点。其一,引入了基于证据链的问答机制,其开放型答案不仅包含最终结论,还提供了详尽的跨模态推理过程,显著区别于仅输出简短结论的传统数据集。其二,覆盖了从基础感知到高级推理的三级认知框架,包括了细粒度对齐、场景变换检测、因果推理和假设推理等十项任务,特别强化了对复杂时间关系与深层跨模态依赖的建模。其三,结构化脚本作为高价值副产品,提供了可复用的中间表示,优于传统的单段落叙述方式,可广泛应用于视频编辑等多种下游场景。
使用方法
该数据集主要用于提升多模态大语言模型(MLLMs)在音视频联合理解上的指令微调能力。使用时可参照论文方法,对VITA-1.5、Qwen2.5-Omni等模型进行全参数微调,训练时采用LLaMA-Factory等工具,并保持与原文一致的批大小、学习率和预热比例等超参数设置。所生成的问答对以7:3的比例混合开放与多项选择格式,各项任务样本均衡分布,可直接用于监督学习。此外,附带的OmniVideo-Test人工验证测试集可用于评估模型在细粒度时间对齐与跨模态推理方面的表现,代码与数据已开源供研究者复现与扩展。
背景与挑战
背景概述
随着多模态大语言模型从视觉语言领域迈向全模态理解,视频理解中音频与视觉信息的联合分析成为关键。然而,现有自动化数据集构建方法普遍采用“视频-字幕-问答”范式,将视频分割为短片段并分别生成音频与视觉描述,导致声音与视觉源之间的固有关联被割裂,且独立片段描述常引发同一实体在不同段落中的指代不一致。为解决这一困境,南京大学与中国科学院自动化研究所的研究人员于2026年提出了OmniVideo-100K数据集,通过实体锚定视频脚本机制,将视频转化为包含摘要、主要实体列表及片段级视听描述的结构化脚本,并利用线索引导的问答生成策略,促使模型跨片段、跨模态挖掘高价值线索,进而生成具有长时序跨度与深层跨模态依赖的问答对。该数据集涵盖十个视听任务,包含十万个自动生成的指令微调样本及505个人工验证的测试样本,在VITA-1.5、Qwen2.5-Omni-7B等模型上取得了最高20.59%的性能提升,并展现出优异的跨基准泛化能力。
当前挑战
OmniVideo-100K所应对的首要挑战是当前模型在音频-视频联合理解中存在的模态偏差与幻觉问题:现有方法将视听内容分离处理,难以建模复杂的跨模态交互,尤其在细粒度时序对齐与深层因果推理任务上表现乏力。其次,构建过程面临多重技术难点:一方面,需确保跨片段叙事的连贯性,避免同一实体在不同段落中出现歧义描述;另一方面,需解决声音与视觉源之间的断连问题,例如在多说话人场景中准确关联语音与说话人。此外,生成高质量问答对还需克服长文本理解与问答合成耦合导致的局部化局限,并排除依赖单模态即可回答的劣质样本。为此,该数据集创新性地引入实体锚定脚本与线索引导策略,通过全局实体先验统一跨片段指代,并借助分步推理链生成具有长时序跨度的视听协同问题,最终将人工验证后的样本通过率严格控制在约38.14%,以确保数据质量与挑战性。
常用场景
经典使用场景
在音视频联合推理研究领域,OmniVideo-100K被广泛用于指令微调多模态大语言模型,以增强其对复杂跨模态场景的深度理解能力。该数据集通过实体锚定视频脚本与线索引导的问答生成机制,提供了涵盖细粒度感知、场景变换检测、因果推理等十项任务的十万个高质量音频-视觉问答对,尤其适合用于评估和提升模型在长时间跨度、多模态协同推理方面的表现。研究者常将其作为训练基准,以检验模型在音视频对齐、叙事连贯性与跨模态逻辑演绎等核心能力上的进步。
实际应用
在实际应用层面,OmniVideo-100K所强化的音视频理解能力可广泛赋能智能视频编辑、沉浸式虚拟会议分析、智能监控系统的事件因果追溯、以及辅助视听觉障碍人士的内容解析系统。例如,在视频编辑场景中,模型能够基于音频线索与视觉内容的精准对齐,自动识别并定位关键情节转折点,实现智能化剪辑推荐。在体育赛事分析中,模型可综合理解解说音频与运动员动作的因果关系,自动生成具有逻辑连贯性的赛事摘要,极大提升内容生产与信息检索的效率。
衍生相关工作
OmniVideo-100K的提出催生了多项具有代表性的后续研究工作。在数据合成层面,研究者借鉴其实体锚定脚本框架,进一步探索了面向长视频的六维结构化描述生成方法(如TimeChat-Captioner),以及将脚本作为视频内容结构化证据桥梁的Video Generation蓝图(如Script-a-Video)。在模型训练层面,基于该数据集微调的VITA-1.5、Qwen2.5-Omni与Qwen3-Omni在多个公开基准(如Daily-Omni、JointAVBench)上展现出显著的性能提升,验证了结构化脚本与线索引导策略在提升音视频协同理解方面的普适价值,并推动了后续关于自适应分割策略与专用音频模型集成的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务