遇见数据集

OmniCap-IF-54K

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

OmniCap-IF-54K是一个用于提升全模态视频描述中指令跟随能力的大规模指令调优数据集。它包含54,000个经过精心筛选的视频-指令-响应三元组,覆盖多种复杂用户需求,包括格式约束(如JSON对象、Markdown表格)、时间定位(时间戳)、视觉内容约束、音频内容约束以及视听协同推理。数据集通过三阶段流程构建:视频筛选、约束感知的指令合成和解耦的响应生成,旨在训练模型在严格遵循用户复杂指令的同时生成高质量、有用的全视频描述。数据以JSON Lines格式组织,每个样本包含视频文件路径和单轮的对话式指令-响应对。视频素材来源于LLaVA-Video-178K和TikTok-10M等公开数据集。该数据集适用于全模态视频描述模型的监督微调,特别是针对指令跟随能力的训练和评估。

OmniCap-IF-54K is a large-scale instruction tuning dataset designed to enhance instruction-following capabilities in full-modal video description. It contains 54,000 carefully curated video-instruction-response triplets, covering various complex user needs, including format constraints (such as JSON objects, Markdown tables), temporal localization (timestamps), visual content constraints, audio content constraints, and audiovisual collaborative reasoning. The dataset is constructed through a three-stage process: video filtering, constraint-aware instruction synthesis, and decoupled response generation, aiming to train models to strictly follow complex user instructions while generating high-quality and useful full video descriptions. The data is organized in JSON Lines format, with each sample containing a video file path and a single-turn conversational instruction-response pair. The video materials are sourced from publicly available datasets like LLaVA-Video-178K and TikTok-10M. This dataset is suitable for supervised fine-tuning of full-modal video description models, particularly for training and evaluating instruction-following capabilities.

创建时间:
2026-06-06
原始信息汇总

数据集概述:OmniCap-IF-54K

OmniCap-IF-54K 是一个大规模指令微调数据集,旨在提升全模态视频字幕生成中的指令跟随能力。该数据集包含 54,000 个精心策划的视频-指令-响应三元组,覆盖格式约束、时间定位、视觉与音频内容约束以及视听协同。

  • 所属机构:NJU-LINK
  • 许可证:CC-BY-NC-SA-4.0
  • 语言:英语
  • 下载链接:https://huggingface.co/datasets/NJU-LINK/OmniCap-IF-54K

构建流程

数据集通过三阶段流水线构建:视频筛选、约束感知指令合成、解耦响应生成。所得样本旨在训练模型生成有用的全视频字幕,同时遵守复杂的用户指定要求,例如 JSON 模式、Markdown 表格、时间戳格式、事件定位和跨模态推理。

数据格式

train.jsonl 文件每行存储一个训练样本。每个样本包含一个相对视频路径和一个单轮指令-响应对。示例如下:

json { "videos": ["LLaVA-Video-178K/ytb_KAqAdn1NXYE.mp4"], "messages": [ { "role": "user", "content": "<video> Using a JSON object, describe the causal relationship between the visual action and the audiences laughter." }, { "role": "assistant", "content": "{ "visual_trigger": "...", "audio_response_intensity": "...", "inferred_humor_mechanism": "..." }" } ] }

videos 字段中的路径是相对于解压后数据集根目录的。

数据集结构

发布内容包含以下文件:

  • train.jsonl:训练数据文件。
  • LLaVA-Video-178K_part_*.tar.gz:视频压缩包(部分)。
  • TikTok-10M_part_*.tar.gz:视频压缩包(部分)。

解压后,目录结构如下:

text OmniCap-IF-54K/ train.jsonl LLaVA-Video-178K/ ytb_*.mp4 ... TikTok-10M/ *.mp4 ...

相关资源

  • 项目主页:https://nju-link.github.io/OmniCap-IF/
  • GitHub 仓库:https://github.com/NJU-LINK/OmniCap-IF
  • 论文:https://arxiv.org/abs/2606.xxxxx
  • 模型(7B):https://huggingface.co/NJU-LINK/OmniCaptioner-IF-7B
  • 模型(3B):https://huggingface.co/NJU-LINK/OmniCaptioner-IF-3B
  • 测试集:https://huggingface.co/datasets/NJU-LINK/OmniCap-IF
搜集汇总
数据集介绍
OmniCap-IF-54K 数据集图片
构建方式
OmniCap-IF-54K数据集的构建遵循一套精心设计的三阶段流水线。首先,通过视频策展环节,从LLaVA-Video-178K和TikTok-10M等大规模视频数据源中筛选出高质量、多样化的视频片段。其次,进行约束感知的指令合成,针对格式约束、时间定位、视觉与音频内容约束以及音视频协同等复杂要求,自动生成多样化的用户指令。最后,采用解耦式响应生成策略,确保模型在遵守用户指定约束(如JSON模式、Markdown表格、时间戳格式)的前提下,输出精准且富有信息量的全模态视频描述。
特点
该数据集最显著的特点在于其强大的指令跟随能力与全模态视频描述的深度融合。它包含54K条精心策划的视频-指令-响应三元组,覆盖格式约束、时间定位、视觉与音频内容约束以及音视频协同等四大类复杂任务。每个样本均要求模型在生成描述时严格遵循用户指定的特定格式(如JSON对象、Markdown表格),同时具备事件定位和跨模态推理能力。这种设计使得数据集成为训练模型处理复杂、多模态用户需求的理想基准。
使用方法
用户可通过HuggingFace命令行工具便捷下载数据集,解压后将获得结构化目录,包含一个JSONL格式的指令文件与对应的视频文件。每个训练样本以标准格式存储,核心为相对视频路径与单轮指令-响应对。在使用时,研究者可直接遍历train.jsonl中的每条记录,将视频路径映射至相应视频文件,并利用用户指令作为输入,让模型学习生成符合格式与内容约束的助手响应。该数据集特别适用于全模态视频描述模型的指令微调与评估。
背景与挑战
背景概述
全模态视频描述(Omni-modal Video Captioning)领域致力于融合视觉、音频等多模态信号生成对视频内容的全面理解,然而现有模型在遵循用户复杂指令方面仍显不足。针对这一瓶颈,南京大学LINK实验室的王嘉豪等研究人员于2026年提出了OmniCap-IF-54K数据集,旨在系统性地提升模型在全模态视频描述中的指令遵循能力。该数据集精心构建了54,000条视频-指令-回应三元组,覆盖格式约束、时间定位、视觉与音频内容约束以及视听协同等多样化的指令类型,为评估与优化模型对复杂用户需求的响应提供了标准化基准。其发布的全模态视频描述指令微调数据集及配套的OmniCaptioner-IF系列模型,有力推动了视频理解技术向更精确、更可控的方向演进。
当前挑战
OmniCap-IF-54K所应对的核心领域挑战在于:现有全模态视频描述模型难以精确遵循具有格式约束、时间定位要求及跨模态推理的复杂指令,亟需高质量的指令微调数据来提升其可控性和实用性。在数据集构建过程中,研究团队面临的关键挑战包括:第一,如何从海量视频中筛选出具备丰富视听交互和因果关系的优质片段,以支撑约束感知的指令合成。第二,需设计一种三阶段流水线(视频策展、约束感知指令合成、解耦响应生成),以自动生成格式多样(如JSON模式、Markdown表格)且包含跨模态推理的指令-回应对,确保数据规模与质量的双重目标。第三,需确保视频源的多样性和响应的独立性,避免模型仅依赖单一模态而忽视跨模态协同信号。
常用场景
经典使用场景
在计算机视觉与自然语言处理的交叉领域中,OmniCap-IF-54K 作为一个大规模指令微调数据集,专为提升全模态视频描述模型的指令遵循能力而设计。其经典使用场景在于训练模型能够处理复杂多样的用户约束,例如输出需符合指定格式(JSON 架构、Markdown 表格、时间戳格式),进行精确的事件时间定位,以及融合视觉与音频内容的跨模态推理。该数据集包含 54K 条精心构建的视频-指令-响应对,覆盖了格式约束、时间定位、视觉与音频内容约束以及视听协同四大核心类别,为研究如何使视频描述模型不仅理解多模态信息,还能严格遵循用户多样化、结构化的指令需求提供了标准化训练资源。
实际应用
在实际应用中,OmniCap-IF-54K 所培育的模型能力可广泛服务于自动化视频内容生产与辅助系统。例如,在视频编辑软件中,用户可要求模型“以 JSON 格式描述视频中主要人物的动作及其引发的音频变化”,从而快速生成结构化的剪辑元数据。在智能安防领域,系统能根据指令“用时间戳列表标记所有异常事件”,实现高效的事件检索与报告自动生成。此外,在教育平台中,模型可依据“用 Markdown 表格对比视频中实验步骤与结果”的指令,为教学素材提供结构化摘要。这些应用场景均依赖模型对多模态信息与复杂指令的精准同步处理,而 OmniCap-IF-54K 正是训练此类鲁棒且灵活系统的基础。
衍生相关工作
OmniCap-IF-54K 的诞生直接催生了相关的全模态描述器系列模型,如 OmniCaptioner-IF-7B 与 OmniCaptioner-IF-3B,这些模型基于该数据集进行指令微调,显著提升了遵循复杂约束的能力。同时,该数据集作为基准测试集,为后续研究提供了评估多模态视频描述指令遵循性能的标准平台。相关工作还包括对数据构建管道的改进,例如视频筛选、约束感知指令合成与解耦响应生成技术的扩展应用,这些方法已被借鉴到音频-视觉联合描述、时序事件描述等更细分的任务中。该数据集也促进了关于如何设计有效指令格式以引导模型输出结构化信息的理论研究,成为连接多模态理解与可控生成领域的桥梁性工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务