遇见数据集

OmniCap-IF

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

OmniCap-IF是一个用于评估全模态视频描述中指令遵循能力的基准测试数据集。该数据集旨在推动模型在生成有用视频描述的同时,精确满足用户明确指定的各种约束条件。数据集包含480个视频和1,920个指令样本,覆盖了理解、生成、检索和面向通信的视频描述任务。每个样本由一个提示词和一套细粒度的评估检查清单组成,用于系统性地评估模型在格式(如JSON、表格、时间戳)和内容(如视觉事件、音频事件、时间定位、视听因果关系)方面对指令的遵循程度。数据集的多样性体现在视频类别、时长、指令长度、约束数量及类型上,其核心评估焦点超越了通用的描述质量,强调模型对结构化、时间性、视觉、音频及视听融合约束的遵从能力。数据集文件结构包括注释文件(包含提示词、检查清单和视频元数据)、原始视频文件以及便于Hugging Face数据集查看器使用的轻量级元数据文件。

OmniCap-IF is a benchmark dataset for evaluating instruction-following capabilities in omnimodal video captioning. The dataset aims to advance models in generating useful video descriptions while precisely meeting various user-specified constraints. It includes 480 videos and 1,920 instruction samples, covering understanding, generation, retrieval, and communication-oriented video captioning tasks. Each sample consists of a prompt and a fine-grained evaluation checklist, used to systematically assess the models adherence to instructions in terms of format (e.g., JSON, tables, timestamps) and content (e.g., visual events, audio events, temporal localization, audio-visual causal relationships). The datasets diversity is reflected in video categories, duration, instruction length, number and types of constraints, with its core evaluation focus extending beyond general description quality to emphasize the models compliance with structural, temporal, visual, audio, and audio-visual fusion constraints. The dataset file structure includes annotation files (containing prompts, checklists, and video metadata), raw video files, and lightweight metadata files for easy use with the Hugging Face dataset viewer.

创建时间:
2026-06-06
原始信息汇总

数据集名称:OmniCap-IF

基本信息

  • 许可证:CC-BY-NC-SA-4.0
  • 语言:英语
  • 领域:视频描述(Video Captioning),专注于全模态(Audio-Visual)条件下的指令跟随
  • 数据集规模:1,000 < n < 10,000(具体为480个视频,1,920条指令样本)

数据集概述

OmniCap-IF 是一个用于评估全模态视频描述中指令跟随能力的基准数据集。它包含480个视频和1,920条指令样本,涵盖理解、生成、检索和面向通信的描述任务。每个样本将提示与细粒度的格式和内容检查清单配对,用于评估模型是否遵循结构、时间、视觉、音频以及视听结合的约束。

数据集结构

数据集目录结构如下:

annotation/ prompts.json # 仅包含提示的基准样本 checklists.json # 包含评估检查清单的样本 video_meta_info.json # 视频时长、路径和类别元数据 videos/ # 视频文件(001.mp4 至 480.mp4) assets/ # 数据集统计信息图片 metadata.jsonl # Hugging Face 数据集查看器使用的轻量级文件

基准任务特点

  • 覆盖多样的视频类别、时长、指令长度、约束数量和约束类型。
  • 强调指令跟随行为:模型需在满足显式用户约束(如JSON/表格格式、时间戳、事件定位、源定位、音频可见性、视听因果关系)的同时生成有用的视频描述。

标注格式

每个视频ID对应四个提示级别的样本,示例格式如下: json { "001": [ { "field": "For Understanding", "prompt_id": "01", "generated_prompt": "...", "constraints_used": [ "omni_events_actions", "omni_temporal_grounding", "visual_events_actions", "audio_events_actions", "json_array", "timestamp_format", "case" ] } ] }

checklists.json 中,每个提示额外包含一个 checklist 字段: json { "checklist": { "format_check": [], "content_check": [] } }

此检查清单用于计算格式和内容正确性的 CSR 和 ISR 指标。

使用方式

  1. 下载数据集: bash hf download NJU-LINK/OmniCap-IF --repo-type dataset --local-dir OmniCap-IF

  2. 运行评估代码:将模型响应置于 response/ 目录下,每个响应文件映射视频ID到提示级别的输出: json { "001": [ { "prompt_id": "01", "response": "..." } ] }

  3. 执行评估: bash python main.py --meta_dir ./annotation --response_dir ./response --save_dir ./results --api_key YOUR_API_KEY --base_url YOUR_BASE_URL --model_name YOUR_JUDGE_MODEL

引用信息

请引用以下论文: bibtex @article{wang2026omnicapif, title = {OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning}, author = {Wang, Jiahao and Ping, An and Wang, Yanghai and Zhang, Yuanxing and Li, Shihao and Bian, Hanyan and Ren, Yichi and Zhang, Yize and Wang, Han and Chen, Haowen and Li, Junze and Wang, Jiaqi and Hu, Yiyang and Xu, Zhuze and Zhang, Zijie and Liu, Jiaheng}, journal = {arXiv preprint arXiv:2606.xxxxx}, year = {2026} }

相关链接

  • 项目主页:https://nju-link.github.io/OmniCap-IF/
  • 论文地址:https://arxiv.org/abs/2606.xxxxx
  • GitHub仓库:https://github.com/NJU-LINK/OmniCap-IF
  • 训练集:https://huggingface.co/datasets/NJU-LINK/OmniCap-IF-54K
搜集汇总
数据集介绍
OmniCap-IF 数据集图片
构建方式
OmniCap-IF是一个面向全模态视频描述指令跟随能力的评估基准。其构建过程首先从多样化的视频类别中精心筛选出480个视频片段,确保覆盖不同时长、场景和内容复杂度。在此基础上,研究者设计了四种核心任务类型:理解、生成、检索与面向交流的描述,并针对每个视频构造了四个不同的提示样本,共计1920条指令。每条指令均配备细粒度的格式与内容检查清单,涵盖结构约束、时序约束、视觉约束、音频约束以及音视频联合约束。所有注释信息被整理为独立的JSON文件,包括提示、检查清单和视频元数据,形成结构化的评测数据集。
使用方法
使用OmniCap-IF数据集进行评测时,用户需从HuggingFace下载完整数据集,包含视频文件、注释与元数据。将待评测模型的输出结果以指定的JSON格式存放于response目录下,每个视频对应的四个提示需分别提供响应文本。随后运行官方提供的评估脚本main.py,需配置LLM裁判模型(如GPT-4)的API密钥与端点。评估过程自动调用裁判模型对每一条响应进行格式与内容检查,计算约束满足率(CSR)与指令遵循率(ISR)。最终结果保存于results目录,支持按任务类型、约束类别等维度进行细粒度分析,为模型改进提供量化指导。
背景与挑战
背景概述
OmniCap-IF基准测试集由南京大学LINK研究团队于2026年创建,核心研究人员包括Wang Jiahao、Ping An等学者,旨在评估全模态视频字幕生成中的指令遵循能力。该数据集包含480个视频和1,920个指令样本,覆盖理解、生成、检索和面向交流的字幕任务,每个样本均配以细粒度的格式与内容检查表,用以检验模型是否满足结构、时间、视觉、音频及音视频融合等多维约束。这一工作为多模态视频理解领域提供了一套严谨的评估框架,推动了全模态模型在动态场景下遵循复杂用户指令的能力研究,对提升视频字幕的实用性与可控性具有重要影响。
当前挑战
该数据集所解决的领域问题在于,现有视频字幕生成模型虽能生成高质量描述,却难以准确遵循用户指定的格式(如JSON、表格)、时间戳、事件定位、音频来源标注及音视频因果关系等具体约束,导致输出与需求脱节。构建过程中,研究者需精心设计涵盖多类约束的指令样本,并开发检查表以实现自动化的格式一致性与内容正确性评估,面临如何平衡指令多样性、检查表覆盖度及评估可靠性的挑战,同时需确保480个视频在类别、时长与约束类型上的代表性,以支撑全面而有效的模型评测。
常用场景
经典使用场景
OmniCap-IF 基准测试集是评估全模态视频描述模型中指令跟随能力的经典平台。该数据集包含480个视频及1920个指令样本,涵盖理解、生成、检索和面向沟通的描述任务。每个样本都提供了细粒度的格式和内容检查清单,用于评估模型在结构、时间、视觉、音频以及视听联合约束上的遵循程度,使得研究者能够系统性地衡量模型输出与用户指令之间的一致性。
解决学术问题
该数据集有效解决了全模态视频描述领域的一个关键学术问题:即现有评估指标多关注描述质量而忽略了对复杂用户指令的严格遵循。OmniCap-IF 通过引入检查清单机制,将指令跟随能力分解为格式合规性、时间定位准确性、事件基础、来源定位以及视听因果关系等多个可量化维度,为学术界提供了一个标准化、可重复的基准,推动了从单纯追求描述流畅性向精确执行用户约束的研究范式转变。
实际应用
在实际应用层面,OmniCap-IF 基准测试集可广泛用于评估和优化各类视频内容理解与生成系统,例如视频检索、自动字幕生成、辅助视障人士的语音描述服务以及智能视频编辑工具。通过该基准,开发者能够准确判断其模型在真实场景下是否能够按照用户指定的格式(如JSON或表格)、时间戳和事件定位要求生成满足特定需求的描述,从而提升人机交互的可靠性和实用性。
数据集最近研究
最新研究方向
在全模态视频理解领域,指令跟随能力正成为评估视频描述模型实用性的关键维度。OmniCap-IF基准数据集应运而生,它突破传统仅关注生成质量的做法,首创性地将细粒度格式与内容检查清单引入视频描述评测体系,涵盖理解、生成、检索与沟通导向的四大任务方向。该基准包含480个视频与1920条指令样本,每条样本均附带结构化、时序、视觉、音频及音视频跨模态约束的检验标准,为评估模型在复杂用户指令下的遵从程度提供了系统化工具。这一创新不仅推动了视频描述从单纯的语义近似迈向精准约束满足,更揭示了当前多模态大模型在格式规范、事件时空定位及跨模态因果推理等前沿方向上的瓶颈,为构建真正可用、可控的全模态智能系统铺设了关键的评测基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务