OmniCap-IF
收藏资源简介:
OmniCap-IF是一个用于评估全模态视频描述中指令跟随能力的基准测试数据集。该数据集包含480个视频和1,920个指令样本,覆盖理解、生成、检索和沟通导向的视频描述任务。每个样本将一个提示与细粒度的格式和内容检查清单配对,用于评估模型在生成视频描述时是否遵循用户指定的结构、时间、视觉、音频和视听约束。数据集强调指令跟随行为,而不仅仅是通用描述质量,要求模型在满足显式用户约束(如JSON/表格格式、时间戳、事件定位、源定位、音频可见性和视听因果关系)的同时生成有用的视频描述。数据集的注释文件包括提示、检查清单和视频元数据,视频文件以MP4格式提供。数据集适用于视频描述、多模态理解和指令跟随评估等任务,并采用CC-BY-NC-SA-4.0许可证。
OmniCap-IF is a benchmark dataset for evaluating instruction-following capabilities in omnimodal video captioning. It contains 480 videos and 1,920 instruction samples, covering comprehension, generation, retrieval, and communication-oriented video captioning tasks. Each sample pairs a prompt with a fine-grained format and content checklist to assess whether models follow user-specified structural, temporal, visual, audio, and audio-visual constraints when generating video captions. The dataset emphasizes instruction-following behavior over general caption quality, requiring models to produce useful video descriptions while adhering to explicit user constraints, such as JSON/table formats, timestamps, event localization, source localization, audio visibility, and audio-visual causality. The annotation files include prompts, checklists, and video metadata, with video files provided in MP4 format. The dataset is suitable for tasks like video captioning, multimodal understanding, and instruction-following evaluation, and is licensed under CC-BY-NC-SA-4.0.
数据集概述:OmniCap-IF
OmniCap-IF 是一个用于评估全模态视频字幕生成中指令遵循能力的基准测试数据集。其核心目标是衡量模型在生成视频描述时,能否满足用户提出的明确约束(如格式、时间、视觉、音频及音视频关联等)。
基本信息
- 许可证: CC-BY-NC-SA-4.0
- 语言: 英语
- 数据集规模: 1K < n < 10K
- 关键词:
video-captioning,audio-visual,omni-modal,instruction-following,benchmark,checklist-evaluation
构成与规模
- 视频数量: 480 个
- 指令样本: 1,920 个,覆盖理解、生成、检索和面向交流的字幕任务。
- 样本结构: 每个视频对应 4 个不同级别的提示样本。每个样本包含一个提示和用于评估的细粒度检查清单(Checklist)。
数据内容
数据集包含以下主要文件:
annotation/目录:prompts.json: 仅包含提示的基准样本。checklists.json: 包含与prompts.json中相同的样本,并附加了用于评估的检查清单。检查清单分为format_check(格式检查)和content_check(内容检查)两部分。video_meta_info.json: 包含视频时长、路径和类别元数据。
videos/目录: 包含编号为001.mp4至480.mp4的 480 个视频文件。metadata.jsonl: 用于 Hugging Face Dataset Viewer 的轻量级文件,通过file_name关联视频和提示。
评估重点
OmniCap-IF 基准测试强调指令遵循行为,而非一般的字幕质量。模型在生成有用的视频描述时,必须满足明确的用户约束,例如:
- 格式约束(如JSON、表格格式)
- 时间戳和事件定位
- 视觉和音频事件行为
- 音视频因果关系
评估指标包括格式遵循率(CSR)和内容正确率(ISR)。
下载与使用
- 下载命令:
hf download NJU-LINK/OmniCap-IF --repo-type dataset --local-dir OmniCap-IF - 使用方式: 下载项目代码,将模型响应放置在
response/目录下,然后运行main.py脚本进行评估。 - 训练集: 相关的训练集为
NJU-LINK/OmniCap-IF-54K。
引用
bibtex @article{wang2026omnicapif, title = {OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning}, author = {Wang, Jiahao and Ping, An and Wang, Yanghai and Zhang, Yuanxing and Li, Shihao and Bian, Hanyan and Ren, Yichi and Zhang, Yize and Wang, Han and Chen, Haowen and Li, Junze and Wang, Jiaqi and Hu, Yiyang and Xu, Zhuze and Zhang, Zijie and Liu, Jiaheng}, journal = {arXiv preprint arXiv:2606.xxxxx}, year = {2026} }




