遇见数据集

OmniCap-IF

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

OmniCap-IF是一个用于评估全模态视频描述中指令跟随能力的基准测试数据集。该数据集包含480个视频和1,920个指令样本,覆盖理解、生成、检索和沟通导向的视频描述任务。每个样本将一个提示与细粒度的格式和内容检查清单配对,用于评估模型在生成视频描述时是否遵循用户指定的结构、时间、视觉、音频和视听约束。数据集强调指令跟随行为,而不仅仅是通用描述质量,要求模型在满足显式用户约束(如JSON/表格格式、时间戳、事件定位、源定位、音频可见性和视听因果关系)的同时生成有用的视频描述。数据集的注释文件包括提示、检查清单和视频元数据,视频文件以MP4格式提供。数据集适用于视频描述、多模态理解和指令跟随评估等任务,并采用CC-BY-NC-SA-4.0许可证。

OmniCap-IF is a benchmark dataset for evaluating instruction-following capabilities in omnimodal video captioning. It contains 480 videos and 1,920 instruction samples, covering comprehension, generation, retrieval, and communication-oriented video captioning tasks. Each sample pairs a prompt with a fine-grained format and content checklist to assess whether models follow user-specified structural, temporal, visual, audio, and audio-visual constraints when generating video captions. The dataset emphasizes instruction-following behavior over general caption quality, requiring models to produce useful video descriptions while adhering to explicit user constraints, such as JSON/table formats, timestamps, event localization, source localization, audio visibility, and audio-visual causality. The annotation files include prompts, checklists, and video metadata, with video files provided in MP4 format. The dataset is suitable for tasks like video captioning, multimodal understanding, and instruction-following evaluation, and is licensed under CC-BY-NC-SA-4.0.

创建时间:
2026-06-06
原始信息汇总

数据集概述:OmniCap-IF

OmniCap-IF 是一个用于评估全模态视频字幕生成中指令遵循能力的基准测试数据集。其核心目标是衡量模型在生成视频描述时,能否满足用户提出的明确约束(如格式、时间、视觉、音频及音视频关联等)。

基本信息

  • 许可证: CC-BY-NC-SA-4.0
  • 语言: 英语
  • 数据集规模: 1K < n < 10K
  • 关键词: video-captioning, audio-visual, omni-modal, instruction-following, benchmark, checklist-evaluation

构成与规模

  • 视频数量: 480 个
  • 指令样本: 1,920 个,覆盖理解、生成、检索和面向交流的字幕任务。
  • 样本结构: 每个视频对应 4 个不同级别的提示样本。每个样本包含一个提示和用于评估的细粒度检查清单(Checklist)。

数据内容

数据集包含以下主要文件:

  • annotation/ 目录:
    • prompts.json: 仅包含提示的基准样本。
    • checklists.json: 包含与 prompts.json 中相同的样本,并附加了用于评估的检查清单。检查清单分为format_check(格式检查)和content_check(内容检查)两部分。
    • video_meta_info.json: 包含视频时长、路径和类别元数据。
  • videos/ 目录: 包含编号为 001.mp4480.mp4 的 480 个视频文件。
  • metadata.jsonl: 用于 Hugging Face Dataset Viewer 的轻量级文件,通过 file_name 关联视频和提示。

评估重点

OmniCap-IF 基准测试强调指令遵循行为,而非一般的字幕质量。模型在生成有用的视频描述时,必须满足明确的用户约束,例如:

  • 格式约束(如JSON、表格格式)
  • 时间戳和事件定位
  • 视觉和音频事件行为
  • 音视频因果关系

评估指标包括格式遵循率(CSR)内容正确率(ISR)

下载与使用

  • 下载命令: hf download NJU-LINK/OmniCap-IF --repo-type dataset --local-dir OmniCap-IF
  • 使用方式: 下载项目代码,将模型响应放置在 response/ 目录下,然后运行 main.py 脚本进行评估。
  • 训练集: 相关的训练集为 NJU-LINK/OmniCap-IF-54K

引用

bibtex @article{wang2026omnicapif, title = {OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning}, author = {Wang, Jiahao and Ping, An and Wang, Yanghai and Zhang, Yuanxing and Li, Shihao and Bian, Hanyan and Ren, Yichi and Zhang, Yize and Wang, Han and Chen, Haowen and Li, Junze and Wang, Jiaqi and Hu, Yiyang and Xu, Zhuze and Zhang, Zijie and Liu, Jiaheng}, journal = {arXiv preprint arXiv:2606.xxxxx}, year = {2026} }

搜集汇总
数据集介绍
OmniCap-IF 数据集图片
构建方式
OmniCap-IF基准测试的构建源于对全模态视频描述中指令遵循能力评估的迫切需求。该数据集精心筛选了480个视频,涵盖理解、生成、检索及面向交流的描述任务,并针对每个视频设计了4个提示样本,最终形成1920个指令样本。每个样本不仅包含自然语言提示,还配备了细粒度的格式与内容检查清单,用于评估模型在结构、时间、视觉、音频及音频-视觉约束上的遵循情况。数据集遵循CC-BY-NC-SA-4.0许可协议,所有标注信息以JSON格式存储于prompts.json和checklists.json文件中,视频文件则独立存放,便于研究者灵活调用。
特点
OmniCap-IF的显著特点在于其评估维度的全面性与精细化。它不仅覆盖了多样化的视频类别、时长和指令长度,还引入了约束数量与类型的变化,旨在超越传统描述质量的评价。该基准强调模型必须满足显式的用户约束,如JSON格式输出、时间戳标注、事件定位、声源定位及音频-视觉因果关系的描述。通过将检查清单(checklists)与提示配对,数据集能够计算格式和内容上的约束满足率(CSR)与指令满足率(ISR),从而提供对模型指令遵循能力的量化洞察。
使用方法
使用OmniCap-IF进行模型评估时,需先通过hf download命令下载数据集至本地。研究者应将模型生成的响应以JSON格式存放于response目录下,每个视频ID对应四个提示级别的输出。随后,运行提供的main.py评估脚本,并指定标注目录、响应目录、结果保存路径以及用于评判的大语言模型API密钥与基础URL。脚本将自动对比模型输出与检查清单,计算格式和内容维度的CSR与ISR指标,从而客观反映模型在全模态视频描述任务中的指令遵循表现。
背景与挑战
背景概述
多模态视频描述是连接视觉、听觉与语言理解的核心任务,其目标在于生成能够准确反映视频内容的自然语言描述。然而,现有研究多聚焦于描述质量本身,忽视了模型遵循用户细粒度指令的能力,这在高交互需求的应用场景中尤为关键。OmniCap-IF数据集由南京大学LINK实验室的王嘉豪等研究人员团队于2026年创建,旨在系统评估全模态视频描述中的指令遵循能力。该基准包含480段视频和1920条指令样本,覆盖理解、生成、检索与面向通信的描述任务,通过清单式检查表(checklist)解析结构、时序、视觉、音频及视听联合约束,为全模态视频描述研究提供了全新的评估范式,推动了从单纯描述质量向指令对齐能力的范式转变。
当前挑战
OmniCap-IF旨在解决的核心领域挑战在于:现有视频描述模型难以精确遵循诸如指定输出格式(如JSON/表格)、时间戳定位、事件归因、音频可见性判别及视听因果推断等多维度用户约束,导致生成内容虽通顺却偏离实际需求。在数据集构建过程中,面临的挑战包括确保480段视频在类别、时长及复杂指令长度上的多样性与平衡性,设计覆盖四种面向任务的多样化指令样例,以及构建细粒度格式与内容双重检查表以支撑客观的指令遵循成功率(CSR)与指令满意率(ISR)评估,这要求对每一条指令均需进行系统拆解与精确标注,以保证评估的全面性与可复现性。
常用场景
经典使用场景
OmniCap-IF数据集专为评估全模态视频描述中的指令跟随能力而设计,涵盖480个视频与1920个指令样本,横跨理解、生成、检索及面向通信的描述任务。每个样本均配对细粒度格式与内容检查清单,用以衡量模型在结构、时间、视觉、音频及音视频联合约束下的执行表现。这一基准为全模态视频描述提供了一个标准化、多维度的测试平台,尤其适用于检验模型能否在复杂用户约束下生成准确且实用的视频描述。
衍生相关工作
OmniCap-IF衍生了多项兼具学术与实用价值的经典工作,包括基于其检查清单的指令跟随评分系统(CSR和ISR),以及专为提升约束遵循能力设计的微调方法。相关研究进一步探索了时序接地与音视频因果推理的联合优化,并催生了面向全模态视觉语言模型的评估框架。此外,该数据集所定义的约束类型为后续的大规模指令跟随数据集构建提供了结构化的设计模板,推动了视频描述领域从生成质量到精确指令执行的跨越式发展。
数据集最近研究
最新研究方向
在全模态视频字幕生成领域,指令遵循能力正成为衡量模型实用性的核心维度。OmniCap-IF基准数据集应运而生,它通过480段视频与1920条指令样本,系统性地评测模型在理解、生成、检索及面向通信的字幕任务中遵循格式与内容约束的表现。该基准聚焦于时间对齐、事件定位、音视频因果推理等细粒度约束,并引入清单检测评分机制,弥补了传统指标仅关注字幕表面质量的不足。这标志着视频字幕研究从单一描述匹配迈向复杂多模态指令服从的新阶段,为构建真正可控、可用的全模态智能系统提供了关键评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务