遇见数据集

ExtremeWhenBench

收藏
arXiv2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

ExtremeWhenBench是由NAVER Cloud AI和韩国科学技术院·人工智能联合创建的首个开放小时级自然语言时序定位基准数据集,旨在解决长视频中基于文本查询的时间定位难题。该数据集包含2,273个查询,覆盖194个视频,平均时长75.7分钟,最长可达9小时,总查询量丰富,数据来源于公开的LVBench、MLVU和VideoMME视频库。数据集通过七阶段流水线构建,包括事件挖掘、问题生成和人工审核,确保查询的自然语言多样性和时间边界准确性。其核心应用领域为长视频理解与检索,专门用于评估视频大模型在小时级尺度下的搜索与定位能力,推动开放领域视频问答技术的发展。

ExtremeWhenBench is the first open-access hourly-scale natural language temporal localization benchmark dataset jointly created by NAVER Cloud AI and the Korea Advanced Institute of Science and Technology (KAIST) AI Joint Research Team, aiming to address the challenge of text-query-based temporal localization in long-form videos. This dataset includes 2,273 queries across 194 videos, with an average duration of 75.7 minutes and a maximum duration of up to 9 hours, boasting a substantial volume of queries. The data is sourced from three public video repositories: LVBench, MLVU, and VideoMME. The dataset is constructed through a seven-stage pipeline, which covers event mining, query generation and manual review, to ensure the natural language diversity of the queries and the accuracy of their temporal boundaries. Its core application fields focus on long-form video understanding and retrieval, and it is specifically designed to evaluate the search and localization capabilities of video large models at the hourly scale, thus promoting the development of open-domain video question answering technologies.

创建时间:
2026-06-11
原始信息汇总

数据集名称

ExtremeWhenBench

核心定位

面向小时级视频的自然语言时间定位(Temporal Grounding)基准,旨在将搜索(Search)与定位(Localize)两个阶段解耦,关注长视频中由于搜索空间巨大带来的性能瓶颈。

数据集规模

  • 2,273 个开放形式的自然语言问题
  • 194 个时长超过1小时的视频(平均75.7分钟,最长9小时)
  • 来源于 LVBench、MLVU 和 VideoMME 三个已有数据集
  • 地面真实事件中位数为 9 秒(与 Charades-STA 的 7.1 秒相当),但搜索空间约为后者的 153 倍

数据特点

  • 查询语句为 开放形式自然语言,非模板化
    • MATTR(移动平均类型-词元比):0.78(对比 TVBench 的 0.60,Charades-STA 的 0.54)
    • 1,578 个独特的 4-gram 词干
    • 每个问题的词汇多样性比 TVBench 高出约 25 倍(TVBench 的 5 个前缀覆盖了其 99.9% 的划分)
  • 带时间戳的地面真实区间

数据格式(每行示例)

json { "qid": "-WnyRMZqV1U_q042", "video_id": "-WnyRMZqV1U", "source_corpus": "VideoMME", "question": "When does an elderly woman with round glasses speak into a microphone?", "correct_interval": [1805, 1822], "duration_s": 17, "video_duration_s": 4271, "category": "reaction" }

  • 预测输出为 [start, end] 秒级区间

评估指标

  • mIoU(平均交并比)
  • R@0.3 / R@0.5 / R@0.7(在特定IoU阈值下的召回率)
  • Parse-failure rate(解析失败率,失败时IoU计为0)

发布内容

  • 标注数据:已在 Hugging Face 上发布,地址为 min1321/extreme-when-bench,许可证为 CC-BY-4.0
  • 评估代码(即将发布):参考 vLLM 脚本(evaluation/)和 lmms-eval 任务插件(lmms-eval/
  • 视频文件:不直接分发,需从原数据集下载(LVBench、MLVU、VideoMME)

来源视频下载

数据集 视频数 获取地址
VideoMME 89 https://video-mme.github.io/
LVBench 67 https://lvbench.github.io/
MLVU 38 https://github.com/JUNJIE99/MLVU
  • VideoMME 和 LVBench 的 video_id 为 YouTube ID;MLVU 为片段名称
  • 下载后存放为 ./videos/{video_id}.mp4

关键发现

  • 在 ExtremeWhenBench 上,CLIP ViT-L/14-336(检索式方法)取得了 0.269 mIoU,超过了所有开源 Video-LLM(如 Qwen3.5-9B 的 0.110 mIoU),而其在 Charades-STA 上仅处于中游水平
  • 85% 的 Video-LLM 错误可归因于搜索失败;采用检索-定位混合方法(retrieve-then-ground)比单一 Video-LLM 提升 6.7 倍
  • 仅增加帧数(如 Qwen3.5-9B 扩展至 2,048 帧)仍无法缩小与检索基线的差距

相关论文

  • arXiv:2606.12300 —— Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

许可证

  • 本仓库:Apache License 2.0(Copyright © 2026 NAVER Cloud Corp.)
  • 标注数据:CC-BY-4.0
  • 来源视频:受 LVBench、MLVU、VideoMME 各自的许可证约束
搜集汇总
数据集介绍
构建方式
ExtremeWhenBench的构建源于对小时级视频中自然语言时间定位任务中搜索瓶颈的洞察。研究团队从LVBench、MLVU和VideoMME三个公开数据集中精选了194个长视频(平均时长75.7分钟,最长9小时)作为视频源,但并未使用其原有问答标注。构建流程包含七个阶段:首先以1帧/秒的频率使用Qwen3-VL-8B模型生成帧级描述,随后通过gpt-5-mini对描述流进行事件分组,再借助gpt-5.1对候选事件进行视觉边界验证,对20.6%的边界进行精炼并剔除3.3%的无效项。经过事件去重后,利用gpt-5-mini为每个事件生成8-18词的自然语言问题,并禁止使用电影术语以避免模板化。最终通过gpt-5.4视觉评分过滤器依据有效性、唯一性和时间难度进行筛选,保留每组前30%且得分≥7的项目,再经164项人工审核后,最终得到2,273个查询-区间对。
特点
该数据集最核心的特点在于其极长的视频时长与高度多样化的自然语言查询的结合。平均视频长度达75.7分钟,而目标事件的中位时长仅为9秒,这意味着模型需要在比Charades-STA大153倍的搜索空间中定位目标,将任务本质从识别转向搜索。查询语言具有极高的多样性,其移动平均类符形符比(MATTR)达到0.78,显著高于TVBench的0.60和Charades-STA的0.54;四元组词干数量达1,578个,是TVBench的25倍以上,彻底打破了传统基准测试中模板化的语言模式。实验表明,开源视频大语言模型在该基准上性能急剧下降,性能差距可达5-120倍,而简单的帧级检索基线CLIP反而以0.269的mIoU超越了所有开源模型,揭示了长视频场景下搜索瓶颈的主导地位。
使用方法
该数据集的使用设计为直接评估视频大语言模型在小时级视频上的自然语言时间定位能力。用户需输入完整视频及自然语言查询,模型应返回起止时间戳对,解析失败则计IoU为0。评估指标采用平均交并比(mIoU)和不同阈值下的召回率。研究团队推荐使用lmms-eval或VLMEvalKit等标准工具链进行集成。为分解失败原因,数据集支持搜索-定位两阶段分析:可通过窗口裁剪实验(如从30秒至全长)观察模型性能拐点,或采用检索-定位混合流水线,先用CLIP进行帧级检索获取候选窗口,再使用视频大语言模型在约6分钟的子窗口内精确定位,该方法已实现6.7倍的性能提升。数据集还提供失败分类框架,将误差归因于搜索失败(85%)或定位失败(11%)。
背景与挑战
背景概述
时序定位(Temporal Grounding)作为连接自然语言与长视频的语言接口,长期以来在短时视频基准上取得了显著进展。然而,当面对时长动辄数小时的视频内容时,现有模型能否高效响应用户的开放式自然语言查询仍是一个悬而未决的问题。为填补这一研究空白,来自NAVER Cloud AI的研究人员Sukmin Seo与Geewook Kim于2026年共同发布了ExtremeWhenBench数据集。该基准涵盖194个视频、2,273条查询,视频平均时长75.7分钟,最长可达9小时,其核心研究问题在于:当时序定位的时间尺度扩展至小时级别时,模型失败的根本原因究竟是事件识别能力的不足,还是搜索效率的瓶颈。这一数据集首次将长期视频定位问题明确分解为搜索与定位两个阶段,为视频语言模型的评估提供了全新的测试平台,对推动长视频理解领域的发展具有里程碑意义。
当前挑战
ExtremeWhenBench所应对的核心挑战在于,现有视频语言模型在处理小时级自然语言查询时,受限于搜索而非识别瓶颈。具体而言,开放式视频大语言模型在短时基准上表现尚可,但在本数据集上性能急剧下降,最佳模型相对下降幅度达5.3倍,而最差模型甚至高达120倍。相比之下,基于帧级别的CLIP检索基线反而超越了所有开放式模型,揭示了搜索阶段的关键性。在数据集构建过程中,研究人员面临多重挑战:1) 确保查询的开放性与多样性,避免模板化表达,为此设计了基于视觉准则的质量过滤器,将问句的4-gram词干多样性提升至TVBench的约25倍;2) 需要对来自LVBench、MLVU和VideoMME的源视频进行事件挖掘、边界精化与去重,通过七阶段流水线将初始事件从41,139个压缩至2,273个高质量查询对;3) 在保证查询唯一性的同时,还需兼顾时序难度与视觉证据的充分性,最终通过人工审查剔除约43%的模糊项,才得以构建出这一严苛而可靠的长视频定位基准。
常用场景
经典使用场景
ExtremeWhenBench作为首个面向小时级视频的自然语言时间定位基准,其经典使用场景在于评估和驱动视频大语言模型在极长时域下的时序理解能力。该基准包含194段平均时长75.7分钟、最长可达9小时的视频,并配有2273条开放式自然语言查询。研究者可利用该基准系统性地检验模型在分钟级乃至小时级视频中,依据文本描述精准定位目标事件起止时间戳的性能,从而揭示短时视频基准所无法暴露的长时序搜索瓶颈。
衍生相关工作
该基准催生了“检索-定位”混合架构这一经典工作方向,即先通过CLIP等检索模型从完整视频中筛选候选片段,再由视频大语言模型进行精细边界定位。实验表明,这种两阶段流水线在仅消耗6分钟视频上下文的情况下,实现了对单一视频大语言模型6.7倍的性能提升。这一范式与开放域问答中的检索增强生成形成结构性呼应,并催生了后续诸如RGNet等统一检索-定位网络的设计,推动了视频理解领域从短时识别向长时搜索的研究范式迁移。
数据集最近研究
最新研究方向
近年来,视频时序定位研究主要聚焦于短时视频场景,而面向小时级长视频的自然语言时序定位仍是一片未被充分探索的领域。ExtremeWhenBench作为首个开源的小时级定位基准,直面长视频中搜索瓶颈这一核心挑战。该基准覆盖194个视频、2273个查询,平均时长75.7分钟,最大可达9小时,其查询分布自由且多样,显著区别于模板化基准。前沿研究表明,在小时级尺度下,主流视频大语言模型因搜索能力匮乏而性能崩溃,而基于帧级检索的基线方法反而表现更优。进一步的错误归因揭示,85%的失败源于搜索而非识别;检索后定位的两阶段混合策略相较单一视频大语言模型性能提升达6.7倍,揭示了长视频时序定位与开放域问答中检索后阅读的结构性相似。该基准为探索长视频理解中的搜索-定位分解机制提供了关键测试平台,对推动视频语言理解向真实复杂场景演进具有重要学术意义与应用价值。
相关研究论文
  • 1
    Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical DecompositionNAVER Cloud AI; 韩国科学技术院·人工智能 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务