DISLab/VRAG-Bench
收藏官方服务:
资源简介:
V-RAGBench 是一个用于长视频检索增强生成(VideoRAG)中检索和生成的忠实解耦评估的基准。它包含2100个基于小时级自我中心视频构建的开放三元组⟨查询, 证据块, 答案⟩,其中每个查询被设计为仅从其本地化证据块中可回答,从而使生成因果依赖于检索。该数据集针对VideoRAG设置,系统必须从长的自我中心视频中检索查询相关证据,然后生成答案。它通过强制执行三个属性(非重复证据、视觉基础、证据本地化)来确保每个查询与唯一充分的证据块绑定,使得检索和生成可以单独和联合测量。
V-RAGBench is a benchmark for faithful, decoupled evaluation of retrieval and generation in long-video retrieval-augmented generation (VideoRAG). It contains 2,100 open-ended ⟨query, evidence chunk, answer⟩ triplets built from hour-scale egocentric videos, where each query is designed to be answerable only from its localized evidence chunk—making generation causally dependent on retrieval.
提供机构:
DISLab搜集汇总
数据集介绍

构建方式
V-RAGBench的构建过程遵循一条严谨的四阶段流水线。首先,从Ego4D和EgoLife两大第一人称视频语料库中,筛选出时长超过一小时的216段未剪辑视频。随后,通过核时序分割与聚类技术,从视频中提取出互不重复的事件片段,确保每一事件在整段视频中仅出现一次。在此基础上,利用多模态大语言模型为每个事件片段生成上下文局部化的开放域问题,共计获得67,370个候选三元组。最后,经过语义冗余性、可回答性、捷径偏差、经验可回答性及证据唯一性五重过滤,仅约8.77%的候选样本得以保留,并经过类别平衡处理,最终形成2,100条高质量的查询-证据-答案三元组。
特点
该数据集的核心特征在于其精巧的三重约束设计,使得检索与生成过程可被独立且联合地评估。每一条查询均与一段独一无二的视频证据片段严格绑定,该事件在整个视频中不重复出现,确保了检索的不可替代性。同时,答案完全植根于视觉信息,无法仅凭常识或语言先验推导,也避免了通用视觉线索带来的捷径。这种设计从根本上消除了传统视频问答基准中普遍存在的‘无需观看视频即可回答’的偏差,使得最终的生成表现真正依赖于检索的准确性。此外,数据集覆盖了时长从1小时到9小时不等的第一人称视频,并均衡地包含了行为流、物体理解及人机交互三类查询,构建了一个极具挑战性的长视频检索增强生成评测场景。
使用方法
V-RAGBench旨在服务于长视频检索增强生成(VideoRAG)领域的研究。用户可直接将其作为评测基准,用以衡量系统在给定超长第一人称视频时,能否首先精准检索到与查询相关的证据片段,进而在该证据约束下生成忠实于视频内容的答案。数据集已预设1,800条训练样本与300条测试样本的划分,支持用户独立评测检索模块的命中率与生成模块的准确率,亦可联合评估端到端的RAG流程。使用时需注意,由于衍生自Ego4D与EgoLife,用户须遵守其原始授权协议,且严禁将数据集用于监控、生物识别或个体身份识别等用途。
背景与挑战
背景概述
V-RAGBench是一个面向长视频检索增强生成(VideoRAG)的基准数据集,由KAIST与高通人工智能研究所的研究团队于2026年创建。该数据集聚焦于小时级第一人称视角视频中的信息检索与答案生成任务,核心研究问题在于如何独立且忠实地评估检索与生成两个环节的性能。不同于传统视频问答数据集——其中超过半数的提问无需观看视频即可回答——V-RAGBench通过强制要求证据片段具有非重复性、视觉可证性与位置限定性,使得每个查询与其对应的证据片段形成唯一因果关联。基于Ego4D与EgoLife两大公开数据集,该工作筛选出216段时长1至9小时的第一人称视频,并构建了2100条开放式的三元组样本。V-RAGBench的提出为长视频多模态理解领域树立了更为严谨的评估标杆,推动了检索增强生成在视频场景下的发展。
当前挑战
V-RAGBench所面临的挑战主要来自两层面。在领域问题层面,长视频检索增强生成需解决检索与生成环节相互耦合的难题:现有基准中高问答准确率往往并非源于成功检索,而是依赖语言先验或通用视觉线索,导致最终精度无法真实反映检索质量。V-RAGBench对此设计了证据唯一性与定位约束,使检索与生成可分别度量。在数据集构建层面,挑战体现于严格的筛选流程——从216段视频经事件提取与去重得到6万余条候选三元组,再通过语义冗余、可回答性、捷径偏差、经验可答性与证据唯一性五重过滤后仅约8.77%的样本得以保留,最终还需在动作流、物体理解、交互三类查询间实现均衡分布。这一过程确保了数据集的高质量,同时也凸显了在长视频场景下构造忠实评测数据的复杂性与成本。
常用场景
经典使用场景
VRAG-Bench 主要服务于长视频检索增强生成(VideoRAG)这一前沿范式,其经典用途在于对视频问答系统进行解耦式评估。传统评测中,模型常依赖语言先验或世界知识回答问题,导致检索环节的实际贡献被掩盖。该数据集通过精心设计的2,100条⟨查询,证据片段,答案⟩三元组严格约束每条查询仅能由其对应的单一视频证据片段作答,从而独立测量检索质量和生成忠实度,为长视频理解研究提供了可靠的因果评估基准。
衍生相关工作
围绕VRAG-Bench衍生了多项开创性工作,其中最具代表性的是与数据集同论文提出的CARVE(Chunk-Aware Reranking for Video Evidence)方法。CARVE聚焦于视频证据的片段感知重排序,通过识别并提升与查询因果相关的视频片段权重,显著改善了长视频中检索结果的质量。此外,该基准推动了多模态大语言模型在长视频理解中的端到端评估范式转型,催生了如交互式证据定位、时空注意力增强检索等一系列后续研究,形成了以解耦评估为核心的长视频RAG研究新方向。
数据集最近研究
最新研究方向
当前,长视频检索增强生成(VideoRAG)领域正面临检索与生成过程难以解耦评估的困境。V-RAGBench的提出恰逢其时,它通过精心设计的2100个三元组,严格确保每个查询仅能由其对应的证据片段回答,从而首次实现了对长视频RAG系统中检索与生成环节的独立度量与联合评估。该基准不仅揭示了现有视频问答中超过半数问题可脱离视频直接回答的严重偏差,还催生了CARVE这一证据感知重排序方法。这一前沿研究方向直指多模态RAG的核心挑战,为构建更忠实、更可靠的长视频理解系统奠定了关键的评估基石。
以上内容由遇见数据集搜集并总结生成



