遇见数据集

YunzeLiu/OmniRetriever-Bench

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

OmniRetriever-Bench 是第一个12方向音频-视频-文本检索基准数据集,包含3,782个经过人工审核的三元组(音频、视频、文本),用于评估跨模态检索模型。它覆盖6个单模态和6个双模态检索方向(如文本到视频、音频到文本等),所有文本描述基于Gemini 3.0 Pro生成并经过人工校正。数据集以CSV格式提供,包括视频URL、起止时间和文本描述,但不直接包含媒体文件,需通过URL下载并裁剪。该数据集旨在测试统一多模态编码器的性能,支持多模态检索和RAG系统研究。

OmniRetriever-Bench is the first 12-direction audio-video-text retrieval benchmark, consisting of 3,782 human-corrected triples (audio, video, text) for evaluating cross-modal retrieval models. It covers 6 single-modal and 6 dual-modal retrieval directions (e.g., text-to-video, audio-to-text), with captions drafted by Gemini 3.0 Pro and reviewed by human annotators. The dataset is provided in CSV format, including video URLs, start/end times, and captions, but does not redistribute media files; clips must be downloaded and trimmed via URLs. It is designed to test the performance of unified multimodal encoders and supports research on multimodal retrieval and RAG systems.

提供机构:
YunzeLiu
搜集汇总
数据集介绍
YunzeLiu/OmniRetriever-Bench 数据集图片
构建方式
在跨模态检索研究长期局限于文本—图像或文本—视频单向路径的背景下,OmniRetriever-Bench的构建直面统一音视频文本编码器缺乏联合评测基准的空白。该基准以3,782个保留三元组为核心,首先从TikTok平台采集源视频,并借助Gemini 3.0 Pro生成密集描述草稿,继而由经过培训的人类标注者对每一则描述进行审核与修正,确保字幕质量。所有样本均以对角线相关方式组织,即每个查询在共享画廊中仅对应一个正例目标,且该正例在全部12个检索方向中保持一致。数据以CSV格式发布,仅提供源视频URL、起止时间戳及人工验证的描述文本,并不直接分发媒体文件,从而遵循标准视频基准的发布协议。
特点
该基准的首要特征在于其开创性地覆盖了12个检索方向,包括6个单模态方向与6个双模态方向,并统一于同一个3,782片段共享画廊中进行评分,从而能够全面检验模型对联合(T, V, A)嵌入的真实利用能力。所有描述文本均经过人工审核,作者审计的Cohen's κ系数在10%抽样上达到0.78,保证了标注的可靠性。片段时长以短片段为主,中位数为2.16秒,p99为16.17秒,契合细粒度跨模态对齐的评测需求,而非长视频检索场景。此外,基准采用对角线相关性设计,每个查询仅有一个正例目标,评估指标涵盖Recall@1/5/10、NDCG@10、MRR及中位排名,为模型排序能力提供多维度的量化依据。
使用方法
使用该基准时,研究者需先根据CSV中记录的URL下载源视频,再利用ffmpeg按start_sec与end_sec裁剪出对应片段,随后以自身模型提取各模态嵌入。评估环节要求将所有嵌入进行L2归一化,并按照对角线相关约定,对12个检索方向分别计算查询嵌入与画廊嵌入的相似度矩阵,其中画廊索引与查询索引相同的样本即为正例。基准配套的参考评估器位于Omni-Retriever代码库中,支持计算Recall@1/5/10、NDCG@10、MRR及中位排名等指标。研究者亦可借助HuggingFace datasets库直接加载CSV数据,并结合自身的数据加载与推理流程完成端到端的检索评测。
背景与挑战
背景概述
跨模态检索旨在弥合异构模态之间的语义鸿沟,音视频文本联合表征则是多模态学习的前沿方向。既有基准如VATEX与AudioCaps仅评测单向或单模态检索,从未在同一画廊中汇聚视频与音频,致使统一编码器所生成的(T,V,A)联合嵌入在评估阶段处于未被检验的境地。OmniRetriever-Bench由Yunze Liu等研究者于2026年提出,为首个覆盖全部12个单模态与双模态检索方向的音视频文本基准,基于3,782个经人工校订的留存三元组构建,配套OmniRetriever-7B模型与开源评测器,为多模态RAG与统一表征学习提供了严谨的检验标尺。
当前挑战
该基准所应对的核心难题在于,传统音视频文本评测长期割裂单模态方向,无法验证统一编码器是否真正利用其联合嵌入空间,抑或仅将多模态几何简单平均;构建过程中的挑战同样突出,需从TikTok用户生成内容中筛选并抽取短视频片段,以Gemini 3.0 Pro草拟稠密描述再经受训标注者逐条校正,保证跨模态语义对齐的一致性与可靠性。此外,源URL依赖导致数据可复现性受平台下架或删除影响,仅采用对角相关性而缺乏分级排序信号,且片段中位时长仅2.16秒,难以支撑长视频检索的评估需求。
常用场景
经典使用场景
在跨模态检索研究领域,音频、视频与文本的联合表征长期受限于单向或单模态评测范式。OmniRetriever-Bench作为首个十二方向音视频文本检索基准,将3,782个片段置于同一共享画廊之中,同时覆盖六种单模态与六种双模态检索方向,经典用法是训练统一编码器并以其联合嵌入完成任意模态到任意模态的匹配,从而检验模型是否真正习得音视频文本的联合几何结构。
实际应用
在实际应用中,OmniRetriever-Bench为多模态检索增强生成系统、跨模态检索引擎与音视频内容理解平台提供了严格的压力测试环境。开发者可借助其评测协议验证模型在音找文、视找音、音视频联合查询等方向上的召回表现,从而优化检索管线,提升视频推荐、内容溯源与智能媒体管理等场景的用户体验。
衍生相关工作
围绕该基准衍生了以OmniRetriever-7B为代表的统一音视频文本编码器,其借助融合即教师蒸馏与Tuple-InfoNCE损失在十二方向上取得显著提升,并在音锚定路径上超越闭源Gemini Embedding 2。相关代码、评估器与项目主页亦随之开放,为后续多模态检索与音视频文本表征研究奠定了可扩展的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务