遇见数据集

OmniAssistBench

收藏
arXiv2026-08-22 更新2026-08-25 收录
官方服务:

资源简介:

OmniAssistBench是一个面向全模态大语言模型助理式交互能力的评估基准,由南京大学、南开大学和滑铁卢大学联合构建。该数据集包含300个视频、685个问答对,视频时长平均182秒,覆盖生活家居、美食烹饪、科技DIY等六大日常场景。数据集通过逆向工程现有互联网视频,结合专家设计的先验知识路径和手动视频编辑,模拟多轮人机交互过程。旨在评估模型在基础感知(如社会关系理解、手势跟随)和高级目标导向任务(如过程跟踪、主动响应)中的表现,解决当前模型在视觉提示跟随、长期记忆和延迟响应方面的瓶颈。

OmniAssistBench is an evaluation benchmark for the assistant-style interactive capabilities of multi-modal large language models, jointly constructed by Nanjing University, Nankai University and the University of Waterloo. This dataset contains 300 videos and 685 question-answer pairs, with an average video duration of 182 seconds, covering six daily scenarios such as home living, food cooking, technology DIY and others. It simulates multi-round human-computer interaction processes by reverse engineering existing online videos, combining expert-designed prior knowledge paths and manual video editing. This benchmark aims to evaluate model performance in basic perception tasks (e.g., social relationship understanding, gesture following) and advanced goal-oriented tasks (e.g., process tracking, proactive response), addressing current bottlenecks of existing models in visual prompt following, long-term memory and delayed response.

创建时间:
2026-08-22
原始信息汇总

OmniAssistBench 数据集详情

数据集简介

OmniAssistBench 是一个用于评估全模态大语言模型(Omni-LLMs)在助手式交互场景中表现的新型基准测试集。该数据集解决了传统视频理解评估中无法适应助手模型动态响应的挑战,通过精心设计的注释流程,构建了模拟真实助手交互的多轮对话测试样本。

任务设计

数据集采用两层任务框架,全面覆盖真实世界应用中助手所需的关键能力:

基础层(Basic Tier)

聚焦核心感知和多模态指令跟随能力,包含以下7个细粒度任务:

  • 社交感知:身份识别(II)、对话对象识别(AI)、复杂情绪理解(CE)
  • 时间感知:事件检索(ER)、外观顺序感知(AO)、动态计数(DC)
  • 指称感知:动作指称感知(AR)、语言指称感知(LR)
  • 非音频提示跟随:手势提示跟随(GPF)、OCR提示跟随(OPF)

高级层(Advanced Tier)

评估交互助手所需的高阶能力,包含:

  • 上下文感知响应(CR)
  • 主动响应:单事件触发响应(SER)、多事件触发响应(MER)
  • 过程追踪:单任务追踪(ST)、多任务追踪(MT)、多任务多线程追踪(CT)

数据规模与多样性

  • 总计 685 个开放式问答对
  • 覆盖 7 个主要任务类型和 16 个细粒度任务
  • 视频领域涵盖运动、烹饪、讲座、DIY、脱口秀等日常主题
  • 包含3个真实世界案例,平均每个案例包含 15 个交互轮次

数据格式

  • 采用开放式问答格式,包含视频片段、用户问题(嵌入视频中)、标准答案及其关键要点
  • 用户问题以真实音频或打字/手写形式嵌入视频
  • 采用多轮交互格式模拟在线交互,用户提示始终位于每个视频片段的末尾,当前轮次视频从上轮结束处开始

注释流程

采用4阶段注释流程,由人工专家严格标注:

  1. 基于情节的原始视频收集:专家与LLM协作构思挑战特定能力的关键场景
  2. 问答设计与用户目标设计:每条样本包含标准答案句和1-3个关键要点短语
  3. 视频编辑:包括平衡视频长度、嵌入用户提示、嵌入用户目标、剪辑多轮交互片段
  4. 质量优化:使用先进MLLM评估注释完整性,人工验证并补充替代参考答案

每条样本平均耗时约 4小时,整个数据集构建总耗时超过 900小时

评测结果

数据集采用LLM-as-a-Judge流程,评分范围为0-5分(归一化至0-100分)。当前模型表现排名前三的为:

排名 模型 总分 (/100)
1 Gemini-3-Pro 66.4
2 Gemini-2.5-Pro 64.6
3 Doubao-Seed-2.0-lite 57.3

结论:即使最先进的商业Omni-LLM也仅能提供部分正确的答案,表明全模态模型在成为可靠的真实世界助手前仍有较大提升空间。

搜集汇总
数据集介绍
OmniAssistBench 数据集图片
构建方式
OmniAssistBench的构建针对传统静态视频理解基准无法适应交互式助手动态路径的问题,创新性地提出基于先验知识的固定路径标注方法。该方法首先从网络视频中筛选符合特定情节的素材,由专家结合视频内容推断用户目标及标准操作流程作为先验知识,从而将发散的用户行为约束至单一交互路径。随后,专家依据路径设计多轮问答对,并利用视频编辑技术将用户提示以音频或画中画形式嵌入视频末端,模拟实时流式交互的时序因果性。整个构建过程包括场景设计、视频采集、问答设计、视频剪辑与质量精炼四个阶段,全程由人工专家完成,耗时超过1000个专家工时,确保数据逻辑一致性与任务精细度。
特点
OmniAssistBench拥有双层评估框架,涵盖基础交互理解与高级交互理解,共包含7大任务、16个子任务及3个真实世界案例,总计300个视频、685个问答对,视频总时长平均达182秒。其特色在于数据格式设计:采用开放式问题替代多选题以避免信息泄漏,并通过将用户提示嵌入视频流中模拟在线交互,用户音频指令与视觉提示(如手势、手写)被整合进视频,同时严格保持多轮交互的时序连续性。此外,基准覆盖广泛的生活主题,并针对非显著细节、视觉提示跟随、延迟响应及多任务追踪等挑战性能力设计任务,全面评估模型在真实助手场景下的表现。
使用方法
使用OmniAssistBench评估模型时,需将视频保持原始分辨率(约1080p),对非Gemini系列模型以每秒1帧采样输入。系统提示词引导模型扮演视频助手,并明确要求其在无需响应时输出“[KEEP QUIET]”,以测试主动响应能力。模型输出通过基于LLM的自动评判器(如GPT-5)按5分制评分,评分维度包括准确性、完整性、冗余度及沉默约束遵循情况,60分以上视为有效回答。评估时,对长视频采用先进先出策略管理上下文窗口,并对多轮任务可选用教师强制模式以隔离误差累积。该基准适用于检验模型在视觉提示理解、长期记忆、跨轮上下文保持及延迟响应能力上的表现,为开发可靠的真实世界交互助手提供参考。
背景与挑战
背景概述
随着全模态大语言模型(Omni-LLMs)从被动感知向实时交互式视频助手演进,评估其在动态、多轮交互场景中的能力成为关键瓶颈。传统的视频理解基准依赖静态问答对,无法适应模型响应驱动用户行为变化所产生的路径分歧。为填补这一空白,南京大学、南开大学与滑铁卢大学的研究团队于2026年推出OmniAssistBench,通过逆向工程互联网视频,以预定义先验知识固定交互路径,构建涵盖基本感知与高级目标导向任务的300个视频、685个问答对的两层评估框架。该基准为交互式助手评估提供了系统性方法论,揭示了现有模型在视觉指令遵循、长时记忆与延迟响应等维度的显著不足,推动了Omni-LLMs在真实场景中的能力验证。
当前挑战
OmniAssistBench的构建面临双重挑战。首先,交互式评估需应对路径分歧问题,即同一目标可通过多种方式达成,静态数据集难以覆盖所有可能路径;为此,团队从源视频中提炼先验知识以强制唯一交互路径,并借助人工设计多轮交互脚本模拟连续交互,克服真实交互视频稀缺的困境。其次,构建过程需大量人力,包括筛选符合特定情节的视频、设计逻辑自洽的用户目标与问答、精细编辑视频以嵌入提示,以及通过专家评审保证标注质量,整个流程耗时逾1000专家小时。此外,评估中模型暴露出遵循视觉提示(如手势)能力不足、多轮交互中上下文丢失、延迟响应困难等问题,凸显了交互式助手在动态场景下的评估复杂度。
常用场景
经典使用场景
OmniAssistBench作为首个面向全模态大语言模型助理式交互的评估基准,其经典使用场景在于模拟实时视频助理的连续多轮交互过程。该数据集通过逆向工程现有互联网视频,构建了包含视觉状态、用户目标与先验知识的固定交互路径,从而评估模型在真实助理场景中的表现。其双层任务框架涵盖了基础交互理解(如社会感知、时间感知、指代感知、非音频提示跟随)与高级交互理解(如上下文感知响应、主动响应、过程跟踪),并辅以三个真实世界案例(会议模拟、盲人辅助、手工艺过程跟踪),全面检验模型在动态环境中的感知、推理与交互能力。
解决学术问题
OmniAssistBench解决了传统视频理解基准无法适应交互路径分叉的学术难题。在传统静态数据集中,模型回答不影响后续视频内容,而真实助理场景中模型输出会改变用户行为,导致同一目标可通过多条路径达成。该数据集通过从源视频提取先验知识,强制模型遵循唯一指定的交互路径,从而以离线方式模拟在线交互的时序因果性。这一创新方法使得研究者能够可靠地评估模型在开放式问答、多轮上下文保持、主动响应时机判断等方面的能力,填补了交互式全模态评估的空白,为后续研究提供了可复现的评测标准。
衍生相关工作
OmniAssistBench的提出孕育了多项衍生工作。一方面,其数据构建流程(基于先验固定交互路径与逆向工程)为后续交互式评估基准提供了方法论范本,推动了如ProactiveVideoQA、OmniMMI等基准在主动推理与流式视频理解方向上的深化。另一方面,该数据集暴露的模型短板,如视觉提示遵循不足、长期记忆有限、延迟响应失败等,反过来促进了全模态模型架构的改进,例如增强的上下文压缩技术、多模态指令微调策略以及针对交互场景的推理框架。此外,其开放式的评分协议(惩罚冗余与幻觉)也启发了更精细的自动评估模型研究,形成了良性循环的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务