OmniAssistBench
收藏资源简介:
OmniAssistBench是一个面向全模态大语言模型助理式交互能力的评估基准,由南京大学、南开大学和滑铁卢大学联合构建。该数据集包含300个视频、685个问答对,视频时长平均182秒,覆盖生活家居、美食烹饪、科技DIY等六大日常场景。数据集通过逆向工程现有互联网视频,结合专家设计的先验知识路径和手动视频编辑,模拟多轮人机交互过程。旨在评估模型在基础感知(如社会关系理解、手势跟随)和高级目标导向任务(如过程跟踪、主动响应)中的表现,解决当前模型在视觉提示跟随、长期记忆和延迟响应方面的瓶颈。
OmniAssistBench is an evaluation benchmark for the assistant-style interactive capabilities of multi-modal large language models, jointly constructed by Nanjing University, Nankai University and the University of Waterloo. This dataset contains 300 videos and 685 question-answer pairs, with an average video duration of 182 seconds, covering six daily scenarios such as home living, food cooking, technology DIY and others. It simulates multi-round human-computer interaction processes by reverse engineering existing online videos, combining expert-designed prior knowledge paths and manual video editing. This benchmark aims to evaluate model performance in basic perception tasks (e.g., social relationship understanding, gesture following) and advanced goal-oriented tasks (e.g., process tracking, proactive response), addressing current bottlenecks of existing models in visual prompt following, long-term memory and delayed response.
OmniAssistBench 数据集详情
数据集简介
OmniAssistBench 是一个用于评估全模态大语言模型(Omni-LLMs)在助手式交互场景中表现的新型基准测试集。该数据集解决了传统视频理解评估中无法适应助手模型动态响应的挑战,通过精心设计的注释流程,构建了模拟真实助手交互的多轮对话测试样本。
任务设计
数据集采用两层任务框架,全面覆盖真实世界应用中助手所需的关键能力:
基础层(Basic Tier)
聚焦核心感知和多模态指令跟随能力,包含以下7个细粒度任务:
- 社交感知:身份识别(II)、对话对象识别(AI)、复杂情绪理解(CE)
- 时间感知:事件检索(ER)、外观顺序感知(AO)、动态计数(DC)
- 指称感知:动作指称感知(AR)、语言指称感知(LR)
- 非音频提示跟随:手势提示跟随(GPF)、OCR提示跟随(OPF)
高级层(Advanced Tier)
评估交互助手所需的高阶能力,包含:
- 上下文感知响应(CR)
- 主动响应:单事件触发响应(SER)、多事件触发响应(MER)
- 过程追踪:单任务追踪(ST)、多任务追踪(MT)、多任务多线程追踪(CT)
数据规模与多样性
- 总计 685 个开放式问答对
- 覆盖 7 个主要任务类型和 16 个细粒度任务
- 视频领域涵盖运动、烹饪、讲座、DIY、脱口秀等日常主题
- 包含3个真实世界案例,平均每个案例包含 15 个交互轮次
数据格式
- 采用开放式问答格式,包含视频片段、用户问题(嵌入视频中)、标准答案及其关键要点
- 用户问题以真实音频或打字/手写形式嵌入视频
- 采用多轮交互格式模拟在线交互,用户提示始终位于每个视频片段的末尾,当前轮次视频从上轮结束处开始
注释流程
采用4阶段注释流程,由人工专家严格标注:
- 基于情节的原始视频收集:专家与LLM协作构思挑战特定能力的关键场景
- 问答设计与用户目标设计:每条样本包含标准答案句和1-3个关键要点短语
- 视频编辑:包括平衡视频长度、嵌入用户提示、嵌入用户目标、剪辑多轮交互片段
- 质量优化:使用先进MLLM评估注释完整性,人工验证并补充替代参考答案
每条样本平均耗时约 4小时,整个数据集构建总耗时超过 900小时。
评测结果
数据集采用LLM-as-a-Judge流程,评分范围为0-5分(归一化至0-100分)。当前模型表现排名前三的为:
| 排名 | 模型 | 总分 (/100) |
|---|---|---|
| 1 | Gemini-3-Pro | 66.4 |
| 2 | Gemini-2.5-Pro | 64.6 |
| 3 | Doubao-Seed-2.0-lite | 57.3 |
结论:即使最先进的商业Omni-LLM也仅能提供部分正确的答案,表明全模态模型在成为可靠的真实世界助手前仍有较大提升空间。




