OmniInteract
收藏资源简介:
OmniInteract是一个用于实时全模态大语言模型的流式基准测试数据集,包含250个视频和1,430个时间锚定的响应槽。数据集分为1Q1A(1,062个槽/210个视频)和1QnA(368个槽/40个视频)两个互补的分割,涵盖中文日常交互(家庭、健身房、博物馆、购物等)和英语数学推理领域,并包含中断和嵌套交互场景。
OmniInteract is a streaming benchmark dataset for real-time full-modality large language models, comprising 250 videos and 1,430 time-anchored response slots. The dataset is divided into two complementary splits: 1Q1A (1,062 slots / 210 videos) and 1QnA (368 slots / 40 videos). It covers Chinese daily interaction scenarios such as home, gym, museum, shopping and others, as well as English mathematical reasoning domains, and incorporates interrupted and nested interaction scenarios.
数据集总体概述
OmniInteract 是一个面向实时全模态大语言模型(Omnimodal LLMs)的流式基准测试集。它要求模型在持续的音视频流中进行原生在线推理,自主决定是否回应、何时回应以及回应什么,而无法预知未来内容。该基准测试专门评估模型在流式交互场景下的表现,而非传统离线处理。
核心特性
- 原生流式评估:口语查询、视觉事件和背景声音均保留在原始音视频流中,不使用文本提示、预分割片段或离线预读。
- 双互补子集:包含 1Q1A(单次交互)和 1QnA(长时程连续监控)两个子集。
- 交互槽位公式化:将每次交互机会定义为
(触发条件, 响应窗口, 目标答案)三元组,使连续流可被量化评估。 - 交互感知指标:提出IA-QTF1(交互感知质量-及时性F1分数)、IDS(中断诊断套件)和NCCS(嵌套链完成分数)等指标。
- 全双工压力测试:包含192个中断槽位和240个(120对)嵌套槽位,用于测试模型的停止行为、上下文切换和恢复能力。
数据集规模与构成
- 总规模:250个视频,共1,430个带时间锚点的响应槽位。
- 1Q1A子集:210个视频,1,062个槽位。其中638个实时响应、184个主动响应、240个嵌套响应。
- 1QnA子集:40个视频,368个槽位。为长时程连续任务监控场景。
- 中断场景:1Q1A子集中有147个中断,1QnA子集中有45个中断,总计192个。
- 领域覆盖:中文日常生活交互(家庭、健身房、博物馆、购物等)和英文数学推理。
数据子集布局
数据集可从Hugging Face (lucky-lance/OmniInteract)下载,结构如下:
data/ ├── 1q1a/ # 中文日常生活QA,150个视频 │ ├── videos/0001.mp4 ... 0150.mp4 │ ├── annotations/0001.json ... 0150.json │ └── video_json_map.json ├── 1q1a_math/ # 英文数学推理,60个视频 │ ├── videos/0001.mp4 ... 0060.mp4 │ ├── annotations/0001.json ... 0060.json │ └── video_json_map.json └── 1qna/ # 长时程烹饪任务监控,40个视频 ├── videos_bench/ (包含 captaincook4d/ 和 egoper/ 子目录) └── annotations/ (包含 captaincook4d/ 和 egoper/ 子目录)
评估模型与主要发现
该基准测试对四个具有代表性的实时全模态模型进行了评估。官方代码仓库提供了针对每个模型的推理适配器。
| 模型 | 后端 |
|---|---|
| AURA | 本地GPU |
| Gemini 2.5 Flash Live | Google / Vertex AI |
| MiniCPM-o 4.5 | 本地GPU |
| Qwen3.5-Omni Flash Realtime | DashScope API |
主要发现(IA-QTF1指标):
- 1Q1A实时交互最佳模型是Gemini 2.5 Flash Live(得分0.553)。
- 1Q1A主动交互和1Q1A嵌套交互的最佳模型均为MiniCPM-o 4.5(得分分别为0.607和0.599)。
- 1Q1A全局、1QnA和所有全局的最佳模型是AURA(得分0.467)或MiniCPM-o 4.5(全局得分0.368)。
- 长时程1QnA监控对当前所有模型难度最大,得分均低于0.06。
- 许多模型在处理嵌套查询时倾向于永久的上下文切换。
- 中断处理存在明显权衡:Gemini保持沉默多,但溢出少;MiniCPM-o回答更多,却会过度生成。
- MiniCPM-o 4.5的数学推理能力在从离线(0.6833)切换到在线流式(0.3475) 时,质量显著下降(Δ −0.3358),证明强离线推理能力无法直接迁移到原生流式交互中。





