遇见数据集

OmniInteract

收藏
github2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

OmniInteract是一个用于实时全模态大语言模型的流式基准测试数据集,包含250个视频和1,430个时间锚定的响应槽。数据集分为1Q1A(1,062个槽/210个视频)和1QnA(368个槽/40个视频)两个互补的分割,涵盖中文日常交互(家庭、健身房、博物馆、购物等)和英语数学推理领域,并包含中断和嵌套交互场景。

OmniInteract is a streaming benchmark dataset for real-time full-modality large language models, comprising 250 videos and 1,430 time-anchored response slots. The dataset is divided into two complementary splits: 1Q1A (1,062 slots / 210 videos) and 1QnA (368 slots / 40 videos). It covers Chinese daily interaction scenarios such as home, gym, museum, shopping and others, as well as English mathematical reasoning domains, and incorporates interrupted and nested interaction scenarios.

创建时间:
2026-05-29
原始信息汇总

数据集总体概述

OmniInteract 是一个面向实时全模态大语言模型(Omnimodal LLMs)的流式基准测试集。它要求模型在持续的音视频流中进行原生在线推理,自主决定是否回应、何时回应以及回应什么,而无法预知未来内容。该基准测试专门评估模型在流式交互场景下的表现,而非传统离线处理。

核心特性

  • 原生流式评估:口语查询、视觉事件和背景声音均保留在原始音视频流中,不使用文本提示、预分割片段或离线预读。
  • 双互补子集:包含 1Q1A(单次交互)和 1QnA(长时程连续监控)两个子集。
  • 交互槽位公式化:将每次交互机会定义为(触发条件, 响应窗口, 目标答案)三元组,使连续流可被量化评估。
  • 交互感知指标:提出IA-QTF1(交互感知质量-及时性F1分数)、IDS(中断诊断套件)和NCCS(嵌套链完成分数)等指标。
  • 全双工压力测试:包含192个中断槽位和240个(120对)嵌套槽位,用于测试模型的停止行为、上下文切换和恢复能力。

数据集规模与构成

  • 总规模:250个视频,共1,430个带时间锚点的响应槽位。
  • 1Q1A子集:210个视频,1,062个槽位。其中638个实时响应、184个主动响应、240个嵌套响应。
  • 1QnA子集:40个视频,368个槽位。为长时程连续任务监控场景。
  • 中断场景:1Q1A子集中有147个中断,1QnA子集中有45个中断,总计192个。
  • 领域覆盖:中文日常生活交互(家庭、健身房、博物馆、购物等)和英文数学推理。

数据子集布局

数据集可从Hugging Face (lucky-lance/OmniInteract)下载,结构如下:

data/ ├── 1q1a/ # 中文日常生活QA,150个视频 │ ├── videos/0001.mp4 ... 0150.mp4 │ ├── annotations/0001.json ... 0150.json │ └── video_json_map.json ├── 1q1a_math/ # 英文数学推理,60个视频 │ ├── videos/0001.mp4 ... 0060.mp4 │ ├── annotations/0001.json ... 0060.json │ └── video_json_map.json └── 1qna/ # 长时程烹饪任务监控,40个视频 ├── videos_bench/ (包含 captaincook4d/ 和 egoper/ 子目录) └── annotations/ (包含 captaincook4d/ 和 egoper/ 子目录)

评估模型与主要发现

该基准测试对四个具有代表性的实时全模态模型进行了评估。官方代码仓库提供了针对每个模型的推理适配器。

模型 后端
AURA 本地GPU
Gemini 2.5 Flash Live Google / Vertex AI
MiniCPM-o 4.5 本地GPU
Qwen3.5-Omni Flash Realtime DashScope API

主要发现(IA-QTF1指标)

  • 1Q1A实时交互最佳模型是Gemini 2.5 Flash Live(得分0.553)。
  • 1Q1A主动交互1Q1A嵌套交互的最佳模型均为MiniCPM-o 4.5(得分分别为0.607和0.599)。
  • 1Q1A全局1QnA所有全局的最佳模型是AURA(得分0.467)或MiniCPM-o 4.5(全局得分0.368)。
  • 长时程1QnA监控对当前所有模型难度最大,得分均低于0.06。
  • 许多模型在处理嵌套查询时倾向于永久的上下文切换
  • 中断处理存在明显权衡:Gemini保持沉默多,但溢出少;MiniCPM-o回答更多,却会过度生成。
  • MiniCPM-o 4.5的数学推理能力在从离线(0.6833)切换到在线流式(0.3475) 时,质量显著下降(Δ −0.3358),证明强离线推理能力无法直接迁移到原生流式交互中。
搜集汇总
数据集介绍
OmniInteract 数据集图片
构建方式
在愈发成熟的多模态大语言模型研究中,实时流式交互能力正成为面向真实场景应用的关键瓶颈。为填补这一评测空白,研究者构建了OmniInteract基准数据集。该数据集包含250段视频及1430个精准对齐的响应槽(Response Slot),以持续音视频流为载体,模拟用户日常生活中的中文交互与英文数学推理场景。视频中的语音查询、环境音与视觉事件均保留于原始未分割的流中,模型需在无未来内容预判的条件下自主决定何时、是否及如何回应。数据集设计了两种互补的测试划分:1Q1A涵盖即时响应、主动干预与嵌套式问答共计1062个交互槽,聚焦局部单轮交互;1QnA则包含368个槽,聚焦长时间连续任务监控场景。每个交互槽被形式化为(触发时刻,响应窗口,目标答案)三元组,从而在保留流式时序结构的前提下,实现对连续响应机遇的精确度量。
特点
OmniInteract数据集的核心特色在于其对全双工流式交互复杂性的系统化揭示。首创交互感知度量体系,IA-QTF1兼顾内容质量与时间性,综合评估模型在流式场景中的表现;IDS中断诊断套件从无应答率、部分应答质量、语意泄露与沉默溢出四个维度精细刻画模型被中断时的行为;NCCS则专门评估嵌套问答链条的完成能力。数据集精心编排了192个中断槽与240个嵌套槽,用以探查模型在用户打断时的停止行为与上下文切换恢复能力。评测发现,长时程1QnA监控是所有设置中最为困难的任务,四个模型得分均低于0.06;嵌套查询中,Gemini在120个嵌套对中有119个丢失外层查询,而MiniCPM-o与AURA则表现出更可靠的恢复能力;数学推理场景中,离线推理准确率0.6833急剧下降至在线流式交互的0.3475,揭示出强离线能力与原生流式交互表现之间的严峻鸿沟。
使用方法
使用该数据集时,研究者需首先通过Hugging Face下载数据并解压至指定目录,随后根据所评估模型选择对应的推理适配器。数据布局将视频与标注文件以扁平的子集形式组织,1Q1A与1Q1A_MATH子集各自配有video_json_map.json索引文件,用于标注视频的场景类型(嵌套或多轮)。评估流程通过统一评测流水线分三个阶段执行:数据准备阶段利用ASR模型与强制对齐器生成精确的时序转录;评分阶段调用LLM裁判对模型输出进行内容与时效性的联合判别;最终汇总获得论文表格中IA-QTF1、IDS与NCCS等关键指标。提供的批处理启动脚本支持断点续跑与多GPU并行推理,并可通过环境变量灵活配置ASR路径、裁判模型与API密钥等参数,确保评测的可复现性与易用性。
背景与挑战
背景概述
随着多模态大语言模型在实时人机交互领域的迅猛发展,如何对模型在连续视听流中自主判断响应时机与内容的综合能力进行可靠评估,成为学界与工业界共同面临的关键瓶颈。在此背景下,来自香港中文大学MMLab、上海交通大学、南洋理工大学、麦克马斯特大学、香港城市大学及江西财经大学等机构的Xudong Lu、Xueying Li等研究者于2025年提出了OmniInteract基准数据集。该数据集专为实时全模态助手的流式交互评测而设计,包含250段视频与1430个时间对齐的响应槽,涵盖单轮交互与长时任务监控两大场景,创新性地将响应机会建模为“触发-窗口-目标答案”三元组,并引入IA-QTF1、IDS及NCCS等多维度度量标准。OmniInteract的出现填补了现有评测体系中缺乏面向真实世界流式交互场景的标准化评估框架的空白,为全模态模型从离线推理能力向在线交互能力的转化提供了关键验证平台,显著推动了该领域的规范化发展。
当前挑战
OmniInteract基准所聚焦的核心挑战之一在于实时全模态交互领域的独特复杂性:模型必须在不具备未来内容预知能力的条件下,于连续视听流中独立决策是否响应、何时响应以及如何响应,这对传统的分段式评测范式构成了根本性突破。更为棘手的是,在构建过程中面临的三大技术挑战:其一,如何设计同时涵盖实时主动响应、中断恢复及嵌套对话的交互槽结构,使其既能度量内容准确性又能捕捉时间敏感性;其二,需要解决长时程任务监控场景下模型持续性注意力维持的评估难题,实验揭示所有被测模型在该设定下的IA-QTF1得分均低于0.06,暴露出当前技术的显著短板;其三,全双工压力测试中中断与嵌套槽的时序对齐问题尤为严峻,不同模型在响应后溢出时长与静默策略间表现出明显权衡,且离线强推理能力向流式场景迁移时性能出现超过33%的大幅衰减,进一步凸显了真实的流式交互环境对模型设计带来的全新挑战。
常用场景
经典使用场景
OmniInteract作为首个面向实时全模态大语言模型的流式交互基准,其最经典的使用场景在于评估模型在持续音视频流中的原生在线推理能力。该数据集精心设计了两种互补的子集:1Q1A聚焦于局部单次交互,涵盖实时响应、主动触发与嵌套对话;1QnA则模拟长时间跨度的连续任务监控,如烹饪流程监督。评估过程中,模型必须在不预知未来内容的前提下,自主判断是否响应、何时响应以及如何回应,完美复现了真实世界中人与AI助手进行全双工流式对话的复杂生态。
实际应用
在实际应用层面,OmniInteract深刻映射了智能助手从静态问答向动态环境感知演进的迫切需求。日常生活中,用户期望AI能够通过摄像头和麦克风实时感知烹饪进度、健身动作或购物环境,并在适当时机主动提供指导、监测异常或回答突发问题。该数据集所模拟的场景,如用户一边执行任务一边与AI进行嵌套对话、系统在被中断后迅速恢复上下文的交互范式,直接对标了智能眼镜、车载助手、家居机器人等前沿产品在真实部署中必须攻克的全双工流式互动难关,为工业界优化实时交互体验提供了关键评估依据。
衍生相关工作
OmniInteract的问世催生了一系列围绕流式全模态评估的衍生研究方向。基于该基准提供的标准化评测框架,研究者可以系统对比不同模型在中断处理上的策略差异,探究VAD阈值、缓冲机制与生成长度对交互质量的影响,从而衍生出专门的鲁棒中断处理算法。此外,数据集揭示的离线推理能力与在线流式表现之间的显著鸿沟,直接激发了针对实时场景的模型轻量化与自适应生成技术研究。嵌套链完成分数这一创新指标,也为设计具备长程上下文感知与灵活切换能力的对话系统开辟了新的优化路径,推动学界构建更契合人类自然通信习惯的下一代AI交互架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务