遇见数据集

lucky-lance/OmniInteract

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

OmniInteract是一个针对实时全模态大语言模型的流式基准测试,通过其本地在线推理在连续音视频流上进行评估。用户查询和环境声音位于音频轨道,视觉事件位于视频中,模型必须决定是否、何时以及如何响应——无需预知未来内容。该数据集包含250个视频和1,430个时间锚定的响应槽位,分为两个任务:1Q1A(210个视频/1,062个槽位)用于局部单响应交互(实时、主动和嵌套),1QnA(40个视频/368个槽位)用于长时程连续任务监控(一个指令→多个时间锚定答案)。领域涵盖中文日常生活交互(家庭、健身房、博物馆、购物等)和英文数学推理。

OmniInteract is a streaming benchmark for real-time omnimodal LLMs, evaluated through their native online inference over continuous audio-visual streams. User queries and ambient sounds live in the audio track, visual events live in the video, and a model must decide whether, when, and what to respond — without lookahead to future content. The dataset includes 250 videos and 1,430 temporally grounded response slots, with two tasks: 1Q1A (210 videos / 1,062 slots) for localized single-response interaction (real-time, proactive, and nested), and 1QnA (40 videos / 368 slots) for long-horizon continuous task monitoring (one instruction → many time-grounded answers). Domains cover Chinese daily-life interaction (home, gym, museum, shopping, …) and English mathematical reasoning.

提供机构:
lucky-lance
搜集汇总
数据集介绍
lucky-lance/OmniInteract 数据集图片
构建方式
OmniInteract 的构建植根于对实时全模态大语言模型在流式交互场景中能力的评测需求。其数据精心搜集并整理自中文日常生活场景(如家庭、健身房、博物馆、购物等)与英文数学推理任务,共包含 250 段视频,并标注了 1430 个具有时间界限的响应槽位。数据集被划分为 1Q1A 与 1QnA 两大子集:1Q1A 涵盖 210 段视频,专注于定位式单次交互,涵盖实时、主动及嵌套等交互形态;1QnA 则包含 40 段视频,聚焦于需要长期连续监控的任务,每个指令对应多个基于时间点的回答。所有视频均配有精细的时间戳注释,记录问题的出现时间与答案的预期回应时间,并附带场景类型标签(如嵌套或多轮),为模型提供清晰的行为基准。
特点
该数据集最显著的特点在于其对实时交互中关键决策点的刻画:模型必须学会判断‘是否’、‘何时’以及‘如何’做出回应,而非依赖对将来内容的预知。OmniInteract 强调流式、全双工的交互模式,将用户查询与环境音融入音频,视觉事件嵌入视频,迫使模型在无前瞻能力的条件下进行原生在线推理。1Q1A 子集进一步细分出 60 个视频用于探测模型在上下文切换与恢复方面的能力,而数学推理子集则为评估模型跨领域实时响应提供了独特视角。整体上,OmniInteract 提供了 IA-QTF1、IDS、NCCS 等一系列专有评测指标,能全面量化模型在实时全模态交互中的性能。
使用方法
使用时,研究者需从 HuggingFace 获取名为 `data.tar.gz` 的压缩文件,解压后将获得按子集(1q1a、1q1a_math、1qna)组织的视频与注释文件。每个子集内的视频与对应 JSON 注释通过相同编号关联,注释文件包含问题时间、问题文本、答案时间、答案文本、问题类型及是否被中断等字段。1q1a_math 子集还额外提供了指向原始数学题的来源链接。此外,每个子集自带的 `video_json_map.json` 文件汇总了包括场景类型在内的元数据。运行评测时,研究者需参考官方代码仓库的 e2e 流程,完成数据准备、LLM 评分、槽位评分并计算论文中的核心指标,从而复现标准化的评估结果。
背景与挑战
背景概述
随着多模态大语言模型在实时交互场景中的需求日益增长,评估模型在连续音视频流中的在线推理能力成为关键挑战。OmniInteract数据集由Xudong Lu、Xueying Li等来自多家机构的研究人员于2026年创建,旨在填补现有多模态基准测试在流式实时交互评估方面的空白。该数据集聚焦于全双工、流式、真时的全模态助手场景,要求模型在持续到来的音频和视频流中自主决定是否响应、何时响应以及如何响应,涵盖中文日常生活(如家庭、健身、购物等)与英文数学推理两大领域。通过250个视频、1430个时间锚定的响应槽位,OmniInteract为评估模型在复杂时序交互中的表现提供了标准化测试工具,对推动实时多模态AI助手的发展具有重要影响力。
当前挑战
OmniInteract所解决的领域核心挑战在于实时多模态交互中的流式决策问题:传统多模态基准多基于完整上下文进行离线评估,而真实场景下模型必须处理无前瞻性的连续音视频流,需同时应对音频中的用户查询、环境音以及视频中的视觉事件,并在此条件下实现高效、准确的响应决策。在数据集构建过程中,挑战体现在如何设计覆盖多类实时交互场景的标注方案,包括单次响应(1Q1A)与长时任务监测(1QnA)两种模式,以及嵌套上下文切换、多轮对话等复杂场景的类型划分。此外,在时间锚定注释的精确性、多语言数据平衡(中英文)以及确保标注的一致性方面也面临显著困难,最终需要构建完整的评估管道(IA-QTF1、IDS、NCCS等指标)以可靠衡量模型性能。
常用场景
经典使用场景
在人机交互领域,实时全模态大语言模型的评估一直缺乏贴近真实世界的标准化基准。OmniInteract数据集正是为此而生,它模拟了连续音视频流中的流式交互场景,要求模型在无法预知未来内容的前提下,自主判断何时、是否以及如何作出回应。该数据集被广泛用于评测模型在动态、非结构化环境中的实时响应能力,特别是在包含日常中文交互与英文数学推理的多样化任务中,成为检验全模态模型流式推理能力的经典标杆。
衍生相关工作
围绕OmniInteract数据集,研究者已衍生出多项开创性工作。其提出的IA-QTF1、IDS与NCCS等流式评测指标,被后续多个全模态模型用于验证在线推理性能。基于该数据集的“1Q1A”与“1QnA”任务设计,激发了关于中断恢复策略、长程任务记忆机制以及音视频时间对齐方法的深入研究。此外,公开的评估代码仓库不仅复现了论文结果,还为社区贡献了一套标准化的流式交互评测流程,成为实时全模态研究的重要基准参考。
数据集最近研究
最新研究方向
OmniInteract致力于构建面向全模态流式交互的评测基准,聚焦于实时多模态大语言模型在连续音视频流中的在线推理能力。该方向深入探索模型在无前瞻条件下自主判断‘是否、何时、如何’响应的核心挑战,通过1Q1A与1QnA两种任务范式,分别模拟单次实时交互与长时连续监控场景。其独特价值在于将流式处理、全双工对话与时序敏感的多模态理解融为一体,为下一代环境感知型智能助手在日常生活场景中的落地提供了关键评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务