遇见数据集

Omni-DuplexEval

收藏
github2026-05-19 更新2026-05-26 收录
官方服务:

资源简介:

Omni-DuplexEval是一个用于评估实时双工全模态交互的数据集,包含实时描述和主动提醒两个任务家族。数据集使用统一字段,包括样本ID、问题文本、答案参考、提醒时间戳、视频类型、视频时长、视频文件和问题音频等。

Omni-DuplexEval is a dataset for evaluating real-time duplex full-modal interaction. It encompasses two task families: real-time description and active reminder. The dataset adopts uniform fields, including sample ID, question text, reference answer, reminder timestamp, video type, video duration, video file, question audio, and so on.

创建时间:
2026-05-15
原始信息汇总

数据集概述

Omni-DuplexEval 是一个面向实时双工全模态交互的评估基准,专注于评价模型在实时描述与主动提醒两类任务上的能力。该数据集通过 Hugging Face 平台发布,并配套提供了完整的评估脚本。

核心任务

Omni-DuplexEval 包含两大评估系列:

  1. 实时描述 (Real-time Description):评估模型随时间变化的描述能力,着重考察时序敏感性和内容准确性。
  2. 主动提醒 (Proactive Reminder):评估模型在事件发生前、事件发生后以及纠正式主动响应场景下的能力。

数据格式

数据集采用统一字段结构,每个样本包含:

字段 说明
id 样本唯一标识符
question_text 指令文本
answer1 纠正参考或第一个实时描述参考
answer2 第二个实时描述参考(若存在)
reminder1 第一个提醒时间点(秒,若存在)
reminder2 第二个提醒时间点(秒,若存在)
video_type 源视频类型
video_duration 视频时长(秒)
video 视频文件
question_audio 指令音频

使用方式

  • 评估脚本:提供单样本和批量两种模式,支持实时描述和主动提醒任务的评估。
  • 模型响应格式:评估脚本假定模型响应已预先以 JSON 格式生成,每条响应包含 sentence / text 和对应的时间戳字段。
  • 环境要求:需 Python 3.10+、Linux 系统、ffmpeg/ffprobe 工具及兼容 OpenAI 的聊天补全 API 端点。
  • 数据加载:批量脚本通过 Hugging Face datasets.load_dataset 直接读取数据集。
  • 输出结果:每个样本输出包含元数据、输入、逐事件/逐语句评判、总结分数及耗时的 JSON 文件;批量脚本额外生成汇总摘要文件。

重要说明

  • 包含内容:评估提示词、评分逻辑、单样本脚本、批量脚本、数据集访问指令及精确命令。
  • 不包含内容:模型推理或基线生成代码。评估脚本仅用于评估已生成的响应 JSON 文件,模型推理需使用各模型的开源代码库独立完成。
搜集汇总
数据集介绍
Omni-DuplexEval 数据集图片
构建方式
Omni-DuplexEval数据集围绕全模态实时双工交互评价这一前沿课题,系统性地构建了两大评估任务族:实时描述与主动提醒。在实时描述任务中,数据集通过为每一样本配备两段标准参考描述以及对应的视频和音频指令,以支持对模型输出在时间敏感性和内容准确性上的双重评估。主动提醒任务则进一步细分为事件发生前提醒、事件发生后提醒及纠正式主动响应三种子场景,每个样本均标注了精准的提醒时间戳和纠正参考文本。所有样本采用统一的字段结构,涵盖样本标识、指令文本、视频类型与时长、视频文件、指令音频等关键要素,为后续模型评估提供了标准化的数据基础。
使用方法
使用Omni-DuplexEval进行评估时,用户需先基于预定义的响应格式(包含句子文本及其起止时间戳)生成模型输出,并保存为JSON文件。随后,可调用单样本脚本对单个视频和响应进行精细评估,或利用批次脚本对整个HuggingFace数据集分片进行高效批量处理。运行前需配置符合OpenAI聊天补全格式的评估器API,并确保环境安装有ffmpeg等依赖。评估结束后,系统会输出每个样本的细粒度评分与汇总统计结果,帮助研究者全面衡量模型在实时双工交互场景下的综合表现。
背景与挑战
背景概述
随着全模态交互技术的迅猛发展,实时双工交互能力成为衡量智能系统自然交互水平的关键指标。Omni-DuplexEval由Chaoqun He、Mingyang Xiang等研究者于2026年提出,旨在系统性地评估智能体在实时双工全模态交互场景中的表现,涵盖实时描述与主动提醒两大核心任务。该基准继承了全模态交互领域对多模态感知与实时响应的需求,通过细粒度的时间敏感性分析和内容准确性评估,为相关研究提供了标准化的评测框架。其影响力在于填补了实时双工交互评估领域的空白,推动了全模态智能体从静态任务处理向动态实时交互的范式转变,为未来人机共生系统的发展奠定了重要基础。
当前挑战
该基准所解决的领域挑战在于实时双工交互中对时间敏感且多模态融合的评估难题,现有方法难以同时兼顾实时描述的时序准确性与主动提醒的任务契合度。构建过程中面临的挑战包括:如何设计统一的数据字段以兼容视频、音频、指令文本等多种模态信息,如何构建高质量的双参考标准(如answer1与answer2)以支撑对比评估,以及如何精确标注提醒时间戳(reminder1与reminder2)以衡量模型的时间定位能力。此外,跨时间窗口的事件关联分析要求评估脚本具备高并行处理能力,同时避免过度消耗计算资源,这对数据采样策略和批处理流程提出了严峻考验。
常用场景
经典使用场景
Omni-DuplexEval基准数据集专为评估多模态交互系统中实时双工能力而设计,广泛应用于衡量智能体在动态视频流中的实时描述生成与主动提醒任务。其经典使用场景包括:让模型观看连续视频片段,同时输出与时间轴同步的叙述性文字(如“现在有人推门进入”),并检测事件触发时的主动干预能力(例如在预设时间点提醒用户“杯子已被拿起”)。研究者利用该数据集统一字段结构(视频、音频指令、时间戳标注)和标准化的评估脚本,对模型的时序敏感性、内容准确性及多模态融合质量进行定量打分,从而系统评测模型在接近人类对话节奏下的双工交互表现。
解决学术问题
该数据集解决了实时全双工多模态交互评估中缺乏统一、标准化基准的学术瓶颈。此前研究多聚焦于离线或单轮问答场景,难以度量模型在流式视频输入下同步理解、生成与主动干预的时序契合能力。Omni-DuplexEval通过引入带有精确时间戳的事件提醒参考和双流实时描述标准答案,首次实现了对模型“何时说、说什么、如何纠错”三个维度的联合评测,填补了动态视频流与语音指令交织场景下交互质量度量体系的空白。其提出的评价指标为后续研究提供了可复现的对比基线,推动了实时多模态交互技术从定性展示向定量比较的范式转变。
实际应用
在实际应用中,Omni-DuplexEval为智能助手、自动驾驶的实时路况播报、远程医疗的手术过程解说、以及增强现实设备中的环境导览等场景提供了关键的测试基准。例如,搭载了该评估系统的虚拟助理需能一边观察用户生活视频,一边在关键时刻主动发出提醒(如“你忘记关水龙头了”),或即时修正先前对画面的误解(如纠正“船体是黑色的”为“船体是白色的”)。通过Omni-DuplexEval的评分结果,开发者可精准定位模型在时序对齐、主动服务意识及纠错灵敏度等方面的短板,从而优化产品体验,提升人机协作的自然流畅度。
数据集最近研究
最新研究方向
在多模态交互技术迅猛发展的当下,全模态实时双工交互系统面临评估基准缺失的挑战。Omni-DuplexEval数据集正是为填补这一空白而生,它聚焦于两个前沿评估任务:实时描述的时间敏感性与内容准确性,以及主动提醒的即时性与修正能力。该基准通过精细的时序标注和双参考对比机制,首次系统性地度量模型在动态视频流中实时理解与双向交互的效能。随着虚拟现实和智能助理对低延迟、高情境感知能力的需求日益迫切,Omni-DuplexEval为比较各类多模态大模型在真实双工场景下的表现提供了标准化平台,其影响在于推动了从静态问答向动态实时互动的范式转变,对新一代人机共融系统的研发具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务