遇见数据集

GuideMe

收藏
github2026-07-13 更新2026-07-14 收录
数据链接:
官方服务:

资源简介:

GuideMe是首个支持多领域流视频任务指导的基准数据集,用于训练和评估多模态大语言模型的闭环交互任务指导能力,涵盖指令、反馈、错误检测和纠正等维度。数据集包含2,458个视频实例,总时长223.7小时,产生47,775个流式交互样本,覆盖烹饪、物体操作、日常生活指导和健身四个任务领域。视频长度从0.5到41.2分钟不等(平均5.5分钟,中位数3.6分钟)。数据集分为GuideMe-Train(1,985个视频,177.0小时)和GuideMe-Test(473个视频,46.7小时)两部分。每个交互样本涵盖四种指导类型之一:下一步指令、完成反馈、错误检测和纠正指导。

GuideMe is the first benchmark dataset supporting multi-domain streaming video task guidance, designed to train and evaluate the closed-loop interactive task guidance capabilities of multimodal large language models, covering dimensions such as instructions, feedback, error detection and correction. The dataset contains 2,458 video instances with a total duration of 223.7 hours, generating 47,775 streaming interactive samples, covering four task domains: cooking, object manipulation, daily life guidance, and fitness. The video lengths range from 0.5 to 41.2 minutes, with an average of 5.5 minutes and a median of 3.6 minutes. The dataset is split into two subsets: GuideMe-Train (1,985 videos, 177.0 hours) and GuideMe-Test (473 videos, 46.7 hours). Each interactive sample falls into one of four guidance types: next-step instructions, completion feedback, error detection, and correction guidance.

创建时间:
2026-06-29
原始信息汇总

数据集概述:GuideMe

GuideMe 是首个面向流式视频的多领域任务指导与干预基准数据集,旨在评估多模态大语言模型(MLLMs)在闭环交互式任务指导场景中的表现,涵盖指令提供、反馈、错误检测与纠正等完整流程。

数据集规模与组成

  • 总视频实例:2,458个
  • 总时长:223.7小时
  • 流式交互样本数:47,775个
  • 视频时长范围:0.5分钟至41.2分钟(平均5.5分钟,中位数3.6分钟)

数据划分

子集 视频数量 时长(小时) 说明
GuideMe-Train 1,985 177.0 用于任务特定适配或微调
GuideMe-Test 473 46.7 留出测试集,用于所有评估

任务领域

涵盖四个任务领域:

  • 烹饪
  • 物体操作
  • 日常生活指导
  • 健身

交互样本类型

每个交互样本涵盖以下四种指导类型之一:

  • 下一步指令(Next-step instructions)
  • 完成反馈(Completion feedback)
  • 错误检测(Error detection)
  • 纠正指导(Corrective guidance)

评估框架

包含三方面评估体系,共同衡量:

  • 序列级对齐(Sequence-level alignment)
  • 干预时机(Intervention timing)
  • 内容质量(Content quality)

发布信息

  • 相关代码与数据正在整理中,即将发布。
  • 论文发表于 ECCV 2026,预印本可在 arXiv 获取:
    • 论文地址:https://arxiv.org/abs/2607.02991
    • 项目主页:https://fawnliu.github.io/project/guideme/
搜集汇总
数据集介绍
GuideMe 数据集图片
构建方式
GuideMe数据集是首个面向流式视频的闭环交互任务引导基准,旨在评估多模态大语言模型在实时过程监控中的表现。该数据集涵盖烹饪、物体操作、日常引导和健身四个领域,共包含2458个视频实例,总时长223.7小时,生成47775个流式交互样本。数据划分为训练集(1985个视频,177.0小时)和测试集(473个视频,46.7小时),每个交互样本对应四种引导类型:下一步指令、完成反馈、错误检测和纠正性引导。构建过程注重模拟真实场景中助手需持续监控用户动作、决定何时保持沉默并适时提供指导的闭环交互范式。
特点
GuideMe数据集的独到之处在于其系统性覆盖了任务指导的完整闭环维度,包括指令、反馈、错误检测与纠正,弥补了先前程序性视频数据集仅部分支持此类能力的不足。数据集基于流式视频设计,视频时长从0.5分钟到41.2分钟不等,平均5.5分钟,反映了现实任务的时间跨度。其多领域特性(烹饪、操作、日常引导、健身)赋予了评测在多样化场景下的泛化能力。与此配套的三方面评估框架(序列级对齐、干预时机与内容质量)共同揭示了现有MLLMs虽精于提供指令,却在错误识别与纠正性反馈方面存在显著短板。
使用方法
GuideMe数据集目前正在整理并即将发布,代码与数据预计将在GitHub仓库中开放下载。使用者可采用训练集(GuideMe-Train)进行任务特定微调或领域适应,评估则在测试集(GuideMe-Test)上进行,涵盖所有四种引导类型的交互样本。推荐结合官方提供的三方面评估框架,从序列级对齐、干预时机与内容质量三个维度对模型进行全面评测。用户可通过项目页面或arXiv论文获取详细使用说明,并期待后续文档与基准代码的公开。
背景与挑战
背景概述
GuideMe数据集由香港城市大学刘芳等研究者于2026年创建,旨在填补多模态大语言模型在实时流式视频任务指导领域的研究空白。现有视频理解基准多聚焦于离线场景,而诸如烹饪、物体操作、日常指导及健身等动态任务中,用户需要模型具备持续监控、错误检测与实时纠正的闭环交互能力。该基准涵盖2,458个视频实例,总时长223.7小时,提供了47,775个流式交互样本,覆盖指令、反馈、错误检测与纠正四类指导类型。其三维评估框架——序列对齐、干预时机与内容质量——为衡量模型在真实场景中的表现提供了新标杆,已对实时任务指导领域产生重要影响。
当前挑战
GuideMe所解决的领域挑战在于:现有多模态模型虽在离线视频理解中表现优异,但无法胜任需闭环交互的实时任务指导,尤其是难以在流式视频中精准识别用户执行错误并给出纠正反馈。构建过程面临多重挑战:首先,需从烹饪、物体操作等四个领域采集并标注长达41.2分钟的视频,确保错误场景的多样性;其次,设计涵盖沉默判断、多类型指导输出的交互样本标注体系极具难度;最后,需构建同时衡量序列对齐、干预时机与内容质量的评估标准,以客观反映模型在真实监控中的缺陷。
常用场景
经典使用场景
GuideMe数据集专为多领域流式视频场景下的闭环任务指导而设计,其经典使用场景涵盖烹饪、物体操作、日常生活指导与健身四大领域。研究者可借助该数据集训练和评估多模态大语言模型,使其具备实时监控用户行为、自主判断沉默时机、提供下一步指令、检测错误并发出纠正反馈的能力。这一场景模拟了真实助手在动态任务执行中持续干预与交互的复杂过程,为流式视频下智能指导系统的研发奠定了关键基础。
解决学术问题
GuideMe数据集有效解决了现有视频理解研究在闭环交互指导上的核心盲区——即模型不仅需理解离线视频,还需在流式场景中实时识别执行错误并提供纠正性反馈。此前,多数过程性视频数据集仅支持部分指导功能,缺乏对指令、反馈、错误检测与纠正这一完整闭环的联合建模。GuideMe填补了这一空白,其三维评估框架(序列对齐、干预时机与内容质量)为系统性衡量模型在真实协作中的表现提供了标准,显著推动了对类人辅助系统完备性的学术探索。
衍生相关工作
围绕GuideMe数据集,已衍生出多类经典工作,包括基于流式视频的错误检测与干预模型、多模态交互式指令生成方法,以及针对干预时机优化的决策算法。这些工作不仅推动了多模态大语言模型向实时交互场景的迁移,还激发了对沉默-干预平衡策略、上下文敏感的反馈生成等前沿课题的研究。此外,该数据集为构建更广泛的任务感知代理系统(如虚拟教练、远程手术辅助)提供了可复用的基准与评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务