遇见数据集

HowToDIV

收藏
arXiv2025-08-15 更新2025-11-27 收录
数据链接:
官方服务:

资源简介:

HowToDIV数据集是一个大规模的多轮对话数据集,包含507个对话,6636个问答对和24小时的视频剪辑,涵盖了烹饪、机械和种植等多样化的任务。数据集由一个专家和一个新手用户之间的真实对话组成,其中专家一步一步地教授用户如何完成任务。每个对话都伴随着用户视角的视频剪辑,以及每段对话的指令步骤。数据集旨在解决现实世界中任务辅助的需求,为AI代理提供语言视觉模型和代理,以帮助用户完成复杂的、多步骤的任务。

The HowToDIV dataset is a large-scale multi-turn dialogue dataset, containing 507 dialogues, 6636 question-answer pairs, and 24 hours of video clips, covering diverse tasks such as cooking, mechanical operations, and planting. The dataset consists of real dialogues between an expert and a novice user, where the expert teaches the user how to complete the task step by step. Each dialogue is accompanied by video clips from the user's perspective, as well as the instructional steps for each dialogue segment. This dataset aims to address the demand for real-world task assistance, providing language-vision models and AI Agents with resources to help users complete complex, multi-step tasks.

创建时间:
2025-08-15
搜集汇总
数据集介绍
HowToDIV 数据集图片
构建方式
在现实世界的任务辅助场景中,穿戴式设备与AI助手的结合正日益受到关注,然而缺乏大规模、高质量的双人对话-视频数据集成为该领域发展的瓶颈。HowToDIV数据集应运而生,其构建方法别具匠心:研究者利用大型语言模型的强大语言生成能力,提出了一套全自动化的流水线,将单人的教学独白视频转化为双人(专家与新手)的任务引导对话。该流程首先从原始视频及其字幕或步骤注释中提取细粒度的原子化指令列表;随后,通过精心设计的提示工程,引导语言模型模拟新手提问与专家解答的交互过程,生成多轮问答对;最后,依据指令的时间戳信息,从原始视频中精准定位并裁剪出与每一轮用户对话相对应的第一人称视角视频片段。整个构建过程无需任何人工干预,极具成本效益与可扩展性。
特点
HowToDIV数据集展现出三大显著特点。其一,规模与多样性兼具:它包含507段完整对话、6636个问答轮次及总计24小时的视频素材,横跨烹饪、机械维修与植物种植三大领域,涵盖从冲泡咖啡到更换轮胎等9种具体任务。其二,对话结构丰富且贴近真实:数据集精心设计了多种用户风格(简洁型与常规型)与行为模式(正确执行型与犯错纠正型),模拟了新手在任务中可能出现的各类偏差与修正场景,使得对话交互更加自然与复杂。其三,时空对齐精确:每一句用户提问均对应一个视角高度一致的视频片段,平均时长12.5秒,这种细粒度的文本-视频对齐为多模态研究提供了坚实基础,使其成为该领域首个集指令、对话与第一人称视频于一体的规模化数据集。
使用方法
HowToDIV数据集旨在为程序化任务辅助领域的对话系统研究提供标准化评测平台。使用方法上,研究者可将数据集的训练集(355个会话)用于微调多模态大语言模型,使其学习如何根据新手用户的自然语言查询及其所处的第一人称视频环境,生成准确的下一步指导指令。建议使用Gemma-3类模型作为基线,并可采用两种提示策略进行评测:其一为仅提供任务提示的困难模式,考验模型的固有知识与推理能力;其二为提供完整步骤列表的辅助模式,观察模型在明确上下文中的表现。评估指标推荐结合BLEU、ROUGE(衡量文本重合度)与LLM-as-a-Judge评分(评估语义合理性与任务正确性),以全面衡量模型在实时、多轮任务指导中的表现能力。
背景与挑战
背景概述
近年来,通用人工智能代理在辅助人类完成复杂程序性任务方面展现出巨大潜力,然而真实世界中多步骤任务指导所需的人机交互对话数据集却极为稀缺。为填补这一空白,Lavisha Aggarwal等研究人员于2025年提出了HowToDIV数据集,该数据集由Google团队主导构建,旨在将单人口述教学视频自动转化为专家与新手用户之间的双人任务指导对话。研究核心在于利用大语言模型的语言理解与生成能力,从现成的第一人称教学视频中提取指令步骤,进而合成包含用户提问、专家答复及对应视频片段的交互式多轮对话,覆盖烹饪、机械维修与植物栽种等多样领域。HowToDIV包含507段对话、6636组问答对及24小时视频片段,为训练和评估具备实时任务辅助能力的AI代理提供了大规模、低成本的基准资源,显著推动了该方向的研究进展。
当前挑战
HowToDIV数据集所解决的领域问题在于,传统教学视频数据集(如HowTo100M、COIN等)均以单人独白形式呈现,缺乏动态问答与错误纠正交互,无法支撑实时任务辅助系统的训练需求。构建过程中面临的核心挑战包括:其一,如何从仅有语音叙述或步骤标注的教学视频中自动提取原子化、可执行的指令序列,并确保其完整性与准确性;其二,如何设计有效的提示策略,引导大语言模型生成自然、多样且符合任务情境的用户-专家对话,包括用户常规提问、简洁表达以及操作错误等不同场景;其三,如何精准地将对话轮次与原始视频中的视觉片段对齐,实现用户视角下操作画面的实时定位,这对缺乏细粒度时间戳的视频尤为困难。这些挑战共同制约着高质量任务指导对话数据的高效规模化构建。
常用场景
经典使用场景
HowToDIV数据集专为程序性任务辅助场景而设计,其核心应用在于模拟专家与新手之间的多轮教学对话。该数据集通过将单人教学视频自动转化为双人对话,为构建能够实时指导用户完成复杂操作步骤的AI代理提供了基础。研究人员常利用该数据集训练和评估模型在烹饪、机械维修、植物种植等多样化任务中的对话生成能力,涵盖用户遵循指令与犯错纠正两种典型交互情境。
解决学术问题
该数据集有效填补了程序性任务辅助领域缺乏大规模、多轮对话-视频对齐数据集的空白。以往数据集多聚焦于单人口述视频或静态步骤标注,缺乏动态交互式指导的学术研究基础。HowToDIV通过自动生成包含用户错误与修正的对话,解决了现有模型在逐步任务指导中难以跟踪用户状态、及时纠正操作偏差的关键问题,为评估和提升AI代理在真实场景中的辅助能力提供了标准化基准。
衍生相关工作
HowToDIV的出现催生了一系列延伸研究方向,包括基于指令的视频生成和细粒度动作识别等。例如,研究者利用该数据集的对话-视频对齐特性改进VideoCLIP模型的视频检索能力,或通过FramePack技术生成背景一致的训练视频以模拟用户错误场景。此外,数据集支持的大规模多任务对话结构,为训练更鲁棒的LLM微调流程和开发主动式、能处理步骤顺序混乱或用户错误的下一代程序性任务代理提供了重要资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务