遇见数据集

微软研究院多模态对齐食谱语料库

收藏
arXiv2020-05-20 更新2024-06-21 收录
官方服务:

资源简介:

微软研究院多模态对齐食谱语料库是一个包含约15万对食谱对齐关系的数据集,涵盖4,262种不同的菜肴。该数据集通过自动对齐来自网络的文本和视频食谱,提供了丰富的常识性信息,如食材和烹饪步骤的替代描述。创建过程中,研究团队首先使用无监督算法学习不同食谱间的对齐关系,然后通过图算法实现多文本和多视频食谱的联合对齐。该数据集的应用领域包括自然语言处理、计算机视觉和机器人技术,旨在帮助机器理解和执行日常任务,如烹饪等。

The Microsoft Research Multimodal Alignment Recipe Corpus is a dataset containing approximately 150,000 pairs of recipe alignment relationships, covering 4,262 distinct dishes. By automatically aligning text and video recipes sourced from the web, this dataset provides rich commonsense information, including alternative descriptions for ingredients and cooking procedures. During its creation, the research team first used unsupervised algorithms to learn alignment relationships between different recipes, then employed graph algorithms to achieve joint alignment of multiple text and video recipes. The application fields of this dataset include natural language processing, computer vision and robotics, aiming to help machines understand and perform daily tasks such as cooking.

提供机构:
微软研究院
创建时间:
2020-05-20
搜集汇总
数据集介绍
微软研究院多模态对齐食谱语料库 数据集图片
构建方式
该数据集基于一种创新的两阶段无监督对齐算法构建。首先从Common Crawl和YouTube中分别提取文本与视频食谱,涵盖4262道菜肴,共获取48,852条文本食谱和77,550条视频食谱。通过词级IBM1模型与隐马尔可夫模型学习食谱间的成对对齐,随后利用最大生成树算法在菜肴层面推导出多条文本与视频食谱的联合对齐。数据集包含约150,000组成对对齐,并附有常识性信息,如文本与视觉释义以及单步至多步的分解。
特点
该数据集的核心特点在于其多模态与跨源对齐能力。它巧妙地将文本与视频食谱中顺序各异、措辞不同的指令进行语义匹配,揭示了食材替换、步骤重排等深层常识。数据集不仅提供成对与联合对齐,还提取了超过35万条文本释义和21万条文本-视频释义,以及5,592个单步至多步分解实例。这些丰富的对齐信息为理解现实世界程序性任务的多样性和灵活性提供了宝贵的资源。
使用方法
研究者可直接利用发布的成对与联合对齐来训练模型,例如学习在给定食材或烹饪方法约束下的食谱重写。文本与视觉释义可用于提升文本相似度计算、图像与视频描述生成以及动作识别等任务的性能。单步至多步分解则有助于研究任务简化,对机器人学习复杂操作具有重要价值。数据集中的视频食谱以YouTube链接和对应时间戳形式提供,便于直接访问原始视频内容进行进一步分析。
背景与挑战
背景概述
在人工智能领域,理解并执行日常生活中的程序性任务一直是研究的前沿方向。尽管机器在棋类游戏等封闭环境中取得了显著进展,但在诸如烹饪等开放世界的多模态任务中,算法仍面临巨大挑战。为此,微软研究院的研究人员Angela S. Lin、Sudha Rao等人在2020年创建了微软研究院多模态对齐食谱语料库。该数据集旨在解决跨模态程序性数据的对齐问题,通过无监督算法将来自网络的海量文本食谱与视频食谱进行对齐,覆盖了4262道菜肴,生成了约15万对成对对齐结果。这一工作为语言、视觉与机器人技术的交叉研究提供了宝贵的常识性知识资源,推动了程序性任务理解的发展。
当前挑战
该数据集面临的挑战主要体现在两个方面。其一,所解决的领域问题在于,不同食谱在指令顺序和食材使用上存在显著差异,且视频指令往往包含大量噪声和非指导性内容,与文本指令的信息粒度不一,使得跨模态对齐极具难度。其二,在构建过程中,需要从Common Crawl和YouTube等异构来源大规模提取并清洗数据,包括去除视频中的闲聊内容、处理指令重排序以及应对食材替换等复杂情况。此外,使用无监督算法学习成对对齐后,还需通过图算法推导多食谱间的联合对齐,整个过程对算法的鲁棒性和扩展性提出了严苛要求。
常用场景
经典使用场景
在烹饪这一日常程序性任务领域中,文本与视频两种模态的指令数据虽浩如烟海,却因顺序差异、措辞多变及信息密度不均而难以互通。微软研究院多模态对齐食谱语料库的诞生,为跨模态指令对齐提供了关键桥梁。其经典使用场景在于,将同一菜肴的多个文本食谱与多个视频食谱中的指令进行联合对齐,从而构建出语义丰富的多模态程序性知识图谱。研究者可借此探索不同食谱间指令顺序的灵活重组、食材替代的隐含规律,以及同一烹饪步骤在语言描述与视觉呈现上的多样表达,为理解现实世界程序性任务的底层结构提供了前所未有的数据支撑。
实际应用
在实际应用层面,该数据集展现出多元化的赋能潜力。在智能烹饪辅助系统中,对齐后的多模态数据可被用于开发能根据食材约束或烹饪方法自动改写食谱的生成模型;在机器人学习领域,大规模的跨模态对齐数据为机器人提供了从人类演示中学习程序性任务的宝贵素材,使其能够理解自然语言指令与物理操作之间的映射关系。此外,该语料库还可服务于文本相似度计算、视频描述生成、密集视频描述与动作识别等视觉语言任务,为工业界打造更具常识推理能力的交互式助手提供了高质量的训练资源。
衍生相关工作
该数据集的发布催生了一系列富有影响力的后续工作。基于其提供的文本与视觉释义对,研究者得以训练更加鲁棒的跨模态嵌入模型,用于食谱与食品图像之间的检索任务。单步到多步分解信息则启发了任务简化领域的研究,为复杂动作的层次化理解提供了新的视角。此外,该语料库的构建框架已被推广至DIY等具有丰富可对齐多模态数据的领域,推动了程序性知识自动提取与泛化研究的边界。这些衍生工作共同印证了该数据集在促进多模态常识推理与智能体协作研究方面的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务