遇见数据集

crag-mm-2025/crag-mm-multi-turn-public

收藏
Hugging Face2025-05-26 更新2025-04-12 收录
官方服务:

资源简介:

CRAG-MM是一个高质量的多模态、多轮对话基准数据集,用于评估多模态助手的视觉理解和对话能力。数据集包含关于图像的不同复杂度的对话,涵盖13个领域,包括第一人称视角图像和公共图像。数据集包括单轮和多轮两种变体,分别对应每个图像一个问题答案交换和关于同一图像的多个问题和答案的扩展对话。

CRAG-MM is a high-quality conversational benchmark for multimodal assistants, designed to evaluate the visual understanding and conversational abilities of AI systems. The dataset consists of conversations about images with varied complexity levels, covering 13 domains, including egocentric images and public images. It includes both single-turn and multi-turn variants, with single-turn being one question-answer exchange per image, and multi-turn being extended conversations with multiple questions and answers about the same image.

提供机构:
crag-mm-2025
搜集汇总
数据集介绍
crag-mm-2025/crag-mm-multi-turn-public 数据集图片
构建方式
CRAG-MM数据集是为全面评估多模态检索增强生成(RAG)系统而构建的高质量对话基准。该数据集基于RayBan Meta智能眼镜采集的自我中心视角图像与公开网络图像,覆盖13个领域,设计包含简单查询至需多源检索与推理的复杂问题共4种类型。数据集以单轮与多轮两种对话形式组织,其中多轮版本针对同一图像展开多轮问答,由人工生成丰富问题并配以专家答案,确保对话的真实性与多样性。当前仅开放验证集,其余分集用于KDD Cup 2025挑战赛评估。
特点
该数据集的核心特点在于其多模态与多轮对话的深度融合,提供单一图像下连续交互的评估能力。每个样本包含会话标识符、图像及可选的图像URL,并结构化存储多轮交互的元数据,如领域、查询类别、动态性及图像质量等索引标签,便于细粒度分析。答案以完整文本形式关联至各交互ID,支持精确匹配。数据集的版本控制与分集设计(验证集、公开测试集)保障了研究的可重复性与挑战赛的公平性。
使用方法
通过Hugging Face的datasets库可便捷加载数据集,如使用load_dataset函数指定数据集名称与版本号即可获取。用户可遍历验证集样本,通过会话ID、图像和轮次字典访问多轮对话内容。借助提供的特征词汇表,可将领域、类别等整型索引解码为可读字符串,从而解析每轮对话的元数据。示例代码展示了如何打印完整对话,包括查询与答案,便于研究者快速开展多模态RAG系统的评估与分析。
背景与挑战
背景概述
在多模态人工智能领域,如何构建能够准确理解并回答关于图像的事实性问题的高质量对话系统,始终是研究的前沿与难点。CRAG-MM数据集由Meta与AIcrowd于2025年联合推出,旨在填补现有基准测试在多轮、多模态检索增强生成(RAG)场景下的评估空白。该数据集聚焦于可穿戴设备(如RayBan Meta智能眼镜)捕获的自我中心图像与公开图像,覆盖13个领域,并设计了从简单视觉查询到需跨源检索与推理的复杂问题四类查询类型。其核心研究问题在于衡量AI系统在真实、动态对话中综合视觉理解与知识检索的能力。作为KDD Cup 2025挑战赛的核心资源,CRAG-MM不仅推动了多模态RAG技术的发展,也为评估下一代智能助手的实用性与鲁棒性设立了新标准。
当前挑战
CRAG-MM所面临的挑战主要体现在两个层面。在领域问题层面,现有基准多局限于单轮问答或静态图像描述,难以评估模型在连续对话中处理图像与文本交织信息的动态能力,而CRAG-MM通过引入多轮交互、动态问题(dynamism)及不同图像质量,揭示了模型在噪声环境下保持推理一致性的困难。在数据集构建层面,挑战源于对大规模、高质量、多轮对话的精细标注需求:需确保每个图像的多轮问答在语义上连贯且覆盖广泛领域,同时平衡自我中心与公开图像的分布差异。此外,数据集以URL形式提供部分图像,导致加载依赖网络稳定性,而评估服务器需始终包含加载后的图像字段,这增加了数据预处理与验证的复杂度。
常用场景
经典使用场景
在检索增强生成(RAG)与多模态人工智能的交叉研究领域,CRAG-MM数据集被广泛用于评测多轮对话中视觉问答系统的综合能力。该数据集以第一人称视角的自我中心图像为核心,覆盖13个领域,包含从简单图像描述到复杂多源检索推理的四类问题,尤其适合评估模型在真实穿戴设备场景下对图像内容的理解、多轮交互中的上下文保持以及跨模态信息融合的鲁棒性。研究者通常将其作为基准,测试多模态大语言模型在事实性问答和动态对话中的表现,从而推动更自然、更精准的智能助手发展。
实际应用
在实际应用中,CRAG-MM数据集直接服务于智能穿戴设备(如RayBan Meta智能眼镜)的交互优化。通过模拟用户在日常场景中的多轮视觉问答,该基准可帮助开发团队测试和提升助手在导航、物体识别、购物辅助等任务中的表现。例如,用户可能先询问“这是什么植物?”,接着追问“它需要多久浇一次水?”,系统需结合图像信息与外源知识库进行连续检索。此类场景的评测有助于减少模型幻觉,增强实时响应能力,最终推动更自然、更沉浸的增强现实体验落地。
衍生相关工作
基于CRAG-MM数据集,学术界已衍生出一系列重要工作。其中,KDD Cup 2025的Meta CRAG-MM挑战赛直接以此数据集为评测核心,吸引了全球团队在多轮多模态检索与生成任务上展开角逐。此外,研究者利用该数据集探索了动态查询理解、跨模态注意力机制优化以及基于知识图谱的推理增强方法。这些工作不仅验证了CRAG-MM在模型评估中的有效性,还催生了如多轮对话状态追踪、视觉-语言联合检索等新研究方向,进一步巩固了其作为多模态RAG领域标杆基准的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务