遇见数据集

M3Exam

收藏
arXiv2026-06-05 更新2026-06-09 收录
官方服务:

资源简介:

M3Exam是由香港科技大学等机构联合构建的面向真实用户-智能体交互的多模态对话记忆基准数据集。该数据集包含239个跨15种人物场景的多会话对话,总计3,025轮交互并积累1,799个多模态文件,配套5,150个涵盖检索、推理和隐式推断的评估问题。数据集通过人物设定、核心事件时间线生成和多轮对话合成流程构建,严格的质量控制确保数据真实性和逻辑连贯性。该数据集旨在评估智能体在长期多模态记忆管理、跨模态推理和隐含意图推断方面的能力,为多模态大语言模型和记忆系统的研发提供关键基准。

M3Exam is a multimodal conversational memory benchmark dataset co-developed by the Hong Kong University of Science and Technology (HKUST) and other institutions, targeting real-world user-AI Agent interactions. This dataset includes 239 multi-session conversations spanning 15 character scenarios, with a total of 3,025 interaction turns and 1,799 accumulated multimodal files, and is paired with 5,150 evaluation questions covering retrieval, reasoning and implicit inference. It is constructed via core workflows including character setting, core event timeline generation and multi-turn conversation synthesis, with rigorous quality control measures implemented to ensure the data's authenticity and logical coherence. This dataset aims to evaluate the capabilities of AI Agents in long-term multimodal memory management, cross-modal reasoning and implicit intention inference, providing a critical benchmark for the development of multimodal Large Language Models (LLMs) and memory systems.

创建时间:
2026-06-05
原始信息汇总

数据集概述:M3Exam

基本信息

  • 数据集名称:M3Exam (Multimodal Memory Benchmarking for Realistic User-Agent Interactions)
  • 项目官方仓库:https://anonymous.4open.science/r/M-3-Exam-128D

数据集描述

M3Exam 是一个新颖的以查询为中心的多元对话问答基准测试,基于真实的用户-智能体交互构建。它支持在多模态记忆、跨模态推理和隐式意图理解等维度上,对长历史对话、图像和文档进行均衡的多维评估。

数据格式与结构

每一个示例角色(persona)目录包含以下文件布局:

  • sessions.json:多会话对话历史(即记忆)
  • question.json:基于历史标注的问题
  • timeline_<Persona_Name>.json:用于驱动数据生成的核心事件时间线
  • images/:对话中共享的图像文件(img_<n>.jpg/png)
  • pdfs/:对话中共享的PDF文档

评估指标

指标按问题类型和汇总报告:

  • EM(精确匹配)
  • F1(F1分数)
  • BLEU-1(BLEU-1分数)
  • LLM-judge(五点量表:0 / 0.25 / 0.5 / 0.75 / 1)

相关方法:M3Proctor

与数据集共同提出的多模态记忆方法,基于朴素RAG骨架,增加了:

  • 回合级分块
  • 会话摘要分块
  • PDF文本层提取
  • 图像VLM描述
  • 查询侧模态分类器
  • 模态感知的重排序
  • 两级级联回答器(仅在纯文本答案置信度不足时,才升级使用图像/渲染后的PDF页面)
搜集汇总
数据集介绍
M3Exam 数据集图片
构建方式
M3Exam的构建源于对真实用户与智能体交互场景的深度模拟。研究团队首先为15个虚拟人物设定了详细的角色画像与核心事件线,随后利用大语言模型自动生成按时间顺序排列的核心事件序列,并掺入无关的干扰事件以模拟用户注意力的自然漂移。接着,通过事件滑动窗口机制驱动用户模拟器与助理进行多轮对话,每次对话均附有图片、图表或PDF文件等多模态材料。最终,在完整的对话历史基础上,系统化地合成了涵盖八种类型的问答对,并经过严格的自动自检与人工抽检,确保每道问题的答案均可从提供的证据中推导得出。
使用方法
M3Exam的使用方法强调评估模型在多模态历史对话中的综合推理能力。给定一个累积的多模态对话历史与一个查询,待评估的智能体需首先从庞大的历史中检索并定位相关的对话轮次与多模态材料,然后综合文本、图像与文档信息进行跨模态的推理。评估时,研究者可采用全局上下文直接回答或借助外部记忆系统检索后回答两种模式,并通过精确匹配、F1分数、BLEU-1及大模型评判员等多种指标进行打分。特别地,为了区分模型在不同能力维度上的表现,建议按照单会话检索、多会话分析、多模态推理等八种问题类型分别报告结果,以揭示模型在记忆、推理与解读各环节的具体短板。
背景与挑战
背景概述
M3Exam 是由香港科技大学、北京化工大学、哈尔滨工业大学(深圳)等多家机构的研究人员于2026年共同提出的多模态对话记忆基准数据集。其核心研究问题在于评估语言代理在真实用户-代理交互场景中,面对积累的多模态对话历史(包含文本、图像、文档)时,是否具备持久的存储、检索与推理能力。该数据集填补了现有基准在跨模态推理、跨会话推理及隐含信息推断方面的空白,通过构建包含15个人物场景、239个多会话对话、1799个多模态工件和5150个评估问题的丰富语料库,为多模态大语言模型和代理记忆系统的能力评估提供了全新测试舞台。M3Exam的发布推动了多模态对话记忆研究从单会话、单模态向多会话、跨模态与隐含意图理解的关键转变,对相关领域具有重要影响。
当前挑战
M3Exam 所聚焦的挑战主要涵盖两个层面。在领域问题层面,现有基准(如 LongMemEval、LoCoMo)仅支持文本或有限的多模态交互,无法评估代理对跨模态证据的精准定位与隐含用户意图的推断,而M3Exam 通过引入主题推理和隐含推断问题,要求模型从分散的文本、图像与文档中组合证据并理解未明说的上下文,对当前模型构成显著瓶颈。在数据集构建过程中,研究者面临确保会话的真实性与多样性的挑战,需设计结构化时间线生成、多轮对话合成及严格的质量控制流程(包括自检与人工审查),以防止人物角色矛盾与核心事件偏离,同时维持跨模态证据的丰富性与问题类型的平衡,最终形成对记忆、推理与解释三大能力的全面压力测试。
常用场景
经典使用场景
在用户与智能代理的长期交互场景中,M3Exam被设计用于评估多模态对话代理的记忆、推理与解读能力。它模拟用户跨越多个会话积累文本、图像与文档的真实互动历程,要求代理在累积的多模态历史中检索并整合证据以回答复杂查询。该基准涵盖15种人物画像、239段多会话对话与5150个评估问题,通过单会话检索、跨模态推理、文件管理、以及隐性意图推断等多维度任务,系统性检验代理在面对碎片化、跨会话信息时的综合表现。
解决学术问题
现有基准多聚焦于纯文本或静态图像记忆,忽略了多模态协作与隐性意图推理的挑战。M3Exam填补了这一空白,它揭示当前最前沿的多模态大模型与记忆系统在跨模态证据定位、跨会话时序推理以及从非直接陈述中解读用户深层次意图等方面存在显著差距。该基准的提出为学术界提供了一个严苛的评估框架,促使研究者重新审视并改进代理在真实环境中的长时记忆机制与隐性信息建模能力,推动了多模态对话系统向更贴近人类认知的方向发展。
实际应用
在实际部署中,M3Exam模拟的场景与个人智能助手、医疗咨询、教育培训及客户服务等领域高度吻合。例如,助手需从过去数周的用户对话中调取一张咖啡照片、一份培训PDF或一张统计图表,以回答关于用户职业、偏好或操作步骤的查询。该基准验证了在忙碌的工作流中,代理能否有效地管理跨模态、跨会话的信息积累,避免因忽视视觉证据或误解用户暗示而做出错误响应,从而提升用户体验与任务完成效率。
数据集最近研究
最新研究方向
M3Exam作为一项面向真实用户-智能体交互场景的多模态记忆基准测试,其前沿研究方向聚焦于评估和提升多模态大语言模型在跨会话、跨模态推理及隐含意图推断方面的能力。该基准通过精心构建的239个多会话对话(涵盖15种人物设定、3,025轮交互及5,150道评测问题),揭示了当前最先进的闭源MLLM与开放式智能体记忆系统在视觉证据锚定、长期上下文积累的效率瓶颈以及隐式信息解读等方面的显著短板。更值得注意的是,研究者基于评测发现提出了M3Proctor——一种模态感知的记忆方法,其通过检测查询的模态偏差并实施按需级联检索,仅在实际需要时消耗原始视觉资源,从而将准确率提升13%的同时将索引构建时间和检索令牌数削减超过70%。这一工作在多模态对话智能体的核心记忆机制研究中树立了新的标杆,其发布的合成数据规避了隐私风险,为未来构建能够长期追踪、逻辑推理并理解未言明用户意图的可信智能体系统奠定了关键基础。
相关研究论文
  • 1
    M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions香港科技大学; 北京化工大学; 香港科技大学·广州; 哈尔滨工业大学·深圳; 北京理工大学·珠海; 腾讯·幻核; 鹏城实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务