遇见数据集

CUE-Mem

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

CUE-Mem Benchmark 是一个多模态对话记忆基准数据集,用于评估对话系统在长程对话中记忆和理解多模态信息的能力。数据集包含中文和英文对话,规模在 1,000 到 10,000 个样本之间。数据涵盖人物档案、事件、偏好问答、识别问答和实体问答等场景,每个样本包含对话轮次、相关图像、音频以及人工标注的问题。数据以 JSON 和 JSONL 格式组织,元数据包括对话轮次索引、问题索引、媒体文件清单和 SHA-256 校验和。该数据集适用于问答(QA)和图像到文本生成(image-text-to-text)任务,特别关注多模态语境下的记忆基准测试。

CUE-Mem Benchmark is a multimodal dialogue memory benchmark dataset for evaluating the ability of dialogue systems to remember and understand multimodal information in long conversations. The dataset contains Chinese and English dialogues, with a scale between 1,000 and 10,000 samples. The data covers scenarios such as person profiles, events, preference QA, recognition QA, and entity QA. Each sample includes dialogue turns, related images, audio, and human-annotated questions. The data is organized in JSON and JSONL formats, with metadata including dialogue turn indices, question indices, media file manifests, and SHA-256 checksums. The dataset is suitable for QA and image-to-text generation tasks, with a particular focus on memory benchmarking in multimodal contexts.

创建时间:
2026-08-31
原始信息汇总

CUE-Mem Benchmark 数据集概述

基本信息

  • 数据集名称:CUE-Mem Benchmark
  • 语言:中文(zh)、英文(en)
  • 任务类型:问答、图像-文本到文本
  • 数据规模:1K < n < 10K 条记录
  • 数据类型:多模态(包含文本、图像和音频)

数据内容与结构

数据集主要用于多模态对话式人工智能的记忆能力基准测试,仓库采用相对路径组织所有数据文件,包含以下核心目录结构:

  • data/dialog/base/:基于人物画像的对话和问答 JSON 文件
  • data/event/images/:事件相关图像
  • data/event/voice_mixed/:事件音频文件
  • data/qa/pref_images/:偏好类问题图像
  • data/qa/rec_images/:识别类问题图像
  • data/qa/entity_images/:实体类问题图像
  • data/profile/generated_portraits/:生成的人物画像
  • metadata/:包含对话轮次、问题、媒体清单及校验和等元数据

元数据文件说明

  • dialogue_turns.jsonl:每条对话轮次的记录
  • questions.jsonl:每条人工标注问题的记录
  • media_manifest.jsonl:媒体文件索引,包含类型、格式和大小
  • checksums.sha256:data/ 目录下所有文件的 SHA-256 校验和

基本使用方法

可通过读取 dialogue_turns.jsonl 获取对话记录,并依据其中存储的相对路径访问相应的图像等媒体文件;同时支持通过 sha256sum 命令对下载的数据进行完整性校验。

搜集汇总
数据集介绍
CUE-Mem 数据集图片
构建方式
CUE-Mem基准数据集精心构建,旨在评估多模态对话系统中的记忆能力。其构建方式严谨,涉及多维度数据采集与标注。数据集包含每个用户的对话记录,通过原始对话及问答JSON文件存储,并使用事件图像、语音文件及各种问答图像丰富内容。此外,生成式画像增添了用户个性维度。所有媒体及元数据文件均通过JSONL格式规范化管理,并设有manifest与checksum文件以保障数据完整性与可复现性。路径约定明确,所有引用均相对数据集根目录,便于数据加载与导航。
特点
CUE-Mem数据集的多模态与对话交互特性显著,覆盖中英双语,涉及视觉问答与图像文本生成等任务。其规模在1K至10K之间,适合中规模基准测试。数据集的独到之处在于融合了事件图像、语音、识别、偏好及实体查询图像,并辅以个性化用户画像,精准模拟现实对话记忆场景。每一条媒体与元数据条目均经字段验证,既提供原始对话与标注问题,又确保数据层级清晰且内容多元,为多模态长程记忆的研究提供了扎实根基。
使用方法
使用CUE-Mem数据集时,研究人员可从本地克隆仓库中加载元数据文件,例如读取dialogue_turns.jsonl以获取每一轮对话数据,利用内置相对路径便捷地访问对应的图像与音频文件。同时,通过检验media_manifest.jsonl与checksums.sha256能确保媒体文件的真实性及完整性。数据集的Python加载示例简单明了,既可独立运行也可整合进深度学习训练流程。此外,数据划分与命名规范,便于后续研究者进行批量处理、特征提取或模型微调,支持各类评估协议。
背景与挑战
背景概述
CUE-Mem基准数据集是在多模态对话人工智能与长期记忆交互研究日臻成熟的背景下,由相关研究团队于近年精心构建的评估资源。该数据集聚焦于模拟具有多维用户画像的对话代理在跨模态场景中对个性化信息的回忆与推理能力,其核心研究问题在于如何量化评估模型在图像、语音与文本交织的对话历史中提取、关联并应用记忆的效能。通过集成结构化的人物档案、事件影像及偏好与实体查询,CUE-Mem为记忆增强型对话系统提供了细粒度的评测框架,填补了现有基准在多模态记忆持久性与情境依赖性问题上的空白,对推动会话式人工智能迈向更自然、更个性化的交互范式具有重要引领作用。
当前挑战
CUE-Mem数据集所应对的挑战深刻且多维。首要挑战在于多模态对话中记忆机制的复杂性,即模型需跨越视觉与音频信息鸿沟,精准锚定用户个性化记忆线索,并在长时交互中实现稳定检索与运用,这远超传统单模态问答任务的能力范畴。其次,数据构建过程中遭遇了严苛的挑战:需精心设计人物档案与事件场景之间的内在关联以确保评测的生态效度,同时平衡跨语言(中英)表述的语义一致性,以及整合富媒体格式(图像、录音)并统一路径与元数据规范的工程复杂度。此外,人类标注问题须兼具辨识度与推理深度,以避免浅层视觉匹配,这要求标注者具备精细的多模态认知素养,从而构成数据质量控制上的显著难度。
常用场景
经典使用场景
CUE-Mem基准数据集旨在深度评估多模态对话系统在长期记忆维持与情境理解方面的能力。其经典使用场景涵盖构建人机交互中的连续性问答任务,系统需基于多轮对话、事件图像及音频等多模态输入,对用户个人档案中的偏好、实体信息及过往经历进行准确推理与回应。研究者常利用其分层数据结构,模拟真实世界中的多模态长期人机交互,以测试模型在跨模态记忆检索、时间顺序整合及个体化响应生成上的综合性能。
解决学术问题
该数据集切中当前多模态大模型在会话记忆方面的核心短板,解决过往基准普遍存在的记忆孤岛与模态割裂问题。它通过精细的档案驱动对话与多元模态事件标注,推动了持续学习、情景记忆建模及多模态对齐等学术议题的研究。其引入的人类注释问题与基准测试协议,为量化模型在动态信息更新与冲突消解中的表现提供了标准化框架,对构建具备认知连贯性的对话智能体具有范式意义。
衍生相关工作
围绕CUE-Mem基准,衍生了若干促进对话记忆技术演进的研究方向。一方面,它催生了针对多模态会话记忆的检索增强框架与内存网络架构的新一轮探索,相关模型以记忆slot或外部知识库整合多模态线索;另一方面,数据集亦被用作训练与评估统一多模态理解模块的素材,推动视觉-语言预训练模型在对话场景中的微调方法创新。此外,其提出了记忆一致性评估指标,启发了后续工作对幻觉抑制与事实保持的深入研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务