遇见数据集

RHELM (Realistic, Heterogeneous, and Evolving Long-term Memory)

收藏
arXiv2026-06-01 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

RHELM是由微软与中国人民大学联合构建的创新型长时记忆基准数据集,旨在模拟真实、异构且动态演化的用户交互场景。该数据集涵盖10个独特人物轨迹,包含11,764轮对话和2,180份外部文件,总对话令牌数达477万,外部文件令牌数为242万,上下文长度范围在50万至100万令牌之间。数据集通过创新的LOOP(规划-展开-演化-剪枝)模块驱动,基于精心设计的六维用户画像生成具有长期语义一致性的对话,并同步融合技术报告、邮件等异构外部数据源。该基准主要应用于评估大型语言模型在复杂现实场景中的记忆能力,重点解决多源信息聚合、动态上下文推理及隐性状态冲突检测等核心挑战。

RHELM is an innovative long-term memory benchmark dataset jointly constructed by Microsoft and Renmin University of China, which aims to simulate realistic, heterogeneous and dynamically evolving user interaction scenarios. This dataset covers 10 unique character trajectories, containing 11,764 dialogue turns and 2,180 external documents, with a total of 4.77 million dialogue tokens and 2.42 million external document tokens, and the context length ranges from 500,000 to 1,000,000 tokens. The dataset is driven by the innovative LOOP (Planning-Expanding-Evolving-Pruning) module, which generates dialogues with long-term semantic consistency based on a carefully designed six-dimensional user profile, and simultaneously integrates heterogeneous external data sources such as technical reports and emails. This benchmark is primarily used to evaluate the memory capabilities of large language models (LLMs) in complex real-world scenarios, focusing on addressing core challenges including multi-source information aggregation, dynamic context reasoning and implicit state conflict detection.

创建时间:
2026-05-29
原始信息汇总

数据集概述

RHELM (Beyond Static Dialogues) 是一个用于评估人工智能系统长程记忆能力的综合性基准测试集。它旨在超越传统的静态对话评估,引入更贴近真实助手应用场景的现实性(Realistic)异构性(Heterogeneous)演化性(Evolving) 记忆挑战。

核心特点

  • 🎭 现实人物画像:包含具有丰富背景故事、个人偏好和不断变化生活状况的多样化角色。
  • 📊 异构数据源:多模态外部记忆来源,涵盖对话、电子邮件、文档等多种类型。
  • 🔄 时间演化:设计时间感知的问题,测试模型在不同时间上下文中的记忆能力。
  • 🧠 挑战性问题分类:包含7大主要类别和26种复杂特性,需要多跳推理、时间综合、偏好追踪和幻觉检测等能力。
  • ⚠️ 记忆条件误导查询:设有“陷阱”查询,这些查询与用户更新的生活状态相矛盾,要求助手检测隐含冲突、拒绝不安全请求并提出合规替代方案。

问题分类法

RHELM 涵盖三大问答域,包含7个类别和26种复杂特性:

类别 说明
fact (事实) 基于事实性记忆的查询
temporal (时间) 需要结合时间信息的查询
hallucination (幻觉) 检测模型是否产生幻觉
aggregation (聚合) 需要聚合多条信息的查询
misleading (误导) 与用户当前状态矛盾的陷阱查询
attachment (附件) 涉及附件文档内容的查询
mixed (混合) 结合以上多种类型的查询

数据格式

每个QA样本采用JSONL格式,包含以下字段:

  • id: 唯一问题标识符(前缀表示问题类型)
  • question: 向记忆系统提出的用户查询
  • answer: 用于评估的真实答案
  • question_date: 问题提出的日期(YYYY-MM-DD格式)
  • question_type: 问题类型(fact, temporal, hallucination, aggregation, misleading, attachment, mixed
  • supporting_evidence: 支撑答案的源数据引用列表
  • characteristics: 问题的细粒度挑战标签列表

数据获取与使用

评估方式

提供基于RAG(检索增强生成)的评估框架,支持:

  • 基础RAG评估:使用稠密检索,设置top-k参数
  • 全上下文评估:不进行检索,将所有证据直接输入模型
  • 异构检索:支持电子邮件和附件检索,支持混合(BM25 + 稠密)检索

配置要求

评估需要配置LLM凭据(OpenAI或Azure OpenAI),支持通过环境变量设置。数据集路径、嵌入模型、分块策略和输出路径等可在配置文件中自定义。

搜集汇总
数据集介绍
RHELM (Realistic, Heterogeneous, and Evolving Long-term Memory) 数据集图片
构建方式
RHELM的构建始于精心设计的多维用户画像,涵盖身份、个性、特质、关系、所属物与当前状态六大维度。基于这些画像,系统采用创新的LOOP模块(规划-推演-演化-剪枝)模拟真实人生轨迹:首先生成短期与长期计划,再以概率p控制事件结果的积极或消极走向,据此动态演化用户画像。为增强现实性,系统通过深度研究方法同步生成与事件轨迹耦合的异构外部数据源,包括电子邮件、个人日记和专业报告。最后,从事件叙述中提取原子化要点并进行分类,驱动多轮对话合成,形成具有长期一致性的交互会话。
特点
RHELM的核心特点在于其高度逼真性与异构融合性。数据集涵盖10条人物轨迹,包含11,764轮对话与2,180个外部文件,上下文长度达50万至100万token。评估套件包含1,305个认知挑战性问答对,覆盖七大查询类型和27种精细记忆特征,创新性地引入记忆条件误导查询,要求模型识别用户隐式状态冲突并主动回应。与现有基准相比,RHELM首次将对话历史与异构外部数据流深度融合,模拟真实世界中用户在时间轴上的动态演变和语义连贯性,弥补了现有评估中人物扁平化与信息源单一化的不足。
使用方法
使用RHELM评估时,研究者可将对话历史与外部数据源按时间顺序拼接,以全上下文方式输入模型,或采用检索增强生成方法,对对话轮次和外部文档分别进行分块与向量化检索。基准提供了七类查询的事实标注与27种挑战特征映射,支持细粒度性能分析。实验配置分为含外部数据源与不含外部数据源两种,便于剖析异构信息对记忆系统的影响。评估采用LLM-as-judge范式,通过人类验证确保评测可靠,尤其适合评估模型在幻觉、误导等真实场景下的推理鲁棒性与多源聚合能力。
背景与挑战
背景概述
RHELM(Realistic, Heterogeneous, and Evolving Long-term Memory)基准数据集由微软研究院与中国人民大学于2025年联合推出,核心研究人员包括韩张、唐子豪、于欣等。该数据集聚焦于评估大语言模型在长期、真实、异构记忆场景下的表现能力。在以往的对话记忆评测中,会话片段缺乏长期语义一致性,用户画像趋于静态扁平,且交互形式仅局限于纯文本对话,忽视了真实世界中文档、邮件等多源异构数据流的引入。RHELM基于精心构造的用户画像与创新的LOOP生成模块,模拟跨时域、动态演化的多轮对话轨迹,并同步整合与用户时间线一致的外部数据源,显著提升了记忆评测的现实性与复杂性,为研究记忆增强型AI助手提供了更贴近真实需求的高仿真评测环境。
当前挑战
RHELM数据集提出的挑战涵盖领域问题与构建过程两个方面。在领域层面,现有评测普遍面临三大难题:缺乏语义一致性与行为保真度,会话历史常由不相关的填充片段拼接而成,用户行为缺乏内在逻辑;信息源同质化严重,评测局限于对话交互,忽略了报告、邮件等异构数据在记忆形成中的关键作用;对隐含误导性查询的检测能力不足,当用户提出与自身状态相悖的请求时,模型往往盲目服从而非主动识别冲突。在构建过程中,需应对如下挑战:通过LOOP机制模拟长期行为轨迹的随机性与动态演化,在JSON模式约束下动态更新用户属性,引入概率性回滚与剪枝模块以减轻累积误差,并利用验证器辅助审计体系保证跨阶段生成的语义一致性与事实准确性。
常用场景
经典使用场景
RHELM基准数据集专为评估大型语言模型在复杂、长期且动态演变的个人记忆场景中的能力而设计。其最经典的使用场景涵盖了模拟真实个人助手与用户之间跨越数月的多轮对话,这些对话不仅包含日常闲聊,更深度融合了用户日程、个人偏好、社交关系以及随时间变化的动态状态。研究者利用该数据集构建的测试集,能够全面考察模型在长时间跨度下对用户历史行为的追踪、理解与回应的能力,从而弥补了现有基准在语义一致性与行为真实性上的不足。
衍生相关工作
RHELM数据集的提出催生了一系列旨在增强模型长期记忆与推理能力的经典工作。在其实验评估中,研究者对比了全上下文模型(如GPT-4.1、Gemini-2.5)、检索增强生成方法以及代表性记忆框架(如MemGPT、Mem0、MemU)的表现,揭示了现有方法在处理跨源聚合和误导性查询时的严重局限。这激励了后续研究探索更高效的记忆压缩与检索机制、跨模态信息融合的推理架构,以及能够主动识别用户隐式状态冲突的对话策略,为构建真正具有连贯记忆的AI系统指明了方向。
数据集最近研究
最新研究方向
RHELM基准测试揭示了大型语言模型在真实、异构且动态演进的长期记忆场景中的关键短板。当前研究前沿聚焦于突破静态对话评估的局限,通过引入利用LOOP模块生成的一致且动态的用户轨迹、深度融合文档与邮件等异构外部数据源,以及创新性地设计记忆条件误导性查询,来系统性衡量模型在多源信息聚合、隐式状态冲突检测与实境推理等复杂能力上的缺陷。实验证明,即便最先进的模型在处理跨源信息综合与应对带有误导性的用户请求时依然表现脆弱,这为下一代具备主动感知与约束调用能力的个人AI助手指明了明确的发展方向。
相关研究论文
  • 1
    Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory中国人民大学·应用统计科学研究中心; 中国人民大学·统计学院; 微软 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务