RHELM (Realistic, Heterogeneous, and Evolving Long-term Memory)
收藏资源简介:
RHELM是由微软与中国人民大学联合构建的创新型长时记忆基准数据集,旨在模拟真实、异构且动态演化的用户交互场景。该数据集涵盖10个独特人物轨迹,包含11,764轮对话和2,180份外部文件,总对话令牌数达477万,外部文件令牌数为242万,上下文长度范围在50万至100万令牌之间。数据集通过创新的LOOP(规划-展开-演化-剪枝)模块驱动,基于精心设计的六维用户画像生成具有长期语义一致性的对话,并同步融合技术报告、邮件等异构外部数据源。该基准主要应用于评估大型语言模型在复杂现实场景中的记忆能力,重点解决多源信息聚合、动态上下文推理及隐性状态冲突检测等核心挑战。
RHELM is an innovative long-term memory benchmark dataset jointly constructed by Microsoft and Renmin University of China, which aims to simulate realistic, heterogeneous and dynamically evolving user interaction scenarios. This dataset covers 10 unique character trajectories, containing 11,764 dialogue turns and 2,180 external documents, with a total of 4.77 million dialogue tokens and 2.42 million external document tokens, and the context length ranges from 500,000 to 1,000,000 tokens. The dataset is driven by the innovative LOOP (Planning-Expanding-Evolving-Pruning) module, which generates dialogues with long-term semantic consistency based on a carefully designed six-dimensional user profile, and simultaneously integrates heterogeneous external data sources such as technical reports and emails. This benchmark is primarily used to evaluate the memory capabilities of large language models (LLMs) in complex real-world scenarios, focusing on addressing core challenges including multi-source information aggregation, dynamic context reasoning and implicit state conflict detection.
数据集概述
RHELM (Beyond Static Dialogues) 是一个用于评估人工智能系统长程记忆能力的综合性基准测试集。它旨在超越传统的静态对话评估,引入更贴近真实助手应用场景的现实性(Realistic)、异构性(Heterogeneous) 和演化性(Evolving) 记忆挑战。
核心特点
- 🎭 现实人物画像:包含具有丰富背景故事、个人偏好和不断变化生活状况的多样化角色。
- 📊 异构数据源:多模态外部记忆来源,涵盖对话、电子邮件、文档等多种类型。
- 🔄 时间演化:设计时间感知的问题,测试模型在不同时间上下文中的记忆能力。
- 🧠 挑战性问题分类:包含7大主要类别和26种复杂特性,需要多跳推理、时间综合、偏好追踪和幻觉检测等能力。
- ⚠️ 记忆条件误导查询:设有“陷阱”查询,这些查询与用户更新的生活状态相矛盾,要求助手检测隐含冲突、拒绝不安全请求并提出合规替代方案。
问题分类法
RHELM 涵盖三大问答域,包含7个类别和26种复杂特性:
| 类别 | 说明 |
|---|---|
| fact (事实) | 基于事实性记忆的查询 |
| temporal (时间) | 需要结合时间信息的查询 |
| hallucination (幻觉) | 检测模型是否产生幻觉 |
| aggregation (聚合) | 需要聚合多条信息的查询 |
| misleading (误导) | 与用户当前状态矛盾的陷阱查询 |
| attachment (附件) | 涉及附件文档内容的查询 |
| mixed (混合) | 结合以上多种类型的查询 |
数据格式
每个QA样本采用JSONL格式,包含以下字段:
id: 唯一问题标识符(前缀表示问题类型)question: 向记忆系统提出的用户查询answer: 用于评估的真实答案question_date: 问题提出的日期(YYYY-MM-DD格式)question_type: 问题类型(fact,temporal,hallucination,aggregation,misleading,attachment,mixed)supporting_evidence: 支撑答案的源数据引用列表characteristics: 问题的细粒度挑战标签列表
数据获取与使用
- 基准数据:已发布在 HuggingFace平台
- 评估框架:已开源在 GitHub仓库
- 数据生成代码:将在论文接收后发布
评估方式
提供基于RAG(检索增强生成)的评估框架,支持:
- 基础RAG评估:使用稠密检索,设置top-k参数
- 全上下文评估:不进行检索,将所有证据直接输入模型
- 异构检索:支持电子邮件和附件检索,支持混合(BM25 + 稠密)检索
配置要求
评估需要配置LLM凭据(OpenAI或Azure OpenAI),支持通过环境变量设置。数据集路径、嵌入模型、分块策略和输出路径等可在配置文件中自定义。

- 1Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory中国人民大学·应用统计科学研究中心; 中国人民大学·统计学院; 微软 · 2026年



