遇见数据集

RHELM (Realistic, Heterogeneous, and Evolving Long-term Memory)

收藏
arXiv2026-05-29 更新2026-06-02 收录
官方服务:

资源简介:

RHELM是由微软与中国人民大学联合构建的面向长期记忆评估的综合性基准数据集,旨在模拟真实世界中的动态用户交互与异构数据流。该数据集包含10个独立人物轨迹,涵盖11,764轮对话和2,180个外部文件,总对话令牌数达477万,外部文件令牌数约243万,数据通过精心设计的用户画像和LOOP模块生成,确保长期语义一致性与时序演化。其核心应用在于评估大型语言模型在复杂现实场景中的记忆能力,特别是解决多源信息聚合、真实上下文推理及隐性状态冲突等关键挑战,推动个性化AI助手的发展。

RHELM is a comprehensive benchmark dataset for long-term memory evaluation, jointly developed by Microsoft and Renmin University of China. It aims to simulate dynamic user interactions and heterogeneous data streams in real-world scenarios. This dataset contains 10 independent character trajectories, covering 11,764 dialogue rounds and 2,180 external files. The total number of dialogue tokens reaches 4.77 million, while the token count of external files is approximately 2.43 million. The data is generated via carefully designed user profiles and the LOOP module, ensuring long-term semantic consistency and temporal evolution. Its core application lies in evaluating the memory capabilities of large language models (LLMs) in complex real-world scenarios, particularly addressing key challenges such as multi-source information aggregation, real-world context reasoning and implicit state conflicts, so as to promote the development of personalized AI assistants.

创建时间:
2026-05-29
搜集汇总
数据集介绍
构建方式
RHELM的构建始于精心设计的六维人物画像,涵盖身份、个性、特质、关系、物品及当前状态,并严格遵循JSON模式以确保结构完整性。核心驱动机制为创新的LOOP模块(规划-推演-演化-修剪),该模块模拟用户真实生命周期轨迹:首先生成短期活动与长期规划,再通过随机概率p控制事件结果为积极或消极,据此动态演化用户画像。为增强现实感,系统同步生成异构外部数据源,包括电子邮件、个人日志与专业报告,这些文件通过深度研究方法生成,形式涵盖文本、Markdown及HTML。最后,从事件叙述中提取原子化要点,依据五种对话意图分类,生成具有主题锚点的多轮对话流。
使用方法
RHELM提供完整的10条人物轨迹,包含11,764轮对话与2,180个外部源文件,上下文长度在500K至1M token之间。研究人员可将其作为评估大型语言模型长时记忆能力的标准化基准。使用方法包括:将对话历史与外部源按时间顺序拼接后输入长上下文模型进行全上下文推理;或采用检索增强生成架构,对对话与文档分别分块并编码,通过向量检索召回相关片段后输入大模型作答。此外,可结合记忆框架(如MemGPT、Mem0)进行评测。所有问答对答案设计为短语形式,便于自动化评估,其中幻觉与误导类型需模型识别并纠正错误前提。数据已在GitHub开源发布。
背景与挑战
背景概述
RHELM数据集由来自中国人民大学与微软的研究团队于2026年联合推出,旨在填补当前大语言模型长期记忆评测领域中真实性与复杂性的显著空白。现有对话式记忆基准多依赖于语义割裂的合成话轮与静态扁平的用户画像,难以捕捉现实交互中用户行为的内在一致性与动态演变。研究人员通过构建六维精细化用户档案,并创新性地引入LOOP机制来模拟用户生命周期内的计划、推演、演化与剪枝过程,使得对话轨迹在长达一年的时间跨度中呈现出高度一致的语义连贯性与动态演化特性。该数据集包含10个完整的人物轨迹,总计超过11,000个对话轮次与2,000余份异构外部文档,为评估个人AI助手的长期记忆能力提供了迄今为止最贴近真实世界的测试平台。
当前挑战
RHELM所聚焦的核心挑战在于突破当前记忆评测中三个长期未能解决的领域瓶颈:其一是缺乏语义一致性与行为保真度,现有基准往往通过插入不连贯的填充文本构造长上下文,导致对话片段无法与深层行为逻辑形成有意义的关联;其二是信息源的极度同质化,多数评测局限于纯对话交互,而现实场景中用户行为广泛分布于报告、邮件、日志等异构数据流,这对助手的跨模态信息合成能力提出了严峻考验;其三是对记忆条件性误导查询的忽视,真实用户可能提出与自身已演变状态相冲突的请求,而现有系统往往沦为盲目的指令执行者。在构建过程中,团队面临的挑战包括如何在不引入语义漂移的前提下,通过密集的验证器审计机制确保长达一年的轨迹生成中所有实体与状态的严格一致性,以及如何在多样化的人物画布上生成兼具深度与自然性的复杂问答对。
常用场景
经典使用场景
RHELM作为面向大语言模型长时记忆能力的基准评测数据集,其最经典的使用场景在于评估个人AI助手在真实、异构且持续演化的长程交互中的记忆表现。该数据集突破了传统静态对话评测的局限,通过构建跨时域、融合同步文档与邮件等多源信息的复杂对话流,全面检验模型在全上下文推理、检索增强生成及记忆框架等范式下的性能。研究者可借助RHELM系统性地衡量模型在事实回溯、时间推理、聚合分析、幻觉检测及误导性查询识别等七类认知任务上的能力,从而对现有记忆系统的鲁棒性与真实性形成深刻洞见。
解决学术问题
RHELM着力解决当前大语言模型记忆评测中三大核心不足:缺乏语义一致性与行为真实性的对话构建、信息源的单一化局限、以及对隐含状态冲突查询的忽视。现有基准普遍依赖语义割裂的插叙填充构建长上下文,缺乏对用户个性与行为逻辑的一致建模;信息源局限于对话记录,忽略了报告、邮件等异质数据对于记忆形成的至关重要性;查询多聚焦显式事实检索,难以评估模型在真实场景中识别并响应请求与隐式约束冲突的能力。RHELM通过引入动态演化的人物画像与LOOP模块、合成异构外部数据源、以及设计记忆条件性误导查询,填补了上述空白,为推动更贴近实际需求的记忆机制研究提供了坚实的数据基座与评估框架。
实际应用
在现实应用层面,RHELM所模拟的评测场景高度契合日益普及的智能个人助手服务。当用户向助手查询数月前的会议安排、基于医疗报告与病历给出调理建议、或在发现请求与自身康复禁忌相悖时期望助手主动劝阻,这些任务都依赖精准的长期记忆与跨源推理能力。RHELM通过还原用户与助手之间涉及日程协作、文件审阅、状态更新等多模态交互的日常流程,为优化消费级AI产品的个性化体验与安全性提供了重要的评估标尺。其设计思路可直接迁移至教育辅导、健康管理、办公协同等垂直领域中的智能体记忆系统研发。
数据集最近研究
最新研究方向
RHELM基准测试聚焦于在大语言模型长期记忆评估中引入真实异构与动态演变特性,突破传统静态对话的局限。前沿研究重点探索跨文档、邮件等异构数据源的语义整合与多跳推理能力,特别针对隐含状态冲突的误导性查询进行鲁棒性测试。当前热点涉及通过LOOP模块模拟用户画像的时序演化,并利用验证器辅助审计确保数据一致性。实验表明,现有全上下文模型与检索增强生成方法在多源聚合与现实语境推理上仍存在显著瓶颈,亟需发展具备主动感知用户隐状态与冲突检测能力的记忆增强架构。
相关研究论文
  • 1
    Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory中国人民大学·应用统计科学研究中心; 中国人民大学·统计学院; 微软 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务