HaluMem
收藏资源简介:
HaluMem是第一个专门为记忆系统定制的操作级幻觉评估基准。它将记忆工作流程分解为三个基本操作:记忆提取(评估系统准确识别和存储对话会话中事实信息的能力)、记忆更新(评估系统在提供新信息时正确修改现有记忆的能力)和记忆问答(评估系统整合多个记忆过程生成无幻觉答案的端到端能力)。每个操作都包含精心设计的评估任务,以揭示记忆处理不同阶段的幻觉行为。
HaluMem is the first operational-level hallucination evaluation benchmark tailored specifically for memory systems. It decomposes the memory workflow into three core operations: Memory Retrieval (evaluating the system's ability to accurately identify and store factual information from conversational sessions), Memory Update (evaluating the system's ability to correctly modify existing memories when provided with new information), and Memory QA (evaluating the system's end-to-end ability to integrate multiple memory processes to generate hallucination-free answers). Each operation features carefully crafted evaluation tasks to reveal hallucinatory behaviors across different stages of memory processing.
HaluMem 数据集概述
数据集简介
HaluMem 是首个专门为记忆系统设计的操作级幻觉评估基准,用于评估记忆系统中的幻觉现象。该基准将记忆工作流分解为三个基本操作:记忆提取、记忆更新和记忆问答。
数据集版本
版本规格
| 数据集版本 | 用户数量 | 对话数量 | 平均会话/用户 | 平均上下文长度 | 记忆点数量 | 问答对数量 |
|---|---|---|---|---|---|---|
| Halu-Medium | 20 | 30,073 | 70 | ~16万词元 | 14,948 | 3,714 |
| Halu-Long | 20 | 53,516 | 120 | ~100万词元 | 14,948 | 3,714 |
版本特点
- Halu-Medium:提供标准长度上下文中的多轮人机对话会话
- Halu-Long:将上下文长度扩展至每用户100万词元,引入大规模干扰和干扰内容
数据结构
用户数据结构
每个用户数据存储为JSON对象,包含以下字段:
uuid:唯一用户标识符persona_info:人物档案信息sessions:多轮对话会话列表
会话结构
每个会话包含:
start_time、end_time:会话时间戳dialogue_turn_num:对话总轮数dialogue:用户和助手之间的对话序列memory_points:从会话中提取的记忆元素列表questions:用于记忆推理和评估的问答对dialogue_token_length:完整对话的词元化长度
记忆点结构
每个记忆点包含:
index:会话内记忆IDmemory_content:记忆文本描述memory_type:记忆类型memory_source:来源类型is_update:是否更新现有记忆original_memories:先前相关记忆importance:相对显著度分数timestamp:创建或更新时间
问答对结构
每个问答对包含:
question:问题内容answer:答案内容evidence:支持证据difficulty:难度级别question_type:问题类型
评估任务
核心操作评估
- 记忆提取:评估系统准确识别和存储事实信息的能力
- 记忆更新:评估系统正确修改现有记忆的能力
- 记忆问答:评估系统端到端整合多个记忆过程的能力
数据质量
经过人工标注验证,数据质量指标如下:
- 准确率:95.70%
- 相关性:9.58/10
- 一致性:9.45/10
获取方式
完整数据集可通过Hugging Face获取: https://huggingface.co/datasets/IAAR-Shanghai/HaluMem




