StreamMemBench
收藏资源简介:
StreamMemBench是一个用于评估流式人物记忆系统的开放基准测试。它将时间顺序的多模态生活流转换为基于证据的任务,然后评估记忆系统是否能够使用初始证据、整合反馈,并在后续交互中重用修正后的记忆。数据集包含6名参与者7天的自我中心流数据,生成2,854个证据任务项和16,214个任务,支持中文和英文版本。
StreamMemBench is an open benchmark for evaluating streaming person memory systems. It converts chronological multimodal life streams into evidence-based tasks, and then assesses whether memory systems can utilize initial evidence, integrate feedback, and reuse revised memories in subsequent interactions. The dataset includes egocentric stream data spanning 7 days from 6 participants, generating 2,854 evidence task items and 16,214 tasks, and supports both Chinese and English versions.
数据集概述:StreamMemBench
核心定位
StreamMemBench 是一个用于评估流式(streaming)智能体记忆系统的开源基准测试。它将时间排序的多模态生活流转化为基于证据(evidence-anchored)的任务,用于测试记忆系统能否使用初始证据、整合反馈并在后续交互中复用修正后的记忆。
基准测试规模
- 数据来源:基于 EgoLife 项目,使用 6 名参与者在 7 天内的第一人称(egocentric)生活流数据。
- 数据内容:
- 总计 2,854 个“证据-任务”项,覆盖 2,854 个独特的流片段。
- 包含 8,107 条证据锚点。
- 总共构建了 16,214 个任务。
- 语言版本:提供中文和英文两个版本,共享相同的公共模式字段和数据集规模。
任务与评估指标
- 任务设计:采用两步任务序列,围绕证据锚点展开。初始任务测试证据使用能力,后续任务测试反馈整合与交互经验复用能力。
- 评估指标:包含四个诊断指标,均归一化至 [0, 1] 范围。
fidelity(保真度)initial_evidence_use(初始证据使用)feedback_incorporation(反馈整合)followup_reuse(后续复用)
支持的记忆系统
该基准测试评估了 8 种记忆系统,涵盖两种基础模型,包括:
- RAG 基线:
rag_raw、rag_extracted - 上游记忆系统:
mem0、memos、evermemos、memskill、memoryos、a_mem
数据格式与结构
每个基准测试项包含一个流片段和一个或多个证据锚点。公共模式字段包括:证据、证据锚点、证据陈述、支持性观察、初始任务、后续任务、反馈以及四个评估指标。
数据集地址
- GitHub 仓库:https://github.com/landian60/StreamMemBench
- 相关论文:http://arxiv.org/abs/2606.14571





