遇见数据集

StreamMemBench

收藏
github2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

StreamMemBench是一个用于评估流式人物记忆系统的开放基准测试。它将时间顺序的多模态生活流转换为基于证据的任务,然后评估记忆系统是否能够使用初始证据、整合反馈,并在后续交互中重用修正后的记忆。数据集包含6名参与者7天的自我中心流数据,生成2,854个证据任务项和16,214个任务,支持中文和英文版本。

StreamMemBench is an open benchmark for evaluating streaming person memory systems. It converts chronological multimodal life streams into evidence-based tasks, and then assesses whether memory systems can utilize initial evidence, integrate feedback, and reuse revised memories in subsequent interactions. The dataset includes egocentric stream data spanning 7 days from 6 participants, generating 2,854 evidence task items and 16,214 tasks, and supports both Chinese and English versions.

创建时间:
2026-06-04
原始信息汇总

数据集概述:StreamMemBench

核心定位

StreamMemBench 是一个用于评估流式(streaming)智能体记忆系统的开源基准测试。它将时间排序的多模态生活流转化为基于证据(evidence-anchored)的任务,用于测试记忆系统能否使用初始证据、整合反馈并在后续交互中复用修正后的记忆。

基准测试规模

  • 数据来源:基于 EgoLife 项目,使用 6 名参与者在 7 天内的第一人称(egocentric)生活流数据。
  • 数据内容
    • 总计 2,854 个“证据-任务”项,覆盖 2,854 个独特的流片段。
    • 包含 8,107 条证据锚点。
    • 总共构建了 16,214 个任务。
  • 语言版本:提供中文和英文两个版本,共享相同的公共模式字段和数据集规模。

任务与评估指标

  • 任务设计:采用两步任务序列,围绕证据锚点展开。初始任务测试证据使用能力,后续任务测试反馈整合与交互经验复用能力。
  • 评估指标:包含四个诊断指标,均归一化至 [0, 1] 范围。
    • fidelity(保真度)
    • initial_evidence_use(初始证据使用)
    • feedback_incorporation(反馈整合)
    • followup_reuse(后续复用)

支持的记忆系统

该基准测试评估了 8 种记忆系统,涵盖两种基础模型,包括:

  • RAG 基线rag_rawrag_extracted
  • 上游记忆系统mem0memosevermemosmemskillmemoryosa_mem

数据格式与结构

每个基准测试项包含一个流片段和一个或多个证据锚点。公共模式字段包括:证据、证据锚点、证据陈述、支持性观察、初始任务、后续任务、反馈以及四个评估指标。

数据集地址

  • GitHub 仓库:https://github.com/landian60/StreamMemBench
  • 相关论文:http://arxiv.org/abs/2606.14571
搜集汇总
数据集介绍
StreamMemBench 数据集图片
构建方式
StreamMemBench的构建源于对智能代理记忆系统在流式多模态生活场景中性能评估的需求。该数据集基于EgoLife项目中的六位参与者在七天时间内的以自我为中心的流数据,将时间排序的多模态生活流转化为以证据锚点为驱动的任务序列。在构建过程中,首先将原始流数据切割为五分钟的流片段,随后通过两轮证据与任务构建及审核流程提取可被记忆系统利用的初始证据,并设计出包含初始任务与后续任务的序列,以检验系统能否在最初使用证据、接纳反馈并根据交互经验修正记忆。最终形成了涵盖2854个证据任务项、8107个证据锚点以及16214个任务的公开基准数据集。
特点
该数据集的独到之处在于其针对未来导向辅助设计的两步任务序列,起始于从第一人称流中提炼的证据锚点,后设后续任务以考察记忆系统对反馈与交互经验的再利用能力。在评估层面,其引入了四项诊断指标,包括记忆保真度、初始证据利用、反馈融合与后续重用,所有指标均归一化至[0, 1]区间,确保了评估过程的标准化与可比性。同时,数据集提供中文与英文双版本,共享相同的公共模式字段,兼顾了跨语言研究的适用性。此外,数据集覆盖八种记忆系统,涵盖基础检索增强生成基线及多种上游记忆框架,为全面比较提供了坚实支撑。
使用方法
使用者可通过命令行工具直观而高效地开展实验。首先,安装StreamMemBench包后,可执行'streammembench build'命令以配置数据集,随后通过'prepare'与'construct'指令分别完成流段准备与证据任务构建。评估阶段,借助'eval'命令指定记忆系统类型和评估配置,例如运行'rag_raw'基线,系统将自动合并基准配置与记忆系统配置,生成记录有四项指标分数的JSONL结果文件。最终,通过'aggregate'指令汇总评估结果,形成综合性能报告。对于api依赖的系统,需在环境变量中配置LLM_API_KEY并指定模型端点,而本地基线无需外部密钥即可启动,大幅降低了使用门槛。
背景与挑战
背景概述
随着多模态生活流数据的日益丰富,如何构建能够长期记忆并利用历史证据的智能体记忆系统,成为人工智能领域的前沿课题。StreamMemBench由Guanming Liu、Yuqi Ren、Hansu Gu等研究人员于2026年创建,依托EgoLife项目的6名参与者、7天的自我中心流数据,构建了包含2,854条证据锚点与16,214个任务的基准测试。该基准将时间有序的多模态生活流转化为证据锚定任务,评估记忆系统能否从初始证据中提取信息、整合反馈以及在后续交互中复用修正后的记忆,从而衡量智能体对未来导向性辅助任务的适应能力。StreamMemBench为记忆系统研究提供了标准化、可复现的评价范式,推动了该领域从单一任务评估向流式、交互式评估的范式转变。
当前挑战
StreamMemBench面临多重挑战。首先,在领域层面,解决的核心问题是评估智能体记忆系统在流式、多模态生活数据中的长期记忆与动态适应能力,这超越了传统静态问答或一次性任务评估的范畴。其次,在构建过程中,需要将杂乱无章的自我中心视频流转化为结构化的、带有时间戳的证据锚点,涉及多轮人工与自动结合的注释与审查流程,确保锚点准确性和任务逻辑的连贯性。此外,跨语言版本(中英文)的维护要求共享公共模式字段,增加了数据一致性与验证的复杂性。最终,需要设计四种诊断指标(保真度、初始证据利用、反馈整合、后续复用)并归一化至[0,1]区间,以系统性地衡量不同记忆系统在真实生活场景中的表现差异。
常用场景
经典使用场景
在智能体记忆系统研究领域,StreamMemBench被设计为一个流式评估基准,专门用于评测智能体在时间有序的多模态生活流中,如何从初始证据中提取信息、根据反馈修正记忆,并在后续交互中复用已纠正的记忆。其经典使用场景聚焦于未来导向的辅助任务,通过两阶段任务序列——初始任务与跟进任务——全面考察记忆系统的忠实度、初始证据利用、反馈整合以及后续复用四大诊断指标,为研究者提供标准化、可复现的评估框架。
衍生相关工作
基于StreamMemBench的评估理念与方法论,研究者已衍生出多个经典工作,包括对RAG基线系统(rag_raw、rag_extracted)以及上游记忆系统(如Mem0、MemOS、MemoryOS、A-Mem、MemSkill、EverMemOS)的横向比较与深入分析。这些系统在该基准上的性能差异揭示了不同记忆架构在流式证据利用与反馈追踪中的优势与局限,进一步催生了融合检索增强与记忆更新的混合方案,为下一代智能体记忆设计提供了实证基础。
数据集最近研究
最新研究方向
StreamMemBench聚焦于面向未来辅助的智能体记忆系统流式评估,其前沿研究方向在于通过时间顺序的多模态生活流数据构建证据锚定任务,系统性地评测记忆系统在初始证据利用、反馈整合及后续交互中记忆重用的能力。该基准源于EgoLife项目,涵盖6名参与者7天的第一视角流数据,生成超过1.6万个任务,并提出了四个归一化诊断指标:保真度、初始证据利用、反馈整合与后续重用。这一研究方向紧密关联智能体长期记忆与持续学习的热点,为开发更具适应性和上下文感知能力的辅助型智能体提供了标准化评测框架,影响深远,尤其推动了记忆系统从静态存储向动态、交互式记忆管理的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务