MemoryBench
收藏资源简介:
MemoryBench旨在为评估LLM系统中的记忆和持续学习提供一个标准化且可扩展的基准,鼓励未来研究朝向更自适应、反馈驱动和高效的LLM系统发展。该基准涵盖多个领域、语言和任务类型,通过用户反馈模拟框架评估LLMsys的持续学习能力
MemoryBench is a standardized and scalable benchmark designed to evaluate memory and continual learning in LLM systems, aiming to encourage future research toward more adaptive, feedback-driven, and efficient LLM systems. This benchmark covers multiple domains, languages and task types, and evaluates the continual learning capabilities of LLMs through a user feedback simulation framework.
MemoryBench 数据集概述
数据集简介
MemoryBench 是一个用于评估大语言模型系统中记忆与持续学习能力的标准化可扩展基准。该基准通过模拟用户反馈机制,全面覆盖多领域、多语言和多种任务类型,旨在推动更自适应、反馈驱动和高效的大语言模型系统发展。
核心特点
- 评估重点:专注于测试系统在服务时间内从累积用户反馈中学习的能力
- 任务多样性:涵盖异构任务类型,突破传统长文本阅读理解任务的局限
- 领域覆盖:包含开放领域、学术知识、法律等多个专业领域
- 语言支持:支持多种语言任务评估
数据集结构
配置目录
configs/datasets/- 数据集配置文件each.json- 各数据集元数据domain.json- 按领域分组的数据集task.json- 按任务分组的数据集
configs/final_evaluate_summary_wo_details.json- 归一化数据
数据目录
raw/- 原始数据集文件
源代码目录
src/datasets/- 数据集类src/llms/- 大语言模型接口src/agents/- 评估代理
数据集获取
完整数据集公开发布于 Hugging Face: https://huggingface.co/datasets/THUIR/MemoryBench
使用方法
环境配置
bash conda create -n memorybench python=3.10 conda activate memorybench pip install -r requirements.txt
数据集加载
通过 load_memory_bench 函数加载数据集:
- 参数说明:
dataset_type:加载类型(single/domain/task)name:数据集/领域/任务名称return_instance:是否返回数据集类实例eval_mode:是否启用评估模式
评估功能
通过 evaluate 函数评估模型预测:
- 输入要求:包含数据集名称、测试索引和模型响应的预测列表
- 输出格式:包含数据集名称、样本索引和各项指标得分的详细结果
结果汇总
通过 summary_results 函数计算总体性能得分:
- 单数据集:直接计算各指标平均值
- 领域/任务:基于预计算统计数据进行跨数据集归一化
相关资源
完整基线实验实现代码库: https://github.com/LittleDinoC/MemoryBench-code




