遇见数据集

MemTest Benchmark Database

收藏
github2026-06-02 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

MemTest是一个用于评估AI记忆系统的基准数据库生成器,可以从任何文本语料库生成结构化的记忆和带真实答案的查询,支持6个评估维度(如精确检索、组合检索、时序推理等),数据集包含记忆ID、内容、人物列表、地点、时间、事件等信息,并提供了标准化的JSON格式输出。

MemTest is a benchmark database generator for evaluating AI memory systems. It can generate structured memory records and queries with ground-truth answers from any text corpus, and supports six evaluation dimensions including exact retrieval, compositional retrieval, temporal reasoning, and others. The dataset contains information such as memory IDs, content, person lists, locations, times, events and other relevant details, and provides standardized JSON-format output.

创建时间:
2026-05-26
原始信息汇总

数据集概述:MemTest — 面向AI记忆系统的基准测试数据库生成器

核心功能:通过自动化流水线,将任意文本语料转化为结构化记忆库,并生成带有ID级答案的确定性查询,用于评估AI系统的记忆检索质量。

关键理念:评估检索而非生成。答案以记忆ID集合(而非文本)形式呈现,确保指标精确匹配、可重复、跨系统可比。

架构(v4)

项目由以下组件构成:

  • pipeline_v4.py:一键式流水线入口
  • extractor.py:基于LLM的记忆提取(唯一使用LLM的步骤)
  • relation_builder.py:纯规则构建别名组与推理链
  • query_builder.py:基于模板从记忆属性生成查询
  • alias_resolver.py:跨语料解析角色别名
  • time_resolver.py:归一化时间表达
  • runner.py:在记忆系统上运行评估
  • quality_check.py:10项自动化数据质量检查
  • schema.py:数据格式定义
  • llm_interface.py:LLM抽象层(兼容DeepSeek/OpenAI)

输入语料位置:test_corpus*/目录下的.md文件(如《西游记》《三国演义》《红楼梦》《金庸》) 输出数据库位置:output/目录下的JSON文件

快速开始

  1. 安装与配置 bash git clone https://github.com/yubingz/memtest.git cd memtest cp .env.example .env

    编辑.env,添加DEEPSEEK_API_KEY

  2. 一键运行 bash python pipeline_v4.py ./my_corpus/ -o test_db.json --name "My Test Database"

    流程:提取 → 构建关系 → 生成查询 → 组装 → 验证

  3. 自定义语料 创建目录,放入.md.txt文件即可。

评估维度(基于four_novels.json,131条记忆,4部小说)

维度 数量 说明
精确检索 303 人物、地点、时间、事件检索(5种查询类型)
组合检索 267 多属性组合查询(人+地点、人+时间等)
时序推理 157 前后时序推理链
负样本 195 无匹配记忆的查询(应返回空结果)
跨版本/别名 146 别名等价查询(如“刘皇叔”=“刘备”=“玄德”)

查询类型示例

类型 模板数 示例
人物检索 8 "刘备的经历有哪些?"
地点检索 6 "在涿县发生了什么?"
时间检索 6 "早年有什么事件?"
事件检索 7 "关于玉的事件有哪些?"
别名查询 5 "刘皇叔是谁?"
组合检索 12+ "刘备在涿县的记录"
组合推理 自动 "...之前发生了什么?"

数据格式

记忆条目示例: json { "memory_id": "MEM000001", "content": "刘备,字玄德,人称刘皇叔,是汉景帝之子中山靖王刘胜的后代。", "person_list": ["刘备", "字玄德", "玄德", "刘皇叔", "中山靖王刘胜", "汉景帝"], "location": {"city": "涿县", "place": "楼桑村"}, "time": {"relative": "早年"}, "event": {"type": "日常", "action": "出生"}, "source": "三国演义", "alias_evidence": [{"entity": "刘备", "alias": "刘皇叔", "evidence": "人称刘皇叔"}] }

查询示例: json { "query_id": "Q0001", "query_text": "刘备的经历有哪些?", "query_type": "人物检索", "test_dimension": "精确检索", "expected_memory_ids": ["MEM000001", "MEM000002", "MEM000005"], "is_negative": false, "difficulty": "困难" }

预构建数据库

数据库 记忆条数 查询数 来源
four_novels.json 131 1157 三国演义 + 红楼梦 + 西游记 + 金庸5部
hongloumeng.json 23 155 红楼梦
sgyy_full.json 17 173 三国演义

设计原则

  1. 仅提取步骤使用LLM,查询生成采用纯模板×属性,确定可重复
  2. 基于ID的答案,消除文本相似度歧义,评估结果精确匹配
  3. 支持自定义语料,流水线自动提取事实并生成查询
  4. 记忆以原文形式存储,存储时不进行转换
  5. 覆盖6个评估维度:精确检索、组合检索、时序推理、负样本、别名等价
  6. 别名感知:角色别名(如孙悟空=齐天大圣=美猴王)被解析并作为等价组测试

许可证:MIT

搜集汇总
数据集介绍
MemTest Benchmark Database 数据集图片
构建方式
MemTest Benchmark数据库的构建遵循一套精密的自动化流水线。其核心流程始于将任意纯文本语料(如《三国演义》等文学著作)输入系统,借助大语言模型(LLM)完成关键的记忆抽取步骤,从文本中提取结构化的记忆单元,包括人物、地点、时间、事件等属性。随后,系统通过纯规则的别名解析与时间归一化组件,构建跨文本的等价实体群与推理链。最终,基于抽取出的记忆属性,利用确定性模板生成大规模查询,并嵌入负样本与跨版本别名等价查询,形成兼具精确性与多样性的基准数据集。整个构建过程仅首步依赖LLM,后续环节均为可复现的确定性操作。
特点
该数据集最显著的特点在于其以记忆ID集合作为检索评估的唯一答案,彻底规避了文本相似度带来的模糊性,确保了评估的精确匹配与跨系统可比性。数据集覆盖六维评估体系,包括精确检索、组合检索、时序推理、负样本及别名等价查询,共计超过千条标准化查询,全面考验AI记忆系统的召回质量。此外,数据集充分考虑了文本中的人物别名现象(如“刘备”与“刘皇叔”),通过别名证据链构建等价组,使得评估更贴合真实场景的语义多样性。所有查询均源自确定性模板,保证了每次生成的结果严格一致。
使用方法
使用者可便捷地基于自有文本语料生成定制化的测试数据库。首先需安装环境并配置LLM的API密钥(仅用于记忆抽取步骤),随后通过一行命令启动完整流水线,系统将自动执行从记忆抽取、关系构建到查询生成的完整流程,并输出结构化JSON文件。该文件包含记忆单元与查询对,可直接用于评估任意AI记忆系统。评估时,系统将记忆系统返回的文本结果映射为记忆ID集合,通过与标准答案的精确匹配计算召回率,从而实现对不同系统检索能力的客观、可复现的横向比较。
背景与挑战
背景概述
MemTest Benchmark Database 由独立研究者于2024年创建,旨在解决人工智能记忆系统评估中普遍存在的非标准化问题。当前,记忆系统的评测多依赖人工构造的查询和主观判断,难以在不同系统间进行横向对比。该数据库的核心创新在于将评估对象从文本生成转向记忆ID集检索,通过确定性模板生成查询与答案,从而实现了评估结果的精确匹配与完全可复现。基于《三国演义》《红楼梦》等经典文学作品,MemTest构建了涵盖精确检索、组合检索、时序推理、负样本及别名等价性的六维评测体系,为AI记忆系统的性能对标提供了可靠基准。
当前挑战
该数据集所面临的挑战主要体现在两个层面:其一,在领域问题层面,现有的记忆系统评估缺乏统一的度量标准,手工程序化的查询方式导致评估结果充满歧义,且不同系统的性能无法直接比较,严重阻碍了记忆增强型AI的进步。其二,在构建过程中,如何从非结构化的文本语料中自动、准确地提取结构化记忆实体(如人物、地点、事件及其关系)是一大技术难点。当前依赖大语言模型进行记忆抽取,虽能保证灵活性,却引入了非确定性和潜在的误差,同时保证数据管道其余阶段(如关系构建、查询生成)的完全确定性,以确保数据库的标准化与可复现性,构成了设计上的核心挑战。
常用场景
经典使用场景
在人工智能记忆系统评估的领域中,MemTest Benchmark Database主要被用于构建标准化、可复现的测试数据库,对各类AI记忆系统的召回质量进行客观评测。研究者可将任意文本语料输入该工具,通过其自动化流水线生成包含结构化记忆和基于ID的确定性答案查询的测试集,进而评估模型在精确检索、组合检索、时序推理、负样本判别及别名等价性等六个维度上的表现。这一流程确保了每次评估的可比性与可复现性,成为衡量记忆系统性能的标准化基石。
解决学术问题
该数据集从根本上解决了当前记忆系统评估中普遍存在的随意性与不可比较问题。以往的研究依赖于人工编写查询、“感觉正确”的主观评估以及无法跨系统对比的私有基准,导致学术成果缺乏严谨性与复现性。MemTest通过提供确定性、可复现的测试数据库和基于记忆ID集合的精确匹配评价指标,实现了评估过程的去模糊化与客观化,使不同记忆系统在同一标准下得以公正比较,极大地推进了AI记忆领域评测体系的正规化与科学化。
衍生相关工作
围绕MemTest的数据集与评估框架,已涌现出一系列推动记忆系统发展的衍生工作。例如,基于其别名解析和推理链构建模块,研究者开发了更精细的实体共指消解算法与时间关系推理模型。同时,其确定的ID匹配评价机制被多篇学术论文采纳为标准评估范式,启发了若干关注记忆模块确定性召回的新颖架构设计。这些工作共同构筑了一个以可复现评测为核心的记忆系统研究生态,不断推动领域边界的拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务