WRIT
收藏资源简介:
WRIT (Write Integrity Test) 评估AI系统在多会话交互中是否能够保持正确、可用和演化的状态。它通过持久性、更新正确性、约束应用以及在噪声和时间间隔下的可靠性来衡量内存。WRIT测试检索基准遗漏的故障模式:静默漂移、丢失历史、损坏的来源和不可检测的损坏。
WRIT (Write Integrity Test) evaluates whether AI systems can maintain correct, usable, and evolving states during multi-session interactions. It measures system memory through persistence, update correctness, constraint enforcement, and reliability under noise and across time intervals. The WRIT test identifies failure modes overlooked by existing benchmarks: silent drift, lost history, corrupted provenance, and undetectable corruption.
WRIT 数据集概述
数据集简介
WRIT(Write Integrity Test)是一个用于评估AI系统在多轮会话交互中,随时间推移维持正确、可用且不断演化的状态能力的基准测试。它衡量记忆的持久性、更新正确性、约束应用以及在噪声和时间间隔下的可靠性。
核心目标
测试现有检索基准所忽略的故障模式:静默漂移、历史丢失、来源链断裂和不可检测的损坏。
数据集范围
包含内容:
- 多会话对话记忆(每个场景5-20个会话)
- 结构化和非结构化状态
- 将智能体与记忆系统作为一个整体进行测试
- 随时间推移的写入完整性
- 时间状态重建
排除内容:
- 单轮问答
- 静态语料库上的纯检索准确性
- 静态长上下文窗口测试
核心概念
记忆类型
- 显性事实:用户明确陈述的信息。
- 可变事实:随时间变化的事实。
- 潜在约束:隐含的偏好和目标。
- 工作状态:持续的计划、任务或工作流。
- 实体与关系:人员、地点和关联对象。
- 非记忆:不应持久化的信息。
故障模式
- 幻觉:模型层面的问题,LLM生成的内容没有输入依据。
- 记忆损坏:基础设施层面的问题,存储的数据是错误的。
场景结构
每个场景包含:
- 对话时间线
- 记忆事件
- 干扰
- 探测任务
- 评估
数据模式
数据采用JSON格式,主要字段包括:scenario_id、version、category、sessions、memory_events、probe、ground_truth、failure_modes。
能力类别
测试的能力包括:检索、更新处理、历史保存、时间回放、来源追溯、约束推断、多跳推理、选择性遗忘、弃答。
故障模式
定义的故障模式包括:陈旧记忆、记忆缺失、错误泛化、记忆幻觉、约束违反、检索未命中、过度保留、错误置信、静默漂移、来源丢失。
评估指标
核心指标
- 召回准确率
- 更新保真度
- 漂移率
- 可检测性
- 约束一致性
- 应用正确性
- 弃答质量
诊断指标
- 陈旧使用率
- 幻觉率
- 干扰项敏感性
- 时间准确性
- 来源完整性
- 过度保留率
评估模式
每个场景在三种模式下运行以隔离故障归因:
- 无记忆模式:系统仅接收探测问题,无先前上下文。
- 原生记忆模式:系统在处理所有会话后使用自身记忆。
- 先知记忆模式:系统接收完美的真实记忆状态。
数据集构成
- 70% 合成场景(程序生成,确定性真实值)
- 30% 人工编写场景(真实的对话模式,边缘情况)
使用案例
- 评估记忆系统
- 内存基础设施的测试驱动开发
- 智能体指令调优
- 行业透明度
与现有基准的比较
WRIT专注于测试写入完整性(存储的事实在被写入后是否仍然正确),而现有主流基准(如LoCoMo、LongMemEval、BEAM、AMB)主要测试检索能力(能否找到存储的事实)。WRIT旨在捕捉检索基准在结构上无法检测的故障。
设计原则
- 真实性优于简单性
- 故障分析优于排名
- 多会话优于单轮
- 写入完整性优于读取速度
- 状态性优于无状态评估
运行方式
通过命令行工具运行基准测试,支持指定适配器和场景类别。
适配器
WRIT通过适配器测试记忆系统。内置适配器包括用于测试Neotoma的neotoma和用于对比的基线baseline。
局限性
- 比传统基准测试成本更高
- 部分依赖人工评估进行模糊探测
- 约束推断的评分更难标准化
许可证
MIT 许可证





