InMind
收藏资源简介:
InMind是一个包含125个任务的基准数据集,用于评估长期记忆代理在后续查询仅通过世界知识与先前陈述的用户事实相关联时,能否应用该事实。它针对隐性关联盲点:一个记忆可能对查询至关重要,但表面上看起来不相似。
InMind is a benchmark dataset consisting of 125 tasks, designed to evaluate whether long-term memory agents can apply previously stated user facts when subsequent queries are only associated with these facts via world knowledge. It targets the implicit association blind spot: a memory that may be critical to a given query but appears superficially dissimilar to it.
数据集概述:InMind
InMind 是一个专门用于评估长期记忆智能体在隐式关联场景下表现的数据集与基准测试平台。它包含 125个任务,旨在检测一个关键缺陷:隐式关联盲区——即当后续查询与先前存储的用户事实仅在常识层面存在关联、文本表面不相似时,智能体无法应用该事实。
核心问题:检索-使用接口的盲点
传统的检索式记忆遵循“先检索,后使用”模式。当查询本身不是好的检索线索时(例如,“树坚果过敏”与“马卡龙食谱”),如果检索在语言模型看到记忆之前发生,关键信息可能被遗漏。
InMind 的分离式诊断设计
每个任务包含一对查询(直接查询与间接查询),以分离不同类型的失败原因:
| 测量指标 | 解决的问题 | 分离的失败类型 |
|---|---|---|
| 直接召回 | 系统能否在直接询问时检索到事实? | 存储或直接检索失败 |
| 上下文控制 | 当事实可见时,模型能否应用其中隐含的关联? | 模型常识缺失或推理失败 |
| 目标召回 | 决定性事实是否被成功传递给了间接查询的上下文? | 检索或路由失败 |
| 应用 | 最终答案是否恰当地使用了该事实? | 端到端记忆使用失败 |
数据集概览
| 属性 | 值 |
|---|---|
| 任务总数 | 125 |
| 评估语言 | 英语 |
| 领域数量 | 10 |
| 用户事实 | 全合成数据 |
| 任务单元 | 记忆对话轮 + 直接查询 + 间接查询 + 预期常识桥梁 |
| 数据格式 | JSON Lines,附带 JSON Schema |
领域分布:
- 健康与保健: 46个任务
- 职业与职业发展: 26个任务
- 人际关系: 16个任务
- 财务: 8个任务
- 法律: 7个任务
- 精神信仰: 7个任务
- 消费者: 5个任务
- 育儿: 4个任务
- 个人发展: 3个任务
- 其他: 3个任务
任务结构示例(任务ID: 155)
| 组成部分 | 示例内容 |
|---|---|
| 记忆 | “我刚发现我对树坚果过敏,因为我吃了些什锦坚果。” |
| 直接查询 | “你告诉过我你对什么食物过敏?” |
| 间接查询 | “我这周末想尝试做马卡龙。有什么好食谱吗?” |
| 常识桥梁 | 传统马卡龙使用杏仁粉,因此这个过敏史应改变回答。 |
每个记录都包含之前的用户/助手对话、两个查询、预期应用、领域、可选的桥梁结构字段以及公开出处信息。
数据集获取与使用
- 克隆仓库:
git clone https://github.com/imlrz/InMind.git - 数据文件:
benchmark/dataset/inmind.jsonl(需验证有125条记录) - 加载示例:可使用Python的
json模块,通过task_id(如155)访问特定任务。
评估系统
- 背景轨迹:包含论文中使用的固定
LongMemEval-s背景轨迹。 - 评估流程:提供中间注入、答案和评判提示、验证工具及提交框架。可从
evaluation/README.md开始。 - 编码智能体:
skills/evaluate-inmind/SKILL.md提供了可执行的集成检查清单。
相关资源
- 论文:arXiv 链接:Abstract · PDF
- 排行榜:Leaderboard
- 项目主页:Website
负责任使用说明
所有用户事实和对话均为合成数据。为了揭示记忆失败在敏感情境(如医疗、移民、宗教等)中的严重后果,部分任务故意包含此类内容。InMind 是评估工具,不提供任何形式的建议。由于基准测试规模较小且旨在诊断,不应过度解读小的百分比差异。





