遇见数据集

InMind

收藏
github2026-07-28 更新2026-07-30 收录
数据链接:
官方服务:

资源简介:

InMind是一个包含125个任务的基准数据集,用于评估长期记忆代理在后续查询仅通过世界知识与先前陈述的用户事实相关联时,能否应用该事实。它针对隐性关联盲点:一个记忆可能对查询至关重要,但表面上看起来不相似。

InMind is a benchmark dataset consisting of 125 tasks, designed to evaluate whether long-term memory agents can apply previously stated user facts when subsequent queries are only associated with these facts via world knowledge. It targets the implicit association blind spot: a memory that may be critical to a given query but appears superficially dissimilar to it.

创建时间:
2026-07-19
原始信息汇总

数据集概述:InMind

InMind 是一个专门用于评估长期记忆智能体在隐式关联场景下表现的数据集与基准测试平台。它包含 125个任务,旨在检测一个关键缺陷:隐式关联盲区——即当后续查询与先前存储的用户事实仅在常识层面存在关联、文本表面不相似时,智能体无法应用该事实。

核心问题:检索-使用接口的盲点

传统的检索式记忆遵循“先检索,后使用”模式。当查询本身不是好的检索线索时(例如,“树坚果过敏”与“马卡龙食谱”),如果检索在语言模型看到记忆之前发生,关键信息可能被遗漏。

InMind 的分离式诊断设计

每个任务包含一对查询(直接查询与间接查询),以分离不同类型的失败原因:

测量指标 解决的问题 分离的失败类型
直接召回 系统能否在直接询问时检索到事实? 存储或直接检索失败
上下文控制 当事实可见时,模型能否应用其中隐含的关联? 模型常识缺失或推理失败
目标召回 决定性事实是否被成功传递给了间接查询的上下文? 检索或路由失败
应用 最终答案是否恰当地使用了该事实? 端到端记忆使用失败

数据集概览

属性
任务总数 125
评估语言 英语
领域数量 10
用户事实 全合成数据
任务单元 记忆对话轮 + 直接查询 + 间接查询 + 预期常识桥梁
数据格式 JSON Lines,附带 JSON Schema

领域分布:

  • 健康与保健: 46个任务
  • 职业与职业发展: 26个任务
  • 人际关系: 16个任务
  • 财务: 8个任务
  • 法律: 7个任务
  • 精神信仰: 7个任务
  • 消费者: 5个任务
  • 育儿: 4个任务
  • 个人发展: 3个任务
  • 其他: 3个任务

任务结构示例(任务ID: 155)

组成部分 示例内容
记忆 “我刚发现我对树坚果过敏,因为我吃了些什锦坚果。”
直接查询 “你告诉过我你对什么食物过敏?”
间接查询 “我这周末想尝试做马卡龙。有什么好食谱吗?”
常识桥梁 传统马卡龙使用杏仁粉,因此这个过敏史应改变回答。

每个记录都包含之前的用户/助手对话、两个查询、预期应用、领域、可选的桥梁结构字段以及公开出处信息。

数据集获取与使用

  • 克隆仓库git clone https://github.com/imlrz/InMind.git
  • 数据文件benchmark/dataset/inmind.jsonl(需验证有125条记录)
  • 加载示例:可使用Python的json模块,通过task_id(如155)访问特定任务。

评估系统

  • 背景轨迹:包含论文中使用的固定 LongMemEval-s 背景轨迹。
  • 评估流程:提供中间注入、答案和评判提示、验证工具及提交框架。可从 evaluation/README.md 开始。
  • 编码智能体skills/evaluate-inmind/SKILL.md 提供了可执行的集成检查清单。

相关资源

负责任使用说明

所有用户事实和对话均为合成数据。为了揭示记忆失败在敏感情境(如医疗、移民、宗教等)中的严重后果,部分任务故意包含此类内容。InMind 是评估工具,不提供任何形式的建议。由于基准测试规模较小且旨在诊断,不应过度解读小的百分比差异。

搜集汇总
数据集介绍
InMind 数据集图片
构建方式
InMind基准测试集以125项精心设计的任务为核心,每项任务均包含一条合成用户事实、一条直接回忆查询和一条语义遥远的间接应用查询,并辅以必要的外部知识桥梁。数据生成采用全合成方式,覆盖健康、职业、法律等10个领域,确保事实与查询间无表面重叠。每条记录结构化存储用户/助手的记忆轮次、两种查询、预期应用、领域标签及可选的桥梁信息,并通过JSON Lines格式组织,附带JSON Schema进行验证。任务ID采用稀疏整数编码,保留审计痕迹,便于后续联合查询。
特点
该数据集的独特之处在于揭示了隐式关联盲区:当后续查询仅通过世界知识与先前事实产生关联时,智能体即便能直接回忆事实,也可能在应用阶段失败。通过配对设计,InMind分离出四种失败模式:直接回忆失败、上下文内推理缺失、关键记忆未进入上下文、以及最终应用错误。这种分解诊断能力使其超越了传统检索基准,能精准定位存储、路由或生成环节的瓶颈。任务覆盖敏感领域(如医疗、法律),强化了评估的现实价值。
使用方法
使用前需通过Git克隆仓库获取包含125条记录的`inmind.jsonl`文件,并利用验收脚本`validate_release.py`验证完整性。评估时,固定使用LongMemEval-s背景轨迹,遵循中间注入协议生成独立时间线,使直接与间接查询可基于同一冻结记忆状态独立评测。研究者可调用`build_timeline.py`为指定任务构建包含背景会话的时间线。对于编码智能体,项目提供了`SKILL.md`技能文件,集成执行检查清单,指导自动评估。社区排行榜和提交模式支持结果对比与复现。
背景与挑战
背景概述
InMind数据集由一群致力于探索人工智能记忆系统局限性的研究人员于近期创建,旨在揭示长期记忆智能体在隐式关联场景中的“盲点”。该数据集的核心研究问题聚焦于:当用户事后提出的查询与先前陈述的事实之间缺乏直接的语义重叠,仅能通过世界知识建立联系时,记忆系统能否成功应用这些事实。这一研究填补了现有基准测试在评估智能体隐性知识迁移能力方面的空白。在相关领域,传统检索式记忆系统在处理诸如“树坚果过敏”与“马卡龙食谱”这类表面无关但实质关联的查询时往往失效,而InMind通过125项精心设计的任务,为系统性评估这一能力缺陷提供了标准化框架,对推动更鲁棒、更智能的记忆感知代理系统的发展具有重要影响力。
当前挑战
该数据集主要应对以下挑战:首先,在领域问题层面,它致力于解决长期记忆智能体在隐式关联任务中的认知盲点——即智能体能够直接回忆用户陈述的事实,却无法在与之语义距离较远的后续查询中应用该事实,这揭示了现有检索-使用接口在处理需要世界知识作为桥梁的复杂场景时的根本局限。其次,在构建过程中,研究团队面临如何精心设计每对“直接查询”与“间接查询”以确保它们共享同一事实却缺乏表面相似性的挑战,这要求深入理解不同知识领域的隐性关联关系。此外,数据集还面临如何通过配对设计精确隔离失败来源(如存储失败、路由失败或推理失败)的挑战,以及如何涵盖十个敏感领域(如健康、法律、精神信仰等)并生成合成用户事实以规避隐私风险的困难。
常用场景
经典使用场景
在基于长期记忆的智能体研究领域中,InMind基准测试被广泛用于评估智能体在隐式关联场景下的记忆检索与推理能力。每个任务均构建了一则合成用户事实,并配以直接查询和通过世界知识间接关联的应用查询,旨在测试智能体能否在表面语义无重叠的情况下,将先前存储的用户信息应用于后续复杂交互。该基准涵盖10个领域共125项任务,涉及健康、职业、法律等敏感议题,为系统化的隐式记忆盲点评估提供了标准化测试平台。
解决学术问题
InMind精准定位并量化了长期记忆智能体中一个被长期忽视的缺陷——隐式关联盲点。传统检索式记忆系统依据查询与存储文本的表面相似度进行召回,当相关性依赖于外部世界知识时,常导致关键信息被遗漏。通过配对诊断设计,InMind能够区分存储失败、检索失败与推理失败等不同类型的错误根源,为记忆系统研究提供了精细化的失败分析框架,显著推动了动态记忆路由与跨知识桥梁构建的理论进展。
衍生相关工作
InMind的发布催生了一系列围绕隐式关联记忆的经典工作,包括提出基于动态知识图的记忆路由方法、开发面向隐式语义匹配的混合检索模型,以及构建多模态知识桥接框架以增强因果推理能力。后续研究还借鉴其配对诊断范式,拓展至情感记忆、道德决策与跨会话一致性等更复杂的认知维度验证,形成了以隐式关联为中心的智能体记忆评估子领域,显著加速了下一代上下文感知系统的迭代进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务