遇见数据集

OrgMemBench

收藏
github2026-06-03 更新2026-06-05 收录
官方服务:

资源简介:

OrgMemBench是一个用于评估AI代理长期组织记忆的基准数据集,包含合成的、双时间、多作者、多通道的语料库,其真实数据是从已知的源真值图中确定性地投影出来的,而不是从自由文本中读取的。该数据集旨在测量AI代理在多个渠道、多个作者和多年积累历史中回答组织决策内容、决策者、时间和原因的能力。

OrgMemBench is a benchmark dataset for evaluating the long-term organizational memory of AI Agents. It includes synthetic, dual-temporal, multi-author, multi-channel corpora, and its real data is deterministically projected from known source ground-truth maps rather than extracted from free text. This dataset aims to measure the capability of AI Agents to answer queries about organizational decision content, decision-makers, timelines and underlying causes across multiple channels, multiple authors and multi-year accumulated historical contexts.

创建时间:
2026-05-26
原始信息汇总

数据集名称

OrgMemBench(Organizational Memory Benchmark)

核心目标

衡量AI智能体在组织级、长时序记忆中回答“某组织何时、由谁、基于何种理由作出了什么决策”的能力,覆盖多通道、多作者、跨越数年累积历史的场景。

数据特点

  • 合成数据:基于种子组织“Helix Logistics”(一家2020–2026发展弧线的小型SaaS/货运科技公司)生成,避免预训练数据污染。
  • 双时态图结构:每个事实携带四个时间戳(valid_at, invalid_at, ingested_at, expired_at),事实可被作废但永不删除,支持依据指定日期回溯任意历史信念状态。
  • 多通道、多作者:跨越会议、讨论线程等多种渠道,由多个作者生成。
  • 决策溯源:不仅记录事实,还记录决策的备选方案、理由及证据链。

数据规模与分档

分档 语料数量 总Token数 问题数量
Small(小) 121 ~60K 11
Medium(中) 443 ~200K 73

测评维度与问题类别

共6个类别,按能力标签(Code)划分:

Code 类别 测评内容
C1 替代/接替(Supersession) 某个事实的当前值、被替代的值、替代时间及原因
C2 决策溯源(Decision provenance) 谁决策、何时、考虑了哪些备选方案、最终原因
C3 双时态(Bi-temporal / as-of) 组织在过去某个时间点相信什么(与当前有别)
C4 审计回放(Audit replay) 重建过去的知识状态,并标记自那以后已变化的内容
C5 证据链/推理链(Justification chain) 支持某结论的证据,每项被归类为直接证词或推理
C6 矛盾检测(Contradiction) 检测两个工件是否冲突,报告双方立场及是否已解决

评价方式

  • 评分标准:基于评分标准加权覆盖面(rubric-weighted facet coverage),分数范围为 [0,1],支持对每个子标准给予部分分数。
  • 答案需恢复结构化金记录(例如决策、决策者、决策日期、备选方案、决定因素),每个子标准独立评分,接受同义改写,遗漏则确定性扣分。

当前排行榜(Leaderboard)

在统一测试框架下,使用同一评判系统,按Medium档平均分排序(仅包含四个公开可用的记忆系统):

系统 Small档平均分 Medium档平均分
gbrain 0.394 0.428
mem0-platform 0.221 0.303
zep-cloud 0.252 0.213
graphify-oss 0.206 0.142
  • 最强系统(gbrain)仅达约0.43(Medium档),仍有约六成分数未获得。
  • 所有系统在双时态、证据链推理、矛盾检测等类别上表现极差(接近0.0–0.31)。

数据许可

  • 数据集datasets/下所有内容):CC BY 4.0(需署名,允许商业使用)。
  • 代码(评估框架、适配器、生成流程):MIT

代码与论文

搜集汇总
数据集介绍
OrgMemBench 数据集图片
构建方式
OrgMemBench是一个专为评估AI智能体在组织级长期记忆能力而设计的合成基准数据集。其构建基于一个名为Helix Logistics的虚拟中小型SaaS与货运科技公司,时间跨度覆盖2020至2026年。核心数据源自一个明确的双时态(bi-temporal)真值图,其中每个事实均携带四个时间戳(有效起始、有效结束、记录时间、过期时间),事实被作废而非删除,并保留明确的替代链接与原因。由此真值图确定性投影生成多作者、多渠道的语料库,以及带有黄金答案的、按能力标签分类的问题集,确保问题无法仅凭记忆从文本中直接读取答案。
使用方法
使用OrgMemBench评价新智能体记忆系统需编写适配器文件(位于orgmembench/adapters/),实现数据导入、检索与可选的原生回答功能。通过Docker容器化评测框架运行,支持自托管系统(如Qdrant、Neo4j)与云托管服务(仅需API密钥)。执行命令如`docker run --rm --env-file .env orgmembench run --system <名称> --tier medium --execute`进行端到端评测,或使用`judge-submission`命令直接评分已有预测结果。测试结果将自动生成排行榜,开放提交PR以扩展新系统。
背景与挑战
背景概述
在人工智能代理日益融入企业运营的背景下,其能否准确回溯与理解组织内部跨时间、跨角色、跨渠道的复杂决策过程,成为衡量其智能水平的关键维度。现有记忆基准多聚焦于单一叙述者的历史记录,难以模拟组织记忆特有的图结构、双时间与决策溯源特征。为此,Jack Gardner于2026年提出了OrgMemBench基准,旨在系统评估AI代理在长期组织记忆任务中的表现。该基准以虚构物流公司Helix Logistics为种子,构建了包含60K至200K tokens的双时间源真值图语料库,涵盖时效更新、决策溯源、双时间查询等六类核心能力。通过统一评价框架对多个公开记忆系统进行测试,揭示了当前最强系统在中等规模上仅达约0.43的平均分,表明组织级记忆问题远未被解决,为相关领域研究提供了重要的评估工具与参照平台。
当前挑战
OrgMemBench所解决的领域问题在于,现有AI代理在面对组织级记忆时存在结构性缺陷:一方面,决策信息以图形式交织于多方对话与文档中,代理需跨越时间与作者界限,从海量碎片中重建完整决策链条,这对传统的检索与推理机制构成严峻挑战;另一方面,事实的双时间特性要求系统区分有效时间与摄入时间,保留而非覆盖更新历史,同时需在矛盾与推理链任务中展现精细的逻辑判别能力。在基准构建过程中,挑战同样显著:研究者需合成一个内部逻辑一致、时间跨度达2020至2026年的公司语料,并确保每个事实携带四维时间戳与显式更替原因,以规避预训练记忆干扰。此外,如何设计部分得分的分面评分规则以公平评估系统的组织记忆表现,以及如何提供可复现的统一评估框架,亦是该基准构建中的核心难点。
常用场景
经典使用场景
OrgMemBench作为一项专为评估AI智能体在组织环境中长期记忆能力而设计的基准测试,其最经典的使用场景聚焦于多作者、多通道、双时态语料库下的决策信息检索与推理。该基准通过合成生成一个名为Helix Logistics的中小型科技企业自2020年至2026年的完整发展历程,构建了一个包含会议记录、邮件往来、内部决策文档等多种信息源交织的复杂语料环境。研究者利用该基准可以系统性地测试智能体能否从海量、异构且存在版本更迭的组织信息中,精准回答涉及决策者、决策时间、备选方案及决策缘由等结构化问题,从而衡量其超越简单文本匹配的深层记忆与推理能力。
解决学术问题
OrgMemBench聚焦解决当前AI记忆研究领域一个至关重要的学术盲区:现有基准如LoCoMo和LongMemEval多模拟单一叙述者的历史记录并已接近饱和,而BEAM虽扩展了文本量却仍局限于个体发言量的变化,无法触及组织记忆的结构性核心。该基准犀利地揭示出组织记忆在三个维度上的独特挑战——图状结构(决策与其上下游讨论、估算、批准紧密关联)、双时态特性(事实的生效时间与记录时间需严格分离,保留替代关系而非简单覆盖)以及决策溯源(事实背后的原因往往比事实本身更具价值)。OrgMemBench通过精确的合成数据设计与分级评估框架,为学术界提供了一个测量智能体在时间推理、矛盾检测和论证链追踪等高阶认知任务上能力的标准参照系。
实际应用
在实际应用层面,OrgMemBench直接服务于当前企业环境中AI智能体的部署痛点——当智能体作为运营参与者进入公司时,致命错误已从‘智能体不知道’转变为‘智能体自信地依据一个已不再正确的事实采取行动’。该基准所模拟的场景涵盖决策版本追溯、审计回放、矛盾发现等真实业务流程中的高频需求。例如,在合规审查中智能体需精确重建某个历史时间点的知识状态并标记后续变化;在项目管理中需跨会议记录和邮件链拼接某一架构决策的完整论证链条。OrgMemBench为评估记忆系统在时效性、准确性和可解释性方面的实际表现提供了可量化的标尺,直接指导企业在采购或自研记忆系统时做出有据可循的技术决策。
数据集最近研究
最新研究方向
随着AI代理在企业运营中的深度嵌入,组织记忆——即跨越多个渠道、多位作者及数年历史,准确追溯组织决策、决策者、时间及缘由的能力——已成为前沿研究焦点。当前,针对大规模、多作者、双时间维度的事实追踪与推理任务,该领域面临根本性挑战:现有记忆系统在处理决策溯源、时间跨度推理及矛盾检测时表现脆弱,即便最先进的系统也仅达到约0.43的评分(中等规模),六类核心能力中,双时间查询、逻辑链条与矛盾检测几乎瘫痪。这一瓶颈直接映射至现实场景中代理“自信地基于已过时事实行动”的致命风险,推动研究从单叙事、高饱和基准向动态图结构、双时间轴及决策因果链的全新范式转变,使模拟组织内部复杂知识迭代与审计回溯成为评估智能体长期记忆的关键战场。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务