OrgMemBench
收藏资源简介:
OrgMemBench是一个用于评估AI代理长期组织记忆的基准数据集,包含合成的、双时间、多作者、多通道的语料库,其真实数据是从已知的源真值图中确定性地投影出来的,而不是从自由文本中读取的。该数据集旨在测量AI代理在多个渠道、多个作者和多年积累历史中回答组织决策内容、决策者、时间和原因的能力。
OrgMemBench is a benchmark dataset for evaluating the long-term organizational memory of AI Agents. It includes synthetic, dual-temporal, multi-author, multi-channel corpora, and its real data is deterministically projected from known source ground-truth maps rather than extracted from free text. This dataset aims to measure the capability of AI Agents to answer queries about organizational decision content, decision-makers, timelines and underlying causes across multiple channels, multiple authors and multi-year accumulated historical contexts.
数据集名称
OrgMemBench(Organizational Memory Benchmark)
核心目标
衡量AI智能体在组织级、长时序记忆中回答“某组织何时、由谁、基于何种理由作出了什么决策”的能力,覆盖多通道、多作者、跨越数年累积历史的场景。
数据特点
- 合成数据:基于种子组织“Helix Logistics”(一家2020–2026发展弧线的小型SaaS/货运科技公司)生成,避免预训练数据污染。
- 双时态图结构:每个事实携带四个时间戳(
valid_at,invalid_at,ingested_at,expired_at),事实可被作废但永不删除,支持依据指定日期回溯任意历史信念状态。 - 多通道、多作者:跨越会议、讨论线程等多种渠道,由多个作者生成。
- 决策溯源:不仅记录事实,还记录决策的备选方案、理由及证据链。
数据规模与分档
| 分档 | 语料数量 | 总Token数 | 问题数量 |
|---|---|---|---|
| Small(小) | 121 | ~60K | 11 |
| Medium(中) | 443 | ~200K | 73 |
测评维度与问题类别
共6个类别,按能力标签(Code)划分:
| Code | 类别 | 测评内容 |
|---|---|---|
| C1 | 替代/接替(Supersession) | 某个事实的当前值、被替代的值、替代时间及原因 |
| C2 | 决策溯源(Decision provenance) | 谁决策、何时、考虑了哪些备选方案、最终原因 |
| C3 | 双时态(Bi-temporal / as-of) | 组织在过去某个时间点相信什么(与当前有别) |
| C4 | 审计回放(Audit replay) | 重建过去的知识状态,并标记自那以后已变化的内容 |
| C5 | 证据链/推理链(Justification chain) | 支持某结论的证据,每项被归类为直接证词或推理 |
| C6 | 矛盾检测(Contradiction) | 检测两个工件是否冲突,报告双方立场及是否已解决 |
评价方式
- 评分标准:基于评分标准加权覆盖面(rubric-weighted facet coverage),分数范围为
[0,1],支持对每个子标准给予部分分数。 - 答案需恢复结构化金记录(例如决策、决策者、决策日期、备选方案、决定因素),每个子标准独立评分,接受同义改写,遗漏则确定性扣分。
当前排行榜(Leaderboard)
在统一测试框架下,使用同一评判系统,按Medium档平均分排序(仅包含四个公开可用的记忆系统):
| 系统 | Small档平均分 | Medium档平均分 |
|---|---|---|
| gbrain | 0.394 | 0.428 |
| mem0-platform | 0.221 | 0.303 |
| zep-cloud | 0.252 | 0.213 |
| graphify-oss | 0.206 | 0.142 |
- 最强系统(gbrain)仅达约0.43(Medium档),仍有约六成分数未获得。
- 所有系统在双时态、证据链推理、矛盾检测等类别上表现极差(接近0.0–0.31)。
数据许可
- 数据集(
datasets/下所有内容):CC BY 4.0(需署名,允许商业使用)。 - 代码(评估框架、适配器、生成流程):MIT。
代码与论文
- 论文PDF:paper/OrgMemBench.pdf
- 数据位置:datasets/helix
- 引用格式(BibTeX)见数据集页面中的Citation部分。




