Governed Memory Experiment Datasets
收藏资源简介:
该仓库包含用于测试治理记忆能力的合成数据集,每个数据集都配有真实文件以进行客观评估。数据集包括多种业务内容类型,如转录、电子邮件、聊天、文档和通话记录等,以及治理路由对、多源数据、召回查询等特定实验数据。所有数据集均为合成数据,不包含真实客户数据、个人身份信息或专有信息。
This repository contains synthetic datasets designed for testing governance memory capabilities. Each dataset is accompanied by authentic reference files for objective evaluation. The datasets cover various business content types including transcripts, emails, chat conversations, documents, call logs, and more, along with specific experimental data such as governance routing pairs, multi-source data, recall queries, and more. All datasets are synthetic and do not contain any real customer data, personally identifiable information (PII), or proprietary information.
Governed Memory 实验数据集概述
数据集基本信息
- 数据集名称:Governed Memory: Experiment Datasets
- 数据集用途:为论文《Governed Memory: A Shared Layer for Accuracy and Compliance Across Agentic Workflows》提供合成数据集和实验方案,用于压力测试治理记忆能力。
- 数据性质:完全合成数据,不包含任何真实客户数据、个人身份信息或专有信息。
数据集内容构成
1. 合成数据集
- 主要数据集:包含250个带标签的内容样本,用于实验E01。
- 内容类型与样本分布:
- 会议记录:50个样本,平均约2500词。
- 邮件线程:50个样本,平均约1600词。
- 聊天记录:50个样本,平均约1000词。
- 账户文档:50个样本,平均约2000词。
- 通话笔记:50个样本,平均约500词。
- 多源实体数据集:位于
synthetic datasets/multi_source/,包含关于同一实体(Sarah Chen, TechFlow Inc)的5个来源数据,用于实验E06和E10。 - 冲突对数据集:位于
synthetic datasets/conflict_pairs/,包含30对陈旧/新鲜事实对,用于实验E14。 - 对抗性治理场景数据集:位于
synthetic datasets/adversarial_governance/,包含50个场景,用于实验E15。 - 其他专项数据集:包括
governance_pairs、entity_isolation、recall_queries等。
2. 实验方案
- 包含15项实验(E01至E15)的可复现测量流程,详细说明见
experiments.md。
3. 模式集合
- 文件
experiment-collections-import.json包含实验使用的三个模式集合:- 集合A:销售联系人(14个属性,定义清晰),用于多项实验。
- 集合B:销售联系人(相同14个属性,其中6个描述故意模糊),用于实验E05的“之前”状态。
- 集合C:支持工单(8个属性),用于实验E01以增加内容多样性。
4. API参考
- 位于
api/目录下,包含认证和端点文档,用于通过Governed Memory API复现实验。
数据结构与标注
- 基本结构:每个内容样本(
.txt文件)均附带一个.ground_truth.json标注文件。 - 标注内容:
- 样本ID、公司、行业、词数。
- 预期事实列表(包含显式和隐含类型)。
- 预期属性键值对。
- 植入的问题数量(未解析代词、相对时间引用、近似重复事实)。
- 多源实体数据特点:包含36个独特事实,其中10个出现在2个以上来源中(去重目标),4个相似但语义不同(不应去重)。
实验覆盖的能力维度
- 提取质量:跨内容类型的事实与属性提取准确性(E01)。
- 记忆密度:记忆密度与输出质量的关系(E02)。
- 治理路由:治理路由精度(E03, E13)。
- 渐进交付:令牌节省(E04)。
- 模式生命周期:模式优化前后的效果(E05)。
- 去重效果:大规模去重有效性(E06)。
- 回忆性能:回忆速度、相关性和阶段细分(E07, E10)。
- 端到端工作流:四条件消融实验(E08)。
- 质量门控:质量门控对输出的影响(E09)。
- 实体隔离:跨实体泄漏检测(E11)。
- 双重记忆互补性:开放集、仅模式与组合模式对比(E12)。
- 时间冲突解决:时间冲突解决准确性(E14)。
- 对抗性约束执行:在对抗性输入下的治理约束执行(E15)。
数据生成与使用
- 生成方法:遵循
experiment-data-guide.md中的方法生成,确保每个样本具有已知的基准事实以实现客观评估。 - 内容场景:模拟8个行业(SaaS、金融科技、医疗保健、电子商务、制造、物流、媒体、教育)的B2B商业对话。
- 复现要求:需要访问Governed Memory API及具有工作区读写权限的API密钥。
- 基础工作流示例:提供了使用SDK复现实验E01(提取质量)的完整代码示例。
文件目录结构
experiments datasets/ ├── README.md ├── experiments.md ├── experiment-data-guide.md ├── experiment-collections-import.json ├── api/ │ ├── authentication.md │ └── endpoints/ ├── results/ (包含E01-E15各实验的结果目录) └── synthetic datasets/ (包含所有合成数据集的目录)
许可证与引用
- 合成数据集(内容及基准事实文件)供研究使用。
- 实验方案和API文档版权归作者所有。
- 论文正式发表后将添加引用信息。




