ChurnBench
收藏资源简介:
ChurnBench是一个开源基准测试,由独立研究者Vivek Kumar Singh和Preeti Priyam构建。该数据集以时间线而非快照形式模拟四源企业数据织物,包含180个任务,覆盖支出可见性、节省机会、关键性和利用率四个执行意图,分为单源、跨源和跨模态三个难度层级。通过确定性模拟器逐日生成员工变动、许可证重新分配、价格变更等事件,并将所有更改写入仅追加的账本,从而实现对漂移数据的精确冻结评估。该基准旨在检测AI代理答案因数据过时而产生的新鲜度错误,与推理错误区分开来,解决了现有检索基准无法测量数据陈旧性的关键缺陷。
ChurnBench is an open-source benchmark constructed by independent researchers Vivek Kumar Singh and Preeti Priyam. This dataset simulates a four-source enterprise data fabric in a timeline-based manner rather than a static snapshot, containing 180 tasks covering four core execution intents: spending visibility, savings opportunities, criticality, and utilization, and is divided into three difficulty tiers: single-source, cross-source, and cross-modal. It generates daily events such as employee turnover, license reassignment, and price changes via a deterministic simulator, and writes all modifications into an append-only ledger, enabling accurate frozen evaluation of data drift scenarios. This benchmark aims to detect freshness errors in AI Agent responses caused by outdated data, distinguish them from reasoning errors, and address the critical shortcoming of existing retrieval benchmarks that cannot measure data staleness.
ChurnBench 数据集概述
基本信息
- 数据集名称:ChurnBench
- 数据集地址:https://github.com/vsingh45/churnbench
- 许可证:MIT
- 性质:面向企业数据架构的开源评测基准,是论文的配套工件与参考实现
数据集定位
ChurnBench 是一个感知漂移(drift-aware)的基准,用于衡量智能体(agentic)系统在异构企业技术栈中处理**时序漂移(temporal drift)的能力。模拟架构中的每一次变更都会写入真值账本(ground-truth ledger),使得智能体在时刻 T 的回答可以与 T 时刻的真实世界状态进行评分比对,从而使新鲜度误差(freshness error)**可被量化测量,而不仅仅是定性描述。
领域与应用背景
- 领域:软件资产管理(Software Asset Management, SAM)
- 数据内容:许可证、用户、消费事件、成本中心、合同
- 漂移的内在性:许可证被重新分配、合同续签、用户离职、价格变动
技术栈
- Postgres 16:历史/分析型数据仓库(类星型模式)
- MongoDB 7:当前运营状态
- FastAPI:模拟 SaaS API(限流、有意设计为慢速)
- 本地文档存储:合成合同与政策(markdown/PDF)
- 全部组件通过
docker compose up运行
核心结果
新鲜度误差,配对比较,均在 enable_thinking=False 下,四个单元格均无永久失败:
D+1 (T′ = T − 1d) |
D+28 (T′ = T − 29d) |
|
|---|---|---|
| tiering ON | 7 | 4 |
| tiering OFF | 7 | 45 |
仅凭缓存年龄几乎无法预测结果。刷新调度器是否运行可预测 11 倍的差异——且仅在时间窗口足够长、TTL 在其中失效时才成立。D+1 列是使该论断可被证伪的对照组。
快速开始
bash
启动架构
docker compose -f infra/docker-compose.yml up -d
安装
poetry install
在选定的时间线长度上生成数据集
poetry run churnbench generate --days 180 --seed 42 --out ./data/run_001
在时间戳 T 对世界状态进行快照
poetry run churnbench snapshot ./data/run_001 2024-09-15
生成评测任务
poetry run churnbench tasks ./data/run_001 --n 180
在缓存构建时间 T′ 和评测时间 T 运行实验臂
poetry run churnbench run grounding ./data/run_001 --t-prime 2024-03-29 --t 2024-04-27
对结果评分
poetry run churnbench score ./data/run_001
实验臂
naive— 智能体每次查询直接访问原始数据源,无预处理classic_rag— 所有内容倒入单一向量存储,统一分块hierarchical— 每个数据源配备 worker 智能体,结果由协调器合并grounding— 所提出的架构(语义模型、源感知路由、新鲜度分层缓存)
消融实验(每次禁用一个原则):
grounding_no_freshness_tiersgrounding_no_semantic_modelgrounding_no_source_routing
评测指标
- 相对账本真值的准确率
- 每任务成本(美元)
- 端到端延迟
- 新鲜度误差 — 在
T时刻回答错误,但在t_eff(实际服务数据的有效检索时间)时刻正确。要将此与普通推理错误区分开,需要针对两个参考进行评分,而非一个。
提交的结果数据
为便于评审者验证真值而非仅验证算术,仓库提交了以下数据:
data/full/ledger.jsonl— 所有标准答案来源的真值账本results/*_full.json— 完整的逐任务结果集,包含retry_provenanceresults/summary_*.json— 轻量级聚合摘要results/supplementary/— 完整的新鲜度误差表(CSV),按运行及合并
原始轨迹(*.traces.jsonl)和检查点保持 gitignored。[DATA REQUIRED] 标记仅在其对应的已提交结果存在时才被替换,绝不以估计数字替代。
论文
paper/目录包含 LaTeX 源码和当前提交草稿paper/churnbench-aixse.pdf- 论文标题:ChurnBench: A Drift-Aware Benchmark Demonstrating That Refresh Scheduling, Not Cache Age, Governs Staleness in Agentic AI
- 本仓库是该论文的参考实现与基准;
churnbench/中的代码即论文所述工件
引用
BibTeX 条目将在论文发表后添加。




