遇见数据集

ChurnBench

收藏
arXiv2026-09-10 更新2026-09-12 收录
官方服务:

资源简介:

ChurnBench是一个开源基准测试,由独立研究者Vivek Kumar Singh和Preeti Priyam构建。该数据集以时间线而非快照形式模拟四源企业数据织物,包含180个任务,覆盖支出可见性、节省机会、关键性和利用率四个执行意图,分为单源、跨源和跨模态三个难度层级。通过确定性模拟器逐日生成员工变动、许可证重新分配、价格变更等事件,并将所有更改写入仅追加的账本,从而实现对漂移数据的精确冻结评估。该基准旨在检测AI代理答案因数据过时而产生的新鲜度错误,与推理错误区分开来,解决了现有检索基准无法测量数据陈旧性的关键缺陷。

ChurnBench is an open-source benchmark constructed by independent researchers Vivek Kumar Singh and Preeti Priyam. This dataset simulates a four-source enterprise data fabric in a timeline-based manner rather than a static snapshot, containing 180 tasks covering four core execution intents: spending visibility, savings opportunities, criticality, and utilization, and is divided into three difficulty tiers: single-source, cross-source, and cross-modal. It generates daily events such as employee turnover, license reassignment, and price changes via a deterministic simulator, and writes all modifications into an append-only ledger, enabling accurate frozen evaluation of data drift scenarios. This benchmark aims to detect freshness errors in AI Agent responses caused by outdated data, distinguish them from reasoning errors, and address the critical shortcoming of existing retrieval benchmarks that cannot measure data staleness.

提供机构:
独立研究者
创建时间:
2026-09-10
原始信息汇总

ChurnBench 数据集概述

基本信息

  • 数据集名称:ChurnBench
  • 数据集地址:https://github.com/vsingh45/churnbench
  • 许可证:MIT
  • 性质:面向企业数据架构的开源评测基准,是论文的配套工件与参考实现

数据集定位

ChurnBench 是一个感知漂移(drift-aware)的基准,用于衡量智能体(agentic)系统在异构企业技术栈中处理**时序漂移(temporal drift)的能力。模拟架构中的每一次变更都会写入真值账本(ground-truth ledger),使得智能体在时刻 T 的回答可以与 T 时刻的真实世界状态进行评分比对,从而使新鲜度误差(freshness error)**可被量化测量,而不仅仅是定性描述。

领域与应用背景

  • 领域:软件资产管理(Software Asset Management, SAM)
  • 数据内容:许可证、用户、消费事件、成本中心、合同
  • 漂移的内在性:许可证被重新分配、合同续签、用户离职、价格变动

技术栈

  • Postgres 16:历史/分析型数据仓库(类星型模式)
  • MongoDB 7:当前运营状态
  • FastAPI:模拟 SaaS API(限流、有意设计为慢速)
  • 本地文档存储:合成合同与政策(markdown/PDF)
  • 全部组件通过 docker compose up 运行

核心结果

新鲜度误差,配对比较,均在 enable_thinking=False 下,四个单元格均无永久失败:

D+1 (T′ = T − 1d) D+28 (T′ = T − 29d)
tiering ON 7 4
tiering OFF 7 45

仅凭缓存年龄几乎无法预测结果。刷新调度器是否运行可预测 11 倍的差异——且仅在时间窗口足够长、TTL 在其中失效时才成立。D+1 列是使该论断可被证伪的对照组。

快速开始

bash

启动架构

docker compose -f infra/docker-compose.yml up -d

安装

poetry install

在选定的时间线长度上生成数据集

poetry run churnbench generate --days 180 --seed 42 --out ./data/run_001

在时间戳 T 对世界状态进行快照

poetry run churnbench snapshot ./data/run_001 2024-09-15

生成评测任务

poetry run churnbench tasks ./data/run_001 --n 180

在缓存构建时间 T′ 和评测时间 T 运行实验臂

poetry run churnbench run grounding ./data/run_001 --t-prime 2024-03-29 --t 2024-04-27

对结果评分

poetry run churnbench score ./data/run_001

实验臂

  1. naive — 智能体每次查询直接访问原始数据源,无预处理
  2. classic_rag — 所有内容倒入单一向量存储,统一分块
  3. hierarchical — 每个数据源配备 worker 智能体,结果由协调器合并
  4. grounding — 所提出的架构(语义模型、源感知路由、新鲜度分层缓存)

消融实验(每次禁用一个原则):

  • grounding_no_freshness_tiers
  • grounding_no_semantic_model
  • grounding_no_source_routing

评测指标

  • 相对账本真值的准确率
  • 每任务成本(美元)
  • 端到端延迟
  • 新鲜度误差 — 在 T 时刻回答错误,但在 t_eff(实际服务数据的有效检索时间)时刻正确。要将此与普通推理错误区分开,需要针对两个参考进行评分,而非一个。

提交的结果数据

为便于评审者验证真值而非仅验证算术,仓库提交了以下数据:

  • data/full/ledger.jsonl — 所有标准答案来源的真值账本
  • results/*_full.json — 完整的逐任务结果集,包含 retry_provenance
  • results/summary_*.json — 轻量级聚合摘要
  • results/supplementary/ — 完整的新鲜度误差表(CSV),按运行及合并

原始轨迹(*.traces.jsonl)和检查点保持 gitignored。[DATA REQUIRED] 标记仅在其对应的已提交结果存在时才被替换,绝不以估计数字替代。

论文

  • paper/ 目录包含 LaTeX 源码和当前提交草稿 paper/churnbench-aixse.pdf
  • 论文标题:ChurnBench: A Drift-Aware Benchmark Demonstrating That Refresh Scheduling, Not Cache Age, Governs Staleness in Agentic AI
  • 本仓库是该论文的参考实现与基准;churnbench/ 中的代码即论文所述工件

引用

BibTeX 条目将在论文发表后添加。

搜集汇总
数据集介绍
ChurnBench 数据集图片
构建方式
ChurnBench 的构建根植于对企业级数据动态漂移本质的深刻洞察,摒弃了传统检索基准冻结语料的范式。它借助一个确定性模拟器,以时间线而非快照的方式演绎企业活动流,将每一次变更——从许可证重分配到用户离职、价格调整与合同续签——悉数写入仅追加的地面真值账本。实时数据源通过折叠账本至任一时刻而投影生成,涵盖关系型仓库、文档存储、模拟SaaS接口与合同文档库。黄金答案由非模型解析器从账本中计算得出,绝不依赖实时存储,从而确保评分过程无模型误差泄露。这种以账本为单一事实来源的构造方式,为可复现的漂移感知评测奠定了严谨根基。
特点
该数据集的核心特质在于其漂移感知与多源异质架构。它精心构建了一个四源企业数据织物,融合了PostgreSQL仓库的结构化历史事实、MongoDB的运营状态、模拟REST接口的受现实约束的SaaS延迟,以及仅能通过文档索引触及的合成合同文书,跨越结构化、半结构化与非结构化三种模态。其时间线生成机制植入泊松流驱动的雇佣、离职、重分配等事件,且变更集中于头部实体的设计精准映射了真实企业的不均衡变更分布。尤为独特的是,ChurnBench 内置了可验证的新鲜度错误协议,通过比较答案在评估时刻与有效检索时刻的黄金真值,将因数据过时而导致的错误与纯粹推理错误严格剥离,这一特性使隐性陈旧性问题首次变得可测且可证伪。
使用方法
使用 ChurnBench 时,研究者需固定两个时间戳:缓存与索引构建于 T′,而提问与评估于 T,二者之差即为缓存年龄。系统在冻结的 T 时刻世界下运行,确保可复现性。评测过程覆盖三类难度层级的任务——单源、跨源与跨模态——共180项,源自消费可见性、节约机会、关键性与利用率四类高管意图的模板化生成。每次运行精确记录准确率、成本、延迟及新鲜度错误四项指标。通过对比分层刷新启用与禁用两种配置,或扫描不同缓存年龄与TTL设置,用户可直接观测到陈旧性暴露与实体变更率及层级宽度乘积的关联。完整的评估工具链、账本及逐错误数据均开源,支持从已提交文件重新验证每一个新鲜度错误,无需重新调用模型。
背景与挑战
背景概述
在企业级智能体系统的生产部署中,检索增强生成所依赖的数据基底横跨关系型数据仓库、文档存储、SaaS接口与合同文本等异构来源,许可证重分配、用户离职、价格调整与合同续签等变更时刻发生,使得智能体即便推理无误也可能因底层数据过期而给出失实答案。然而,现有检索与智能体评测基准普遍将语料冻结为静态快照,仅能衡量检索是否命中正确段落,无法追问答案在其被评估时是否仍然成立。ChurnBench由独立研究者Vivek Kumar Singh与Preeti Priyam于2026年提出,以软件资产管理为领域,将企业数据织体构建为随时间演化的时间线而非快照,通过仅追加的基准真值账本区分新鲜度错误与推理错误,为漂移数据环境下的智能体评测提供了可复现的开源测量工具与方法论框架。
当前挑战
该数据集所面对的领域难题在于,数据陈旧性在传统评测设计中本质上是不可见的:冻结语料无法产生过期答案,因而这一故障模式既未被度量,也难以在既有评测范式下被度量。企业场景中的陈旧性寄存于缓存、物化聚合与向量索引之中,而非文本语料之内,基于事实级取代规则的方案对此无能为力。构建过程中亦面临多重挑战:需在保证精确可复现的前提下模拟多源异构数据的受控漂移,借助仅追加账本与非模型解析器消除评分环节的模型误差泄漏;需校准泊松事件流以贴近真实企业变更统计,而部分变异率缺乏公开来源;还需设计可证伪的新鲜度错误判定协议,在双时间戳上重新解析真值,以将答案曾一度正确而评估时已失效的情形与从未正确的推理失败严格区分开来。
常用场景
经典使用场景
在检索增强生成与智能体评估领域,ChurnBench的经典用法是作为时间线驱动的基准,评估智能体在数据持续漂移环境下的答案时效性。它生成四源企业数据织物——涵盖PostgreSQL仓库、MongoDB操作存储、限流REST接口与合同文档索引,每个变更均写入仅追加的地面真值账本。通过冻结时刻T′构建缓存与索引、在时刻T评估,系统能够自动判定答案是否因数据过期而失效,从而将陈旧误差与推理错误精确剥离,为漂移感知评估提供了可复现的测量工具。
解决学术问题
ChurnBench直击现有检索基准冻结语料、无法度量答案时效性的根本缺陷。传统基准只能检验检索是否命中正确段落,却无从判断答案在评估时刻是否依然为真。该数据集通过双时间戳地面真值解析机制,解决了陈旧误差无法被自动检测与归因的学术难题,使研究者能够区分“曾经正确但已过期”与“从未正确”两类错误。其意义在于将数据新鲜度从不可见的运维问题提升为可测量、可证伪的研究变量,为漂移感知评估奠定了方法论基础。
衍生相关工作
ChurnBench的发布催生了围绕漂移感知评估的系列后续工作。其仅追加账本与双时间戳验证协议被借鉴用于扩展记忆存储的时效性研究,推动了从事实级取代规则向缓存层、物化聚合与向量索引刷新机制的跨越。该基准还激发了对分层刷新调度机制的消融研究,以及将漂移基准扫描变量从窗口长度转向生存时间配置与实体变异率乘积的范式转变。后续工作进一步探索了运行中持续漂移、跨领域迁移以及多种接地架构在陈旧度与成本间的权衡比较。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务