遇见数据集

DBA-Bench

收藏
arXiv2026-07-24 更新2026-07-28 收录
数据链接:
官方服务:

资源简介:

DBA-Bench是由电子科技大学研究团队创建的一个面向生产环境的数据库操作基准测试数据集,旨在评估基于大语言模型的数据库代理系统。该数据集包含106个精心设计的场景,覆盖了查询调优、故障恢复、模式变更等7个核心任务领域,每个场景均基于全仪器化的PostgreSQL环境构建,并注入活跃的OLTP/OLAP混合工作负载以模拟真实生产复杂性。数据集通过可控的场景复现机制确保每次测试的因果故障状态一致,同时提供多源观测数据如时间序列指标、系统日志和查询计划。其核心应用在于系统化评估数据库代理在诊断深度、环境噪声和操作安全约束下的端到端修复能力,为解决现有评估方法在实时交互、开放解空间和场景覆盖度方面的差距提供标准化测试平台。

DBA-Bench is a production-oriented database operation benchmark dataset developed by the research team from the University of Electronic Science and Technology of China (UESTC), designed to evaluate Large Language Model (LLM)-based database proxy systems. This dataset includes 106 meticulously designed scenarios spanning seven core task domains, such as query tuning, failure recovery, schema change and other related tasks. Each scenario is constructed on a fully instrumented PostgreSQL environment, with active mixed OLTP/OLAP workloads injected to simulate the complexity of real-world production scenarios. The dataset ensures consistent causal fault states across all tests through a controllable scenario reproduction mechanism, while offering multi-source observational data including time-series metrics, system logs and query plans. Its core application lies in systematically evaluating the end-to-end repair capabilities of database proxies under the constraints of diagnostic depth, environmental noise and operational security, providing a standardized testing platform to address the gaps in existing evaluation methods regarding real-time interaction, open solution space and scenario coverage.

提供机构:
电子科技大学
创建时间:
2026-07-24
原始信息汇总

数据集名称

DBA-Bench

当前状态

  • 正处于公开发布前的准备阶段
  • 代码库、文档与基准测试场景正在最终确定中

预计发布

  • 将在近期开源

后续动作

  • 该仓库将在发布时被归档并建立镜像
  • 可通过关注此仓库或查阅相关论文(即将在arXiv上发布)获取更新
搜集汇总
数据集介绍
DBA-Bench 数据集图片
构建方式
在数据库运维领域,大语言模型代理的评估长期受限于任务范围、测试环境与评价指标的不统一。DBA-Bench的构建立足于弥合现有评估与生产运维之间的四大鸿沟:实时环境保真度、观测空间尺度与复杂度、解决方案的开放性以及场景复杂度与覆盖率。其核心构建方式基于三条设计准则:生产保真度要求在有活跃工作负载的、经全面监测的PostgreSQL环境中进行多轮读写交互;结果优先评价将成功定义为在操作安全约束下实现可测量的恢复或故障消除;受控场景可复现性则通过快照恢复与场景特定谓词验证,确保每次运行前代理面对的脏态环境因果状态与可见症状完全一致。该基准包含106个跨七个任务域的场景,每个场景依据参考诊断路径的证据因果跳数与环境噪声水平被标注为两个公开的难度等级。
特点
DBA-Bench最显著的特点在于其开创性的评价视角与精细化的难度剖析。它采用结果优先的评价协议,将成功定义为在满足操作安全约束前提下的可度量系统恢复,而非仅仅追求诊断准确性;场景特定的结果验证器独立于安全规则,分别评判恢复效果与操作风险,使得不同的修复路径只要满足相同的成功契约即可获得认可。此外,基准通过参考路径诊断深度与环境复杂度两个独立属性定义场景难度,前者衡量因果推理的跳跃步数,后者量化观测空间中非因果噪声的比例。这种多维度的标注体系使得性能下降的根源能够被精准归因——不论是源于更长的因果链还是更嘈杂的证据环境,均能得到清晰的刻画。
使用方法
DBA-Bench的使用方法紧密围绕一个统一的工具接口与闭环操作范式展开。代理通过五个核心API与运行中的数据库环境交互:查询指标、执行SQL、管理实例、读取日志以及检索知识库。这些工具覆盖了从观测到干预的全部操作,其中execute_sql尤为强大,允许代理进行任意SQL查询、诊断与修复,但同时也由安全规则严格审查其调用是否必要且有据可循。每次运行构成一个完整的操作闭环:代理在活跃负载下定位证据、施加修复并验证结果,最终提交包含根因类型、因果因素、执行动作与验证证据的结构化报告。评价维度涵盖诊断准确性、结果有效性、操作安全性与token成本,确保能从多个层面全面衡量代理的生产就绪程度。
背景与挑战
背景概述
在数据库运维领域,基于大语言模型(LLM)的智能代理正展现出替代传统数据库管理员(DBA)的潜力,然而现有评估体系却因任务范围、测试平台与评价指标的不统一而支离破碎。为弥合这一鸿沟,电子科技大学的Kai Zheng教授团队于2026年正式推出了DBA-Bench这一具有生产级保真度的基准测试框架。该数据集由Junming Chen、Junyang Jiang等研究者共同构建,核心研究问题聚焦于:如何在真实的在线数据库环境中,系统性地评估LLM代理在故障诊断、修复执行与安全操作方面的综合能力。DBA-Bench的诞生填补了该领域缺乏共享、可复现评估平台的空白,其通过涵盖7大运维任务域、106个真实场景的精细化设计,为数据库自治代理的性能衡量树立了客观标尺,对推动LLM代理从实验室原型迈向生产级应用具有里程碑式的意义。
当前挑战
DBA-Bench所面临的挑战首先体现在领域问题的复杂性上:真实数据库故障绝非孤立事件,而是表现为计划膨胀、锁竞争与资源枯竭交织的级联效应,代理需在数千条时间序列、繁杂的业-务日志与并发事务中定位因果证据,这对传统评估所依赖的静态、低噪声环境构成了根本性颠覆。其次,基准构建本身亦极具挑战:为确保不同代理能在同等因果故障条件下被公平比较,开发团队必须实现高度可控的场景复现机制,即每次运行前精确恢复带错的脏环境并通过谓词验证,同时维持在线工作负载的持续变化以模拟生产级动态。此外,修复方案的高度开放性使得结果评判难以依赖固定答案,而必须转向以系统恢复状态与操作安全性为双重判据的‘结果优先’评价范式,这一设计在保证评价广度的同时,也对验证逻辑的完备性提出了严苛要求。
常用场景
经典使用场景
DBA-Bench作为数据库运维智能体的基准测试平台,其经典使用场景在于评估基于大语言模型的自主智能体在接近生产环境的复杂故障条件下执行数据库运维任务的能力。该数据集设计了106个涵盖七类运维领域的场景,包括查询调优、系统故障恢复、健康检查、业务变更、资源治理、复合故障及误导告警,每个场景均在带有活跃工作负载的PostgreSQL环境中复现,要求智能体通过多轮读写交互完成诊断、修复与验证,从而真实衡量其端到端的运维效能。
衍生相关工作
DBA-Bench的发布催生了一系列衍生研究工作,包括针对诊断连续性缺陷的因果推理增强方法、面向安全约束的修复契约设计,以及融合知识图谱与树搜索的混合推理架构。基准中揭示的诊断与修复性能鸿沟激励了研究者开发更鲁棒的多跳因果诊断策略和上下文感知的安全守卫机制。此外,其开源的高保真场景库为后续的数据库智能体对抗训练、长序列动作规划以及成本感知的模型路由策略提供了标准化的验证平台。
数据集最近研究
最新研究方向
面对大语言模型驱动的数据库运维代理在实际生产环境中面临的诊断深度不足、环境噪声干扰、修复安全性欠缺等核心挑战,DBA-Bench 构建了涵盖106个复杂故障场景的高保真基准框架,聚焦于多轮读写交互、大规模观测空间下的因果推理与开放式修复路径评估。该基准通过引入生产级PostgreSQL环境、持续业务负载和场景化快照恢复机制,系统性地揭示了现有模型在端到端修复中的瓶颈:最佳自动化方案的Safe Pass率仅为17.9%,与人类DBA的93.4%形成显著鸿沟,且诊断到修复的转化过程中存在62.1%的失效比例。DBA-Bench 的提出标志着数据库运维自动化评价从孤立任务测试向兼具故障复现性、安全约束与结果验证的评估范式演进,为构建可靠、可比的数据库智能运维代理提供了关键试验场与能力基准。
相关研究论文
  • 1
    DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents电子科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务