ORCA-bench
收藏官方服务:
资源简介:
ORCA-bench是一个用于评估大语言模型智能体在生产级事件响应场景中根因分析能力的基准测试。该数据集基于一个经OpenTelemetry仪表化的微服务系统(Astronomy Shop),运行六天并产生超过50GB的遥测数据,包含1,079个系统性地变化报告具体性、检测时间延迟和共现故障场景的RCA任务。数据集通过切换特征标志生成任务,并经过专家SRE人工验证症状与根因。它旨在模拟真实事件响应中从模糊用户报告、遥测接口和源代码定位根因的挑战,从而衡量前沿编码智能体在可靠性工程中的准备程度。
创建时间:
2026-07-31
搜集汇总
数据集介绍

构建方式
ORCA-bench依托OpenTelemetry Astronomy Shop微服务系统构建,该系统包含19种语言编写的19个微服务,并集成Prometheus、OpenSearch、Jaeger等真实遥测后端,通过Grafana API和终端提供遥测与源代码访问。构建流程分六阶段:首先部署环境并生成六天连续模拟负载的50GB遥测数据;其次由专家SRE设计13个场景,涵盖独立、级联等五种故障类型;随后参数化任务,采样报告偏移和检测时间,并生成不同特异性的用户报告;最后利用LLM生成候选根因和症状,并辅以人工验证形成40个任务的Verified子集。
特点
ORCA-bench的核心特质在于其生产保真度与难度梯度设计。它首次完整整合了电话会议工程师所依赖的三大证据源——真实遥测接口、原始遥测数据以及源代码,同时系统化地改变了报告特异性、检测延迟和并发故障结构,构建了从易到难的上下文阶梯。1076个任务中包括195个控制任务,用于测试模型正确识别无故障场景的能力。所有根因标签和症状均由专家SRE验证,LLM评判结果与人类重评高度一致,可有效避免模型对公开系统的偏向性。
使用方法
使用者可通过Harbor平台获取ORCA-bench数据集,该平台提供了完整的遥测日志、指标和跟踪数据以及源代码访问权限。评价流程包括三个步骤:首先进行检测检查,判断模型是否正确报告了事故存在与否;然后按根因准则对每个可能原因进行0-3分的评分,考量症状确认、证据收集和根本原因识别;最后汇总计算RCA准确率、深度和幻觉率等指标。数据集支持灵活评测,可改变输入上下文(如仅提供遥测或结合代码),以分析不同因素对根因分析性能的影响。
背景与挑战
背景概述
ORCA-bench由康奈尔大学、哥伦比亚大学及Traversal公司于2026年联合推出,旨在评估大型语言模型在真实生产环境中的故障根因分析能力。该基准首创性地将代码代理置于完整可观测性环境中,集成OpenTelemetry插桩的微服务系统(Astronomy Shop),提供六天超过50GB的指标、日志和追踪数据,并通过Grafana API与源代码访问模拟一线SRE工作场景。研究团队构建了1079个系统性变化报告模糊度、检测时间及故障共现模式的任务,并引入专家SRE验证的ground-truth症状及人类重评的LLM裁判机制。实验显示,最先进模型在中等难度任务上仅达25.3%的RCA准确率,在困难任务上骤降至10%,揭示当前代理远未达到生产可靠性要求,为衡量预训练编码代理的运维就绪度确立了关键基准。
当前挑战
ORCA-bench直面多项核心挑战。领域层面,根因分析要求从模糊的自然语言报告出发,在动态微服务系统中综合解析异构信号,区分多因并发与背景噪声,并准确归因非结构化时序数据;现有模型常陷入认知偏差,过度聚焦显著症状而遗漏次要根因,或虚构不合理结论(幻觉率高达7%-40%)。构建层面,需精确同步六个月调度的功能开关事件与真实遥测数据,设计五种故障场景类型,人工细化覆盖指标、日志、追踪的ground-truth症状,并确保LLM裁判与人类专家评分高度一致(Cohen's κw=0.90)。此外,大规模数据处理(50GB)迫使采用Grafana API而非原始数据,加剧了信息抽样的难度。
常用场景
经典使用场景
ORCA-bench作为首个将大语言模型智能体置于生产级故障现场的综合基准,其核心应用场景在于评估与推动语言模型在真实运维环境中的根因分析能力。该基准通过构建一个配备OpenTelemetry插桩的微服务系统,完整呈现指标、日志与追踪三类遥测数据及源代码访问,系统性地变化用户报告的具体程度、故障检测延迟及并发故障场景,共涵盖1,079项任务。此举旨在模拟值班工程师面临的模糊投诉与复杂系统状态,推动智能体从静态代码修复向动态、多模态证据推理的范式跨越,为自动化可靠性工程奠定评测基础。
衍生相关工作
ORCA-bench的提出催生了一系列相关研究方向的拓展与深化。其高保真环境与严谨评分方法为后续工作提供了标准参照,推动了融合因果推断、图分析与强化学习的混合根因定位方法的发展。同时,该基准明确的性能缺口(最佳模型中等难度仅25.3%准确率)促使研究者探索提示工程、代理工作流优化及持续学习机制以缩小差距。此外,其关于源代码访问重要性的发现(移除后所有指标下滑),引发了关于智能体工具使用与信息检索策略的研究,并可能孕育出面向生产系统的专用运维智能体架构与评估框架。
数据集最近研究
最新研究方向
ORCA-bench作为首个将语言模型代理置于生产级可观测性环境中的SRE基准,其最新研究方向聚焦于根因分析(RCA)任务的多维复杂度建模,涵盖报告模糊性、检测时延以及并发故障场景的系统化变化。该基准通过集成实时遥测接口与源代码访问,深度剖析了前沿编码代理在真实运维条件下的能力边界,揭示即便顶尖模型在中等难度任务上的RCA准确率仅为25.3%,且在硬任务上骤降至10%,同时存在高达40%的幻觉率。此研究不仅为AI在站点可靠性工程(SRE)领域的应用设立了严苛的评估标尺,更明确指出现有代理距安全承担生产可靠性职责尚存显著鸿沟,从而为未来智能运维代理的迭代升级指明了关键优化方向与挑战所在。
相关研究论文
- 1ORCA-bench: How Ready Are Language Model Agents for Oncall?康奈尔大学·康奈尔理工学院; Traversal; 哥伦比亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成



