遇见数据集

OmniaBench

收藏
arXiv2026-07-16 更新2026-07-18 收录
数据链接:
官方服务:

资源简介:

OmniaBench是由华为云与北京大学联合构建的大规模通用智能体评估基准,旨在系统化评测智能体在多样化真实场景中的综合能力。该数据集涵盖1,431个可执行任务,包含单轮与多轮交互形式,数据来源于应用商店、产品需求文档、网络检索及人工精炼,构建了覆盖90个一级领域和354个二级领域的层次化分类体系。数据集通过四种互补方法(DAG、DAG-S、Solver、Program)合成,并引入十维能力分类与八种原子难度因子,专门用于评估智能体在任务理解、工具调用、状态管理及规划决策等核心环节的性能,为解决现有基准场景覆盖有限、难以反映智能体在异构应用环境中真实能力边界的问题提供诊断性分析工具。

OmniaBench is a large-scale general AI agent evaluation benchmark jointly developed by Huawei Cloud and Peking University, aiming to systematically assess the comprehensive capabilities of AI agents across diverse real-world scenarios. This benchmark encompasses 1,431 executable tasks in both single-turn and multi-turn interaction formats. Its data is sourced from app stores, product requirement documents, web searches, and human refinement, and it establishes a hierarchical classification system covering 90 first-level domains and 354 second-level domains. Synthesized via four complementary methods (DAG, DAG-S, Solver, Program), the benchmark introduces a ten-dimensional capability classification framework and eight atomic difficulty factors, specifically designed to evaluate AI agents' performance in core aspects such as task understanding, tool invocation, state management, and planning and decision-making. It provides a diagnostic analytical tool to address the shortcomings of existing benchmarks, which suffer from limited scenario coverage and cannot accurately reflect the real capability boundaries of AI agents in heterogeneous application environments.

创建时间:
2026-07-16
原始信息汇总

OmniaBench 数据集概述

OmniaBench 是一个用于评估通用AI智能体的广泛诊断性基准测试。场景知识通过从应用商店、产品文档、行业资源和网络检索中提炼,构建成一个层次化分类体系,涵盖 ToC、ToB 和 ToE,包含 90 个一级领域354 个二级领域。在此分类体系之上,OmniaBench 构建了可执行环境,并通过四种互补的构建路线合成任务,随后沿 十个维度的能力分类八个原子难度因子 对每条轨迹进行评分。

数据集规模与构成

  • 完整数据集:1,431 个任务
  • 挑战性子集:644 个任务(用于排行榜评估,旨在降低成本并减轻污染风险)

四种任务构建路线

路线 描述 挑战性子集任务数
DAG(核心) 基于采样工具依赖链的多轮、有状态交互 354
DAG-S(衍生) 通过查询精炼从DAG任务衍生出的单轮任务 200
Solver 选择、调度、分配和优化场景 60
Program 带有分支、迭代和任务程序合成的过程推理 30

诊断性评估体系

  • 十维能力分类:任务理解、信息收集、规划与决策、状态管理、工具使用、代码与编程操作、数据分析、办公与文档处理、交互协作、可靠性与安全性
  • 八个原子难度因子:支持细粒度分析,超越单一聚合分数
  • 评分方式:DAG / DAG-S / Solver 任务使用加权清单评分;Program 任务使用二元 VerifyCode 验证

排行榜(挑战性子集,Pass@1 指标)

排名 模型 访问方式 DAG Solver Program DAG-S 总体
1 Claude-Sonnet-5 闭源 57.34 9.97 56.67 63.33 58.54
2 GPT-5.6-Sol 闭源 55.37 7.52 65.00 50.00 57.14
3 GLM-5.2 开源 54.80 6.83 26.67 60.00 56.83
4 GPT-5.5 闭源 54.80 7.27 38.33 60.00 56.52
5 DeepSeek-V4-Pro 开源 52.54 6.23 36.67 53.33 54.50
6 Claude-Opus-4.7 闭源 53.39 7.60 43.33 63.33 54.19
7 Kimi-K2.6 开源 49.72 7.09 45.00 63.33 52.33
8 Qwen3.7-Max 闭源 48.59 6.49 51.67 66.67 49.69

特点

  • 广泛的场景覆盖:包含 90 个一级 / 354 个二级领域,基于真实应用商店、产品需求文档和行业分类体系,涵盖消费者、企业及员工场景
  • 四种互补的任务构建路线:支持多轮有状态工具链执行、单轮任务、选择/调度/分配/优化场景以及过程推理
  • 诊断性评估:提供十维能力分析和八原子难度因子,超越简单通过/失败判断
  • 可复现的评估框架:提供与模型无关的评估运行器、四路线编排器和评分流水线,兼容 OpenAI 兼容和 Anthropic 原生接口

团队与发布

  • 开发团队:华为云后训练团队与北京大学 DCAI 团队,与中国人民大学、北京理工大学和清华大学合作
  • 发布时间:代码库和数据集于 2026 年 7 月发布
搜集汇总
数据集介绍
OmniaBench 数据集图片
构建方式
OmniaBench的数据构建过程始于从应用商店、产品需求文档、网络检索及人工精修中提炼应用导向的场景知识,形成覆盖ToC、ToB与ToE三大视图、包含90个一级与354个二级领域的层级化分类体系。基于该分类体系,研究团队为每个二级领域构建可执行的环境,包括实体、属性、状态变量及工具API,并通过语法检查、工具调用预演与状态一致性验证确保环境稳定性。任务合成则融合领域知识,经由四条互补路线生成:DAG路线基于工具依赖图生成多轮交互与状态跟踪任务;DAG-S路线对DAG任务进行查询精炼以形成单轮任务;Solver路线面向选择、调度与优化场景;Program路线涵盖分支、迭代与程序合成等复杂推理任务。最终任务经过人类标注与筛选,并额外构建了一个包含644个任务的挑战子集以降低评估成本与数据污染风险。
特点
OmniaBench的核心特点在于其广泛的场景覆盖与精细的诊断能力。相比仅聚焦于单一工具生态或少数任务环境的基准,该数据集在90个一级与354个二级领域中构建了包含丰富工具、实体、状态及初始化配置的交互式环境,平均每个环境支持65.32个工具,任务平均需要约100轮交互。数据集引入了一个十维能力分类体系,涵盖任务理解、信息收集、规划与决策、状态管理、工具使用、代码与编程操作、数据分析、办公文档处理、交互协作及可靠性与安全性,使得评估结果可分解至能力层面,揭露模型在智能体执行不同阶段的长短板。此外,八种组合式原子难度因子从用户意图、角色约束、环境状态、工具执行、多轮交互及结果验证等维度刻画任务挑战,支持细粒度的错误模式分析。
使用方法
OmniaBench的使用方式基于统一的轨迹评估框架,适用于支持OpenAI函数调用格式的各类大语言模型。评估时,模型需在给定环境中逐步调用工具、追踪状态变更、与用户模拟器交互,最终完成任务。DAG类任务采用角色驱动的多轮交互,由用户模拟器逐步披露信息,直至发出###STOP###终止信号;Solver、DAG-S与Program路线则为单轮任务。评估信号分为两类:DAG、Solver与DAG-S任务使用包含多项标准的评分项目(rubric)进行评估,任务需满足所有项目方视为成功;Program任务则通过VerifyCode程序化验证器直接判定二进制结果。用户模拟器的可靠性经过多模型检验,Kendall's τ值为1.0,变异系数为7.24%,确保了排名稳定性。评估支持按领域、能力维度、任务难度、交互轮次及错误分布进行多维度分析。
背景与挑战
背景概述
随着大语言模型从静态文本生成器逐步演化为能够理解用户意图、调用外部工具并完成复杂交互任务的通用智能体,学术界与工业界对其评估体系的需求日益迫切。然而,现有Agent基准多聚焦于有限场景、单一工具生态或特定交互格式,难以系统刻画模型在异构应用环境中的能力边界。在此背景下,华为云与北京大学联合团队于2026年提出了OmniaBench——一个覆盖ToC、ToB和ToE三大场景、包含90个一级领域和354个二级领域的高阶通用Agent评估基准。该基准通过从应用商店、产品文档、行业资源及人工精炼等多源知识构建层次化分类体系,并基于此生成可执行环境与多轮交互任务,意图为评估国际先进模型在广泛真实应用中的执行能力提供系统性支撑。
当前挑战
当前通用Agent面临的挑战涵盖多个层面:首先,模型需在部分可观测环境中持续理解用户意图、制定多步规划、调用工具、追踪状态并动态调整策略,这要求其在规划、约束维护和自适应校正方面具备极强的推理能力。其次,OmniaBench的构建过程面临巨大工程难度,需从繁杂的异构数据源中提炼结构化领域知识,并生成覆盖单轮与多轮交互、包含状态追踪与工具协调的可执行任务。实验表明,即使最先进的Claude-Sonnet-5和GPT-5.6-Sol也仅分别取得58.54%和57.14%的通过率,反映出现有模型在长周期规划、信息聚合与约束遵守等方面仍存在显著能力瓶颈。
常用场景
经典使用场景
OmniaBench旨在为通用人工智能代理(general AI agents)提供多场景、交互式的评估基准。其经典使用场景聚焦于全面评估大语言模型(LLMs)在异构应用环境中的任务执行能力,涵盖面向消费者(ToC)、面向企业(ToB)以及面向员工(ToE)的共计90个一级领域和354个二级领域。研究者通过该基准构建可执行环境,要求代理在部分可观测的马尔可夫决策过程(POMDP)框架下完成任务,涉及多轮对话、工具调用、状态追踪与动态规划等核心能力,从而系统评测模型在复杂、现实应用中的综合表现。
衍生相关工作
OmniaBench的出现催生了一系列相关经典工作。例如,其数据构建路线中的DAG、DAG-S、Solver与Program四种互补策略,为后续研究提供了可复用的任务合成范式;十维能力评估框架被其他基准借鉴用于细粒度诊断分析;原子难度因子设计启发了一系列关于任务复杂度可控生成的研究。此外,该基准的挑战子集(challenging set)设计理念已被应用于降低评测成本、防止数据泄露的研究中,推动了更高效、更稳健的代理评估方法论的发展。
数据集最近研究
最新研究方向
OmniaBench作为一项面向通用AI智能体的综合性基准测试,其前沿研究方向聚焦于跨越消费者端(ToC)、企业端(ToB)与员工端(ToE)三大场景的异构应用领域,通过构建包含90个一级领域和354个二级领域的层次化分类体系,并融合有向无环图、求解导向与程序化生成等多种任务构造路径,系统性地评估智能体在任务理解、信息整合、规划决策、状态追踪、工具编排等十维能力上的表现。该基准深刻揭示了当前顶级模型在长程规划、约束维持与自适应纠偏等环节的持续性瓶颈,为理解通用智能体的能力边界提供了诊断性框架,推动了智能体评估从单一任务成功率向多维度、细粒度能力剖析的范式转变。
相关研究论文
  • 1
    OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios华为云·后训练团队; 北京大学·深度计算与人工智能实验室团队 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务