遇见数据集

OmniaBench

收藏
github2026-07-17 更新2026-07-18 收录
数据链接:
官方服务:

资源简介:

OmniaBench是一个用于评估通用AI代理的广泛诊断基准,其场景知识来源于应用商店、产品文档、行业资源和网络检索,涵盖90个一级和354个二级领域。它通过四种互补的构建路线合成任务,包含1,431个任务,并提供一个644个任务的挑战子集用于高效评估。数据集支持十维能力分类和八个难度因素的细粒度分析。

OmniaBench is a comprehensive diagnostic benchmark for evaluating general-purpose AI Agents. Its scenario knowledge is sourced from app stores, product documentation, industry resources and web searches, covering 90 primary domains and 354 secondary domains. It synthesizes tasks through four complementary construction approaches, with a total of 1,431 tasks, and provides a challenge subset of 644 tasks for efficient evaluation. The dataset supports fine-grained analysis across ten-dimensional capability classifications and eight difficulty factors.

创建时间:
2026-07-16
原始信息汇总

数据集概述

OmniaBench 是一个用于评估通用 AI 代理的广泛诊断性基准测试。它通过从应用商店、产品文档、行业资源和网络检索中提取场景知识,构建了一个分层分类法,涵盖 ToC、ToB 和 ToE,包含 90 个一级领域354 个二级领域。在此分类法基础上,构建了可执行环境并通过四种互补的构建路线合成任务,同时根据 十维能力分类法八个原子难度因素 对每个轨迹进行评分。

数据集规模

  • 全部任务数:1,431 个任务。
  • 挑战性子集:包含 644 个任务,用于低成本、抗污染的排行榜评估。

任务构建路线

路线 描述 挑战性子集任务数
DAG(锚点) 多轮、有状态的交互,基于采样的工具依赖链 354
DAG-S(衍生) 通过查询优化从 DAG 任务派生出的单轮任务 200
Solver 选择、调度、分配和优化场景 60
Program 带有分支、迭代和任务程序合成的程序化推理 30

评估框架

  • 诊断性评估:非简单的通过/失败,而是基于十维能力分类法(任务理解、信息收集、规划与决策、状态管理、工具使用、代码与程序化操作、数据分析、办公与文档处理、交互协作、可靠性与安全性)和八个原子难度因素进行细粒度分析。
  • 评分方式:DAG / DAG-S / Solver 任务基于加权评分表进行评判;Program 任务使用二进制的 VerifyCode 验证。
  • 可复现评估工具:提供一个模型无关的运行器、四路线编排器和评分流水线,位于 evaluation/ 目录下,可跨 OpenAI 兼容和 Anthropic 原生提供商使用。

排行榜(挑战性子集,Pass@1)

排名 模型 访问方式 DAG Solver Program DAG-S 总体
1 Claude-Sonnet-5 闭源 57.34 9.97 56.67 63.33 58.54
2 GPT-5.6-Sol 闭源 55.37 7.52 65.00 50.00 57.14
3 GLM-5.2 开源 54.80 6.83 26.67 60.00 56.83
4 GPT-5.5 闭源 54.80 7.27 38.33 60.00 56.52
5 DeepSeek-V4-Pro 开源 52.54 6.23 36.67 53.33 54.50
6 Claude-Opus-4.7 闭源 53.39 7.60 43.33 63.33 54.19
7 Kimi-K2.6 开源 49.72 7.09 45.00 63.33 52.33
8 Qwen3.7-Max 闭源 48.59 6.49 51.67 66.67 49.69

数据构建流程

通过 Web 代理收集的领域知识经过人工校准,然后转化为可实例化的 Python 环境,包含实体、状态、工具和初始化配置。任务在这些环境之上通过上述四种路线合成。

数据集获取与使用

  • 数据集下载:挑战性子集(644 个任务)的路线文件托管在 Hugging Face 上,首次运行评估时自动下载。
  • 代码库结构
    • evaluation/:包含可复现的评估运行器、路线编排和评分代码。
    • website/:Next.js 项目页面。
  • 快速开始:需 Python 3.10+,克隆仓库、创建虚拟环境、安装依赖后,配置模型配置文件和环境变量文件,即可运行评估。

开源协议

  • evaluation/website/ 的源代码使用 Apache License 2.0 协议。
  • 数据集在 Hugging Face 上单独发布,其协议条款以 Hugging Face 数据集卡片为准。

团队

华为云后训练团队北京大学 DCAI 团队 开发,与中国人民大学、北京理工大学和清华大学合作完成。

搜集汇总
数据集介绍
OmniaBench 数据集图片
构建方式
OmniaBench的构建过程根植于对现实世界应用场景的深度洞察。研究团队通过从应用商店、产品文档、行业资源与网络检索中系统性收集领域知识,借助人工校准与反思机制,将其提炼为一套涵盖ToC、ToB与ToE三大维度的层次化分类体系,包含90个一级领域与354个二级领域。在此知识骨架之上,研究人员构建了可实例化的Python执行环境,为每个场景赋予实体、状态、工具与初始化配置。任务生成则沿四条互补路径展开:多轮有状态工具链执行的DAG路线、由DAG派生的单轮DAG-S路径、聚焦选择与调度等决策的Solver路线,以及强调分支与迭代推理的Program路线,最终汇聚成包含1431个任务的完整集合,并从中精炼出644个挑战性子集以支持低成本、抗污染的评测。
特点
该数据集的核心特色在于其广度与诊断深度的有机结合。覆盖90个一级与354个二级领域的场景广度,确保了智能体评估不囿于单一垂直领域,而是横跨消费、企业及员工内部等多元真实应用。尤为突出的是其十维能力评估框架,囊括任务理解、信息搜集、规划与决策、状态管理、工具使用、代码编程、数据分析、文档处理、交互协作及可靠安全等维度,配合八项原子难度因子,使评测突破简单的通过/失败二元判断,实现对智能体表现的全景式诊断。此外,基于加权评分清单与VerifyCode验证的评分体系,加之支持多种推理提供商的模型无关评估框架,共同构成了这一高度可复现的诊断工具。
使用方法
使用OmniaBench开展评估十分便捷,仅需Python 3.10及以上环境。用户首先将代码仓库克隆至本地,安装所需依赖,随后在配置文件中声明参与角色(智能体、用户模拟器或评分裁判)的模型信息,并将API密钥填入环境变量文件。执行评估时,通过单条命令即可指定模型配置文件、要运行的任务路线(支持DAG、DAG-S、Solver、Program四条路线或全部运行)以及并行工作线程数,系统会在首次运行时自动从Hugging Face下载包含644个挑战性任务的评测数据集,无需手动操作。评测结果将被写入指定目录,同时框架还支持断点续跑、按任务编号或语言过滤等高级功能,为深入研究提供灵活支持。
背景与挑战
背景概述
随着人工智能代理在复杂真实场景中的应用日益广泛,对其通用能力的全面评估成为领域内亟待解决的核心问题。OmniaBench由华为云模型后训练团队与北京大学DCAI团队联合中国人民大学、北京理工大学及清华大学的研究人员于2026年共同创建,旨在构建一个覆盖广泛、诊断细致的通用AI代理基准测试。该研究核心在于从应用商店、产品文档、行业资源和网络检索中提炼场景知识,构建了一个层级化分类体系,涵盖面向消费者、企业及雇员三大场景的90个一级域和354个二级域。在此基础上,通过四种互补的构建路径合成1431个任务,并以十维能力分类与八项原子难度因素进行轨迹评分。该基准的影响力在于其对代理能力的细粒度诊断超越了传统通过/失败评价,为领域发展提供了重要参考。
当前挑战
OmniaBench所面临的挑战首先在于解决通用AI代理评估的领域难题:现有基准多局限于单一场景或任务类型,难以全面反映代理在多样性、状态化执行中的真实表现。该基准需涵盖消费级、企业级及雇员场景下的多轮状态化工具链执行、单轮查询、选择调度优化及程序化推理等多种任务形式,对代理的理解、规划、工具使用及交互协作能力提出严苛要求。其次,构建过程亦充满挑战:需从海量异构来源中提取并校准域知识,构建可实例化的Python执行环境,并设计四条互补路径合成任务。为控制评估成本与降低公开后数据污染风险,还需从全量集中精选644任务作为挑战性子集,确保在保持域覆盖的同时实现高效、可靠的评测。
常用场景
经典使用场景
在通用人工智能代理的评估领域,OmniaBench被设计为一项全面且精细的诊断基准,用以衡量AI代理在多样化场景下的综合能力。其核心使用场景涉及对AI代理在消费级(ToC)、企业级(ToB)及雇员级(ToE)三大领域中的表现进行标准化测试,覆盖了从应用商店、产品文档到行业资源与网络检索中提炼出的90个一级领域与354个二级领域。研究者通过四种互补的任务构建路径——包括多轮状态依赖的有向无环图(DAG)任务、单轮精炼的DAG-S任务、调度与优化类的Solver任务以及涉及分支与迭代的程序推理任务——来系统性地评估代理的规划、工具使用、数据分析和安全可靠性等十个核心维度。这使OmniaBench成为评估前沿模型如Claude-Sonnet-5和GPT-5.6-Sol在复杂环境中实际表现的首选工具。
解决学术问题
OmniaBench致力于解决当前AI代理评估中普遍存在的场景覆盖不足与能力诊断粗糙的学术难题。传统基准往往聚焦于狭窄领域的任务,缺乏对代理在真实世界多样化情境下综合行为表征的刻画。OmniaBench通过引入涵盖354个细粒度领域的层次化场景分类体系,并辅以一项包含八个原子难度因子的精细诊断框架,显著推进了代理能力评估的深度与广度。其核心贡献在于超越了简单的通过率统计,转而提供对任务理解、信息搜集、决策规划、状态管理及协作互动等关键能力的多维度剖析。这一工作不仅为理解大语言模型从封闭环境走向开放世界的能力边界提供了可靠标尺,还通过固定的挑战性子集(644项任务)有效缓解了基准污染风险,为社区树立了严谨、可复现的评估范式。
衍生相关工作
OmniaBench的发布已催生了一系列富有影响力的衍生研究工作。其精细化的十维能力评估框架直接启发研究者开发针对特定能力元(如状态管理与工具调用)的专项评估协议,推动了代理能力诊断的细粒度化。此外,基于其层次化场景分类体系与四条任务构建路线,学界开始探索如何将领域知识与规则评估自动翻译为动态环境的合成流程,促进了可扩展基准生成方法论的发展。OmniaBench在挑战性子集上采用的抗污染固定评估范式也被后续研究采纳,成为应对基准泄露领域标准实践的初步雏形。与此同时,其路线编排器与多模型评估基础设施的开源共享,为代理评估工具的模块化与可移植性树立了范例,激励了跨平台评估生态的涌现。这些工作共同丰富了通用AI代理评估的理论与实践工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务