OmniaBench
收藏资源简介:
OmniaBench是一个用于评估通用AI代理的广泛诊断基准,其场景知识来源于应用商店、产品文档、行业资源和网络检索,涵盖90个一级和354个二级领域。它通过四种互补的构建路线合成任务,包含1,431个任务,并提供一个644个任务的挑战子集用于高效评估。数据集支持十维能力分类和八个难度因素的细粒度分析。
OmniaBench is a comprehensive diagnostic benchmark for evaluating general-purpose AI Agents. Its scenario knowledge is sourced from app stores, product documentation, industry resources and web searches, covering 90 primary domains and 354 secondary domains. It synthesizes tasks through four complementary construction approaches, with a total of 1,431 tasks, and provides a challenge subset of 644 tasks for efficient evaluation. The dataset supports fine-grained analysis across ten-dimensional capability classifications and eight difficulty factors.
数据集概述
OmniaBench 是一个用于评估通用 AI 代理的广泛诊断性基准测试。它通过从应用商店、产品文档、行业资源和网络检索中提取场景知识,构建了一个分层分类法,涵盖 ToC、ToB 和 ToE,包含 90 个一级领域 和 354 个二级领域。在此分类法基础上,构建了可执行环境并通过四种互补的构建路线合成任务,同时根据 十维能力分类法 和 八个原子难度因素 对每个轨迹进行评分。
数据集规模
- 全部任务数:1,431 个任务。
- 挑战性子集:包含 644 个任务,用于低成本、抗污染的排行榜评估。
任务构建路线
| 路线 | 描述 | 挑战性子集任务数 |
|---|---|---|
| DAG(锚点) | 多轮、有状态的交互,基于采样的工具依赖链 | 354 |
| DAG-S(衍生) | 通过查询优化从 DAG 任务派生出的单轮任务 | 200 |
| Solver | 选择、调度、分配和优化场景 | 60 |
| Program | 带有分支、迭代和任务程序合成的程序化推理 | 30 |
评估框架
- 诊断性评估:非简单的通过/失败,而是基于十维能力分类法(任务理解、信息收集、规划与决策、状态管理、工具使用、代码与程序化操作、数据分析、办公与文档处理、交互协作、可靠性与安全性)和八个原子难度因素进行细粒度分析。
- 评分方式:DAG / DAG-S / Solver 任务基于加权评分表进行评判;Program 任务使用二进制的
VerifyCode验证。 - 可复现评估工具:提供一个模型无关的运行器、四路线编排器和评分流水线,位于
evaluation/目录下,可跨 OpenAI 兼容和 Anthropic 原生提供商使用。
排行榜(挑战性子集,Pass@1)
| 排名 | 模型 | 访问方式 | DAG | Solver | Program | DAG-S | 总体 |
|---|---|---|---|---|---|---|---|
| 1 | Claude-Sonnet-5 | 闭源 | 57.34 | 9.97 | 56.67 | 63.33 | 58.54 |
| 2 | GPT-5.6-Sol | 闭源 | 55.37 | 7.52 | 65.00 | 50.00 | 57.14 |
| 3 | GLM-5.2 | 开源 | 54.80 | 6.83 | 26.67 | 60.00 | 56.83 |
| 4 | GPT-5.5 | 闭源 | 54.80 | 7.27 | 38.33 | 60.00 | 56.52 |
| 5 | DeepSeek-V4-Pro | 开源 | 52.54 | 6.23 | 36.67 | 53.33 | 54.50 |
| 6 | Claude-Opus-4.7 | 闭源 | 53.39 | 7.60 | 43.33 | 63.33 | 54.19 |
| 7 | Kimi-K2.6 | 开源 | 49.72 | 7.09 | 45.00 | 63.33 | 52.33 |
| 8 | Qwen3.7-Max | 闭源 | 48.59 | 6.49 | 51.67 | 66.67 | 49.69 |
数据构建流程
通过 Web 代理收集的领域知识经过人工校准,然后转化为可实例化的 Python 环境,包含实体、状态、工具和初始化配置。任务在这些环境之上通过上述四种路线合成。
数据集获取与使用
- 数据集下载:挑战性子集(644 个任务)的路线文件托管在 Hugging Face 上,首次运行评估时自动下载。
- 代码库结构:
evaluation/:包含可复现的评估运行器、路线编排和评分代码。website/:Next.js 项目页面。
- 快速开始:需 Python 3.10+,克隆仓库、创建虚拟环境、安装依赖后,配置模型配置文件和环境变量文件,即可运行评估。
开源协议
evaluation/和website/的源代码使用 Apache License 2.0 协议。- 数据集在 Hugging Face 上单独发布,其协议条款以 Hugging Face 数据集卡片为准。
团队
由 华为云后训练团队 和 北京大学 DCAI 团队 开发,与中国人民大学、北京理工大学和清华大学合作完成。




