遇见数据集

gaia-evals

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

GAIA Hermes Agent vLLM 评估痕迹数据集是一个私有数据集,包含了在 GAIA 基准测试(GAIA-benchmark/GAIA)验证集上,使用 Hermes Agent 对一系列本地 vLLM 服务的模型(包括 NVFP4 和 FP8 量化版本)进行性能评估的完整产出物。该数据集旨在系统性地评估和比较不同大型语言模型在复杂、多步骤的代理任务上的能力。数据核心内容涵盖多个维度的评估结果:总体性能、推测解码性能分析、引擎计时数据、令牌使用统计和配置元数据。数据集评估了34个不同的模型运行实例,涉及多个模型系列,在总共165个GAIA验证任务上进行。每个模型运行的评估痕迹被组织在独立目录中,包含汇总文件和详细遥测数据归档。该数据集适用于语言模型代理能力的基准测试、推理服务效率研究、成本分析、可复现性验证等。

The GAIA Hermes Agent vLLM evaluation trace dataset is a private dataset containing complete outputs from performance evaluations of Hermes Agent on a series of local vLLM service models (including NVFP4 and FP8 quantized versions) on the GAIA benchmark (GAIA-benchmark/GAIA) validation set. It aims to systematically evaluate and compare the capabilities of different large language models on complex, multi-step agent tasks. The core data covers multiple dimensions of evaluation results: overall performance, speculative decoding (MTP) performance analysis, engine timing data (e.g., TTFT, decoding throughput), token usage statistics, and configuration metadata. The dataset evaluates 34 different model run instances across multiple model series on a total of 165 GAIA validation tasks. Each model runs evaluation traces are organized in an independent directory, containing aggregated JSON/CSV files and an archive (telemetry.tar.gz) with detailed per-task telemetry data for full reproducibility. This dataset is suitable for researchers and developers for benchmarking language model agent capabilities, empirical studies on inference service efficiency (especially speculative decoding), token consumption analysis, transparency and reproducibility verification, and as foundational data for further analysis of model performance on complex tasks requiring tool usage, code execution, and web browsing.

创建时间:
2026-06-05
原始信息汇总

数据集概述:GAIA Hermes Agent vLLM Evaluation Traces

基本信息

  • 数据集名称: GAIA Hermes Agent vLLM Evaluation Traces
  • 任务类别: 问答(question-answering)
  • 语言: 英语
  • 标签: gaia, hermes-agent, vllm, nvfp4, fp8, token-usage, agent-evaluation
  • 许可: other

数据集来源与内容

该数据集包含来自 Hermes Agent 在本地 vLLM 服务的 NVFP4 和 FP8 模型上运行 GAIA 基准测试(gaia-benchmark/GAIA)的验证集工件。评分使用官方 GAIA question_scorer 进行二元评分(每任务通过/未通过),不涉及 LLM 裁判。

评估指标

  • 核心指标: pass@1(通过数 / 总数),按等级(1/2/3)和总体分别报告。

评估设置

  • 硬件: NVIDIA B300 SXM6 AC(NVFP4 量化模型) / NVIDIA H100 80GB(FP8)
  • Agent 框架: NousResearch/hermes-agent @ v2026.5.16(PyPI 0.14.0)
  • 工具集: [terminal, file, code_execution, web, todo]
  • 最大迭代次数: 100
  • 模型服务方式: 本地 vLLM OpenAI 兼容服务器
  • 评分器: 树内 gaia.scorer.question_scorer(官方 GAIA 排行榜评分器的纯 Python 移植版本)
  • 并发数: 20
  • vLLM 前缀缓存: 启用(--kv-cache-dtype bfloat16 + --enable-prefix-caching + --enable-prompt-tokens-details
  • GAIA 数据集版本: 固定于 SHA 682dd723ee1e1697e00360edccf2366dc8418dd9

数据目录结构

每个顶层目录 <model-shortname>_<TS>/ 包含:

  • DONE.json:状态、计数和 pass@1
  • full_run_manifest.json:启动命令、模型 URL、vLLM 探测信息
  • overall_summary.jsonoverall_summary.md:pass@1、终止原因、token 总量
  • domain_summary.json:按级别的奖励和 token 汇总
  • task_counts.json:按级别的任务计数
  • all_tasks_usage.jsonall_tasks_usage.csv:每个任务一行
  • rollouts.jsonl:每任务行,包含模型答案和真实答案
  • submission.jsonl:排行榜格式的任务ID与模型答案
  • telemetry.tar.gz:压缩的每任务遥测数据(包含 agent_requests.jsonltool_executions.jsonltrajectory.json

核心评估结果矩阵

整体 pass@1 排名(部分摘录)

# 模型 总数 总体 pass@1
1 step-3.7-flash-q3km 20 0.9000
2 step-3.7-flash-iq4xs 20 0.8000
3 Jackrong/Qwopus3.6-27B-v2 165 0.7273
4 nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4 165 0.6545
5 google/gemma-4-31B-it 165 0.6485
6 Qwen/Qwen3.6-35B-A3B-FP8 165 0.6485
7 Qwen/Qwen3.6-35B-A3B 165 0.6364
8 Qwen/Qwen3.6-27B 165 0.6242
9 Qwen/Qwen3.5-122B-A10B-gptq-int4 165 0.6061
10 LiquidAI/LFM2.5-8B-A1B 165 0.1030

引擎计时(仅限 llama.cpp 引擎)

对于由 llama.cpp (GGUF) 引擎服务的运行,记录平均 TTFT、解码吞吐量、预填充吞吐量和草稿令牌接受率。

# 运行 TTFT 毫秒 解码 tok/s 预填充 tok/s
1 step-3.7-flash-q3km_20260607T133155Z 2715.2 32.5 1064.3
2 step-3.7-flash-iq4xs_20260607T131619Z 1986.0 58.3 1252.1
3 step-3.7-flash-iq4xs_20260607T032001Z 1515.2 87.5 1626.7

Token 使用情况(Agent 端,部分摘录)

# 运行 总计 缓存占比
1 qwopus3.6-27b-v2_20260606T231229Z-fleet8 92.6M 93.0%
2 nvidia-nemotron-3-super-120b-a12b-nvfp4_20260607T055859Z 118.9M 80.1%
3 qwen3.5-9b_20260606T215718Z-fleet8 106.7M 92.6%
4 nvidia-nemotron-3-ultra-550b-a55b-nvfp4_20260607T080556Z 0.0M 0.0%
搜集汇总
数据集介绍
gaia-evals 数据集图片
构建方式
该数据集源自对GAIA基准测试中验证集任务的系统性评估,通过Hermes Agent框架驱动,经由本地部署的vLLM推理引擎对多种量化模型(包括NVFP4与FP8格式)进行推理。每个评估运行完成后,其产物被组织在顶层目录下,以模型简称与时间戳命名。评分采用GAIA官方提供的question_scorer,基于二元判定机制,通过数值归一化、逗号与分号分隔列表的等价匹配以及空白与标点归一化后的字符串相等性进行判断,摒弃了依赖LLM作为评判者的方式。所有运行的配置参数、硬件环境与工具链版本均被记录在full_run_manifest.json中,确保了实验的可复现性。
特点
该数据集的核心特色在于其多维度、细粒度的评估指标体系。以pass@1作为核心指标,分别按难度级别(L1、L2、L3)和总体水平报告,揭示了不同复杂度任务下模型性能的显著差异。数据集的独特之处在于其不仅记录了最终的通过率,还容纳了MTP推测解码的逐位置草稿令牌接受率、引擎时序数据(如TTFT和解码吞吐量)、以及代理端的令牌使用情况。尤其值得关注的是,其将因迭代上限而截断的任务单独标识为max-turns hit,明确区分了模型能力上限与基础设施故障,为用户提供了更精确、更透明的模型行为洞察。
使用方法
使用该数据集时,研究者可聚焦于顶层pass@1矩阵,快速比较不同量化方案与模型架构在GAIA基准上的表现。通过解析overall_summary.json与domain_summary.json,可获取详细的通过率与终止原因分布。若需深入分析,rollouts.jsonl提供了每个任务的模型输出与标准答案,便于进行错误分析。对于关注推理效率的用户,vLLM运行下的mtp_metrics_final.txt文件与llama.cpp引擎请求的engine_timing区块,分别提供了推测解码接受率与每请求的时序性能数据。此外,telemetry.tar.gz压缩包中包含了每个任务完整的agent_requests.jsonl与trajectory.json,支持对模型行为轨迹进行逐步骤的重放与质性审计。
背景与挑战
背景概述
GAIA(General AI Assistants)基准测试由Meta AI等研究机构于2023年提出,旨在衡量通用AI助手在现实世界多步推理任务中的表现。该基准涵盖一级至三级不同难度的任务,要求模型综合运用工具调用、代码执行与多源信息检索等能力。GAIA Hermes Agent vLLM评估追踪数据集在此基础上,专注于记录Hermes智能体框架在本地vLLM服务环境下,对NVFP4和FP8量化模型的评估过程与结果。通过分布式推理基础设施,该数据集系统性地记录了多种大规模语言模型在GAIA验证集上的pass@1得分、引擎时序与令牌消耗等关键指标,为量化模型性能的横向对比提供了标准化框架,推动了AI助手在工具增强型任务中能力评估的规范化进程。
当前挑战
GAIA数据集面临的首要技术挑战在于如何准确评估智能体在多步推理与工具调用场景下的真实能力,特别是在L2和L3高难度任务中,模型需要同时处理信息检索、代码执行与网站交互等复合步骤,其性能波动显著。评估构建过程中,量化模型的精度管理成为核心难题:NVFP4和FP8等低精度格式虽能提升推理效率,却可能因数值截断导致推理链中关键信息的丢失,进而影响最终结果的准确性。此外,基础设施层面的容错性也是重大挑战,例如大型模型(如550B参数级别)在vLLM服务下的运行常因显存溢出或前缀缓存失配而中断,部分评估任务因“最大迭代次数”限制被强制截断,这些因素共同增加了评估结果的可重复性与可比性分析的复杂性。
常用场景
经典使用场景
GAIA 数据集是评估通用人工智能助手的基准测试,其经典使用场景在于验证代理系统在复杂、多步推理任务上的能力。研究者通常借助 Hermes Agent 等工具链,在 vLLM 等推理引擎上部署不同精度(如 NVFP4、FP8)或量化版本的模型,并以 pass@1 为核心指标,考察模型在处理需要工具调用(如终端、代码执行、网页搜索)的多轮交互问题时的表现。该数据集按难度分为三个层级(L1/L2/L3),能够细致衡量模型从简单事实检索到复杂逻辑推导的泛化水平。
解决学术问题
GAIA 数据集着力解决了当前大语言模型在真实世界复杂任务中缺乏标准化评估手段的学术难题。传统基准测试多聚焦于单轮问答或静态知识抽取,难以反映模型在需要多步推理、工具协同与容错恢复等情境下的真实能力。GAIA 通过设计细粒度的二值评分机制及专门的问题评分器,规避了基于大模型裁判的主观偏差,为不同模型在代理场景下的准确性、鲁棒性与效率提供了可复现、可比对的学术标杆。这一标准化评测框架的建立,有力地推动了智能体系统从封闭实验走向开放应用。
衍生相关工作
围绕 GAIA 数据集,研究者已衍生出多项经典工作。其中,Hermes Agent 作为一个通用代理框架,将 GAIA 的评估管线与多种模型、推理引擎深度绑定,形成了高复现性的评测飞轮。此外,有学者借鉴其多轮交互与工具编排设计,构建了面向金融、医疗等垂直领域的领域化代理评估集。在系统优化层面,该数据集还被用于验证如 MTP 推测解码、KV 缓存压缩与混合精度推理等加速算法的有效性,推动了 vLLM 等高性能推理系统的内核精进,已成为大模型服务化落地不可或缺的试验床。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务