exolabs/gaia-evals
收藏官方服务:
资源简介:
该私有数据集包含来自Hermes Agent在本地vLLM服务的NVFP4和FP8模型上运行的GAIA(gaia-benchmark/GAIA)验证工件。每个任务的评分基于官方的GAIA `question_scorer`进行二元评分(包括数字归一化、逗号/分号列表分割相等性以及空白/标点符号归一化的字符串相等性),未使用LLM判断。GAIA的关键指标是`pass@1`(通过数/总任务数),按级别(1/2/3)和整体进行报告,因为L2和L3任务的平均难度远高于L1。
This private dataset contains GAIA (gaia-benchmark/GAIA) validation artifacts from Hermes Agent runs against local vLLM-served NVFP4 and FP8 models. Scoring is binary per task via the official GAIA `question_scorer` (numeric normalisation + comma/semicolon list-split equality + whitespace/punctuation-normalised string equality). No LLM judge. The headline metric for GAIA is `pass@1` (passed / n). Its reported per level (1/2/3) and overall, because mean difficulty of L2 / L3 tasks is far higher than L1.
提供机构:
exolabs搜集汇总
数据集介绍

构建方式
GAIA Hermes Agent vLLM Evaluation Traces 数据集旨在系统性地评估不同量化与推理引擎配置下智能体在 GAIA 基准上的表现。其构建基于 Hermes 智能体框架,驱动本地 vLLM 或 llama.cpp 服务化的多种模型(涵盖 NVFP4、FP8、AWQ、GGUF 等压缩格式),对 GAIA benchmark 中的验证集任务进行全量推理。每个独立运行的结果均存放于以模型简称与时间戳命名的顶层目录下,并配套记录完整的 token 消耗、引擎耗时、MTP 草稿接受率等细粒度指标。评分采用 GAIA 官方提供的 question_scorer 进行严格的二进制判定,不依赖任何大语言模型裁判,确保评价的客观性与可复现性。
使用方法
使用该数据集时,研究者可按需关注不同的分析维度。如需直接评估模型在 GAIA 上的推理能力,可直接查阅以模型为行、以 pass@1 为核心指标的主干性能矩阵。若需深入优化推理效率,则可利用 MTP 草稿接受率表格计算条件接受率及有效加速比。引擎时序数据支持对 llama.cpp 部署场景下的 TTFT 及解码吞吐进行对比。数据集布局与 exolabs/tau2-hermes-nemotron-eval-data 一致,开发者可通过解析 run 目录下的 overall_summary.json 及 mtp_metrics_final.txt 等文件,自动化地提取和复现本报告所呈现的各项指标。
背景与挑战
背景概述
GAIA基准测试(GAIA Benchmark)由Meta AI等机构于2023年提出,旨在评估大语言模型在真实世界多步骤推理任务中的能力。与传统问答数据集不同,GAIA聚焦于需要工具调用、信息检索与逻辑链拆解的复杂问题,其任务按难度分为三个层级(Level 1/2/3)。该数据集的出现填补了现有基准对智能体系统(Agent)协作能力评估不足的空白,成为衡量模型工具使用与推理能力的权威标杆。GAIA-Evals由此衍生,专门记录Hermes Agent等智能体在不同量化精度模型(如NVFP4、FP8)及推理引擎(vLLM、llama.cpp)下的执行轨迹与评分结果,为低精度推理与智能体系统的协同优化提供了宝贵的实证分析基础。
当前挑战
GAIA-Evals致力于解决的核心领域挑战在于:智能体系统在多步复杂任务中需同时兼顾推理准确性、工具调用效率与计算资源约束。具体而言,挑战包括:1)任务难度的非线性梯度——L2与L3级别任务的平均复杂性远高于L1,要求模型具备深层逻辑拆解与多源信息整合能力;2)低精度量化(如NVFP4、FP8)引起的性能退化——需在模型压缩与pass@1准确率间寻找平衡点;3)构建过程中,不同推理引擎(vLLM与llama.cpp)产生的计时差异与MTP(多令牌预测)接受率统计需统一归一化处理;此外,基础设施故障导致的运行不完整(如deepseek-v4-flash-iq2xxs仅完成3/165次评测)亦对数据完整性构成挑战。
常用场景
经典使用场景
GAIA 基准测试专注于评估通用AI助手的真实世界推理与多步任务解决能力,其问题跨越三个难度层级,要求模型整合信息检索、数学计算、逻辑推理等复合技能。该数据集的经典使用场景在于,通过对一组精心设计的、需要多步工具调用与知识融合的问答任务进行评核,系统性地衡量大语言模型作为“智能体”时的自主决策水平。研究者依托其严格的二进制评分体系(无需LLM评委),对不同量化精度、推理引擎及架构的模型进行横向对比,从而精准定位模型在复杂任务链中的脆弱环节。
解决学术问题
该数据集解决了当前大语言模型评估中缺乏高难度、多步骤、真实世界推理基准的学术困境。通过设置不同难度层级(L1/L2/L3),它能够清晰揭示模型在简单信息检索与复杂逻辑链推演之间的能力鸿沟。其量化评分矩阵为研究模型压缩(如NVFP4、FP8量化)与推理效率(如MTP投机解码)之间的权衡提供了实证依据,推动了高效模型部署与智能体系统优化的理论发展。此外,它还为评估代理系统的回合限制、缓存效率等工程因素对最终性能的影响提供了标准化框架。
实际应用
在实际应用中,GAIA数据集广泛服务于大语言模型的行业测评与模型选型。企业团队可借助其分层评分机制,为不同业务场景(如客服问答、数据分析助手)匹配合适的模型与推理引擎——例如,通过比对llama.cpp与vLLM服务框架下的性能差异,选择性价比最优的部署方案。该数据集还能指导硬件配置决策,如通过分析TTFT与解码吞吐量,评估不同GPU(如H100、B300)对模型推理效率的实质影响。其日志信息亦可为智能体提示工程与工具调用策略的迭代优化提供数据支撑。
数据集最近研究
最新研究方向
GAIA数据集正被广泛应用于智能体系统的前沿评估,尤其在低精度量化与推测解码驱动的推理加速交叉领域。最新研究以Hermes Agent为基准框架,系统比较了NVFP4、FP8、AWQ及GGUF量化方案在vLLM与llama.cpp引擎上的表现,发现Qwen3.6-35B-A3B-NVFP4等小参数高精度量化模型在高难度L3任务上可超越部分大模型,且MTP推测解码机制能将平均token接受长度提升至3.82,达成近4倍解码加速。该工作揭示了量化精度、参数量与推理效率之间的精细权衡,为构建低延迟、高可靠性的对话式智能体系统提供了关键实证支撑,也标志着业界正从纯精度竞赛转向注重部署效能的混合优化范式。
以上内容由遇见数据集搜集并总结生成



