exolabs/gdpval-evals
收藏官方服务:
资源简介:
该私有数据集包含来自Hermes Agent针对本地vLLM服务的NVFP4和FP8模型运行的GDPVal(OpenAI)评估工件。它是一个工件存储库,而非清理过的基于行的数据集:有用数据位于运行摘要、每任务使用文件以及每请求遥测日志(`agent_requests.jsonl`,每个运行归档在`telemetry.tar.gz`中)中。
This private dataset contains evaluation artifacts of GDPVal (OpenAI) generated by Hermes Agent during its runs against local vLLM-served NVFP4 and FP8 models. It is an artifact repository rather than a cleaned row-based dataset: usable data is contained in run summaries, per-task usage files, and per-request telemetry logs (`agent_requests.jsonl`, with each run archived in `telemetry.tar.gz`).
提供机构:
exolabs搜集汇总
数据集介绍

构建方式
该数据集源于对Hermes Agent在vLLM框架下服务于NVFP4与FP8量化模型所产生的评估痕迹的系统性收集与整理。构建过程并非以经过清洗的行式数据为基础,而是将每次评估运行视为一个独立的工件仓库,其目录结构严格按照模型简称与时间戳的命名规则进行组织。数据集中包含运行摘要、任务级使用情况文件以及关键的每请求遥测日誌,后者被归档为`agent_requests.jsonl`文件,并通过`telemetry.tar.gz`进行压缩保存。这种设计使得数据集能够完整保留评估过程中的原始状态与上下文信息。
特点
该数据集以平均奖励分数为核心评估指标,覆盖220个任务,旨在衡量模型在代理任务中的整体表现,而非依赖稀疏的通过率指标。它涵盖了多种主流大语言模型在量化与稀疏化条件下的评估结果,提供了包括MTP草案令牌接受率在内的多个维度的性能数据。数据集中还区分了因基础设施故障而未完成的运行,并将其独立标记,确保了评估报告的准确性和可靠性。其结构化的运行轴键便于进行跨模型、跨引擎的性能比较与分析。
使用方法
使用者可直接利用数据集中提供的运行摘要和任务级文件进行模型性能的对比分析,重点关注`avg_reward`指标。对于vLLM服务的模型,其完整的Docker运行命令和配置参数均已提供,可通过复制粘贴在相应的Blackwell级主机上进行服务配置的复现。同时,数据集还包含了llama.cpp引擎的每请求计时信息,可用于评估不同量化方案下的解码吞吐量和首令牌时间,从而实现从性能指标到部署配置的全链路复现与验证。
背景与挑战
背景概述
在大型语言模型(LLM)的推理优化研究中,量化技术因其在降低显存占用与提升吞吐量方面的显著优势而备受关注。该数据集由Exo Labs研究团队创建于2025年6月,专注于系统化评估采用NVFP4和FP8等低精度量化方案的Hermes Agent模型在vLLM推理引擎上的表现。其核心研究问题在于探索量化对代理(agent)任务执行质量的影响,尤其关注平均奖励(avg_reward)这一细粒度指标,而非稀疏的pass@1。该数据集针对220项代理任务提供了多维度评估,涵盖了从27B到550B参数的模型规模,为量化LLM在复杂交互场景下的性能对比提供了标准化基准,推动了低精度推理在实用化代理系统中的落地研究。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,量化与代理任务智能的平衡是核心难点:低精度表示(如FP4)虽能大幅压缩模型体积与加速推理,却可能显著损害模型在复杂多步任务中的推理连贯性与工具调用准确性。从评估指标可见,不同量化方案间的avg_reward差距显著,揭示出精度损失与任务完成质量之间的微妙权衡。在构建过程上,基础设施失效问题尤为突出——大量运行因引擎不兼容、模型加载失败或资源配置不当而未能完整执行,如部分NVFP4模型在特定MoE后端下无法启动,导致必须隔离处理不完整的评估轨迹。此外,多引擎(vLLM与llama.cpp)间运行时的标准化亦构成挑战,由于时间戳与令牌计数器存在差异,使得跨引擎的性能对比与结果复现增添了额外复杂性。
常用场景
经典使用场景
在大型语言模型与智能体系统评估的科研前沿,GDPVal数据集扮演着度量智能体任务完成质量的核心标尺角色。该数据集构建了涵盖220项多样化任务的评估体系,以平均奖励分数作为关键性能指标,为不同量化精度与架构的模型提供了统一竞技平台。研究团队借此可系统对比不同模型在Agent任务场景中的表现,如FP8、NVFP4等低精度量化方案与全精度模型之间的性能差异,通过对奖励分布、回合截断率等精细指标的分析,深入揭示模型在实际智能体交互中的决策质量与鲁棒性。
衍生相关工作
受GDPVal评估框架的启发,学术界衍生出一系列围绕低精度量化智能体性能建模的经典工作。研究者基于其提供的行为轨迹与奖励细粒度分布,进一步探索了模型量化与Agent能力衰减之间的数学关联,催生了新的自适应量化感知推理策略。此外,该数据集所采用的MTP推测解码评价机制,促使后续工作在推测性采样与传统贪婪解码之间建立了更精细的性能对比基准,推动了边缘侧高效推理技术的系统化发展。
数据集最近研究
最新研究方向
当前,GDPVal评测数据集正作为低比特量化与稀疏化大模型在智能体任务中性能与效率平衡的核心标尺,聚焦于NVFP4、FP8及混合精度格式下模型部署的实战评估。前沿研究紧密围绕NVIDIA Nemotron系列混合架构及Qwen3.6系列MoE模型的推理优化展开,热点集中在vLLM与llama.cpp引擎下的多令牌预测(MTP)接受率、端到端解码吞吐量及任务级奖励分布上。以Jackrong/Qwopus3.6-27B-v2和nvidia/Qwen3.6-35B-A3B-NVFP4为代表的模型,在220项任务中展现出差异化的平均奖励与推理延迟特征,揭示了压缩精度对工具调用与长上下文推理能力的微妙影响。该数据集的系统性评估不仅为下一代黑威尔架构上的量化推理方案提供了可复现的基准,更推动了行业从单纯追求参数量向‘每比特性能’权衡范式的演进。
以上内容由遇见数据集搜集并总结生成



