遇见数据集

witcheer/hermes-pairing-bench

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

这是一个名为Hermes Pairing — Agentic Benchmark for Local LLMs (Phase A)的数据集,用于评估本地大型语言模型驱动代理的能力。数据集通过将本地模型与Hermes Agent(一个CodeAct代理)配对进行测试,该代理使用Python代码编写来协调工具,而非生成JSON函数调用。数据集包含一个排行榜,基于四个轴(加权总和为Hermes Pairing Score,范围0-100)对模型进行排名:codeact(代码作为动作,权重0.40)、longcontext(长上下文检索,权重0.25)、instruction(指令遵循,权重0.20)和multistep(多步循环稳定性,权重0.15)。数据在NVIDIA RTX 5090(32GB)上使用llama.cpp/GGUF和真实约3.5K令牌系统提示生成,属于可重复的合成排名阶段(Phase A),用于评估代理能力,而非实际验证(Phase B为验证步骤)。数据集还包括模型性能分析、方法细节和关键发现,如模型效率对比、长上下文内存限制等。

This dataset, named Hermes Pairing — Agentic Benchmark for Local LLMs (Phase A), is designed to evaluate how well local large language models can drive an agent. It pairs local models with Hermes Agent (a CodeAct agent by NousResearch), where the model acts by writing Python code (`execute_code`) to orchestrate tools, rather than emitting JSON function calls. The dataset includes a leaderboard ranking models based on four axes (with a weighted sum called Hermes Pairing Score, ranging 0–100): codeact (code-as-action, weight 0.40), longcontext (retrieve-and-use in long context, weight 0.25), instruction (compliance under real prompt, weight 0.20), and multistep (loop stability, weight 0.15). Data was generated using llm-bench-rig on an NVIDIA RTX 5090 (32GB) with llama.cpp/GGUF and under Hermess real ~3.5K-token system prompt. It represents a reproducible synthetic ranking phase (Phase A) for agentic capability assessment, with Phase B serving as the validation step using the actual Hermes Agent. The dataset also provides findings, methodology details, and model information, highlighting aspects like model efficiency, long-context limitations, and performance trade-offs.

提供机构:
witcheer
搜集汇总
数据集介绍
witcheer/hermes-pairing-bench 数据集图片
构建方式
Hermes Pairing Benchmark 针对本地大语言模型在智能体任务中的表现,构建了一套双阶段评估体系。第一阶段(Phase A)基于合成数据,通过 llm-bench-rig 工具在 NVIDIA RTX 5090 平台与 llama.cpp/GGUF 环境下,测度模型在代码执行、长上下文检索、指令遵循及多步循环四个维度的能力,各维度加权合成 Hermes Pairing 评分。第二阶段(Phase B)则选取 Phase A 的优胜模型,部署至真实的 Hermes Agent 框架中,对 14 项多步任务进行三次重复验证,依据文件系统状态判定成功与否,并记录调用轮次与生成令牌数,以揭示合成测试无法捕捉的效率与可靠性差异。
特点
该数据集极具特色之处在于其双阶段设计:合成阶段提供可复现的基准排序,而真实阶段则通过实际智能体闭环验证排名可靠性,两者结合构成了对模型能力的深度剖析。数据集涵盖了从 18B 至 36B 的多种参数量级模型,并针对长上下文场景引入 VRAM 感知的逐深度评分机制,若模型在 64K 上下文下内存溢出则该深度记零分,从而揭示小模型在资源受限条件下的优势。此外,评判标准不再依赖单一性能,而是呈现各模型在不同维度上的强弱分化,为不同场景的模型选型提供了精细依据。
使用方法
使用该数据集时,可借助 Hugging Face 的 datasets 库加载两个配置:`phase_a_synthetic` 与 `phase_b_real_harness`,分别对应合成阶段与真实阶段的数据。分析时,可参考 Hermes Pairing 评分的加权公式(codeact 权重 0.40,longcontext 权重 0.25,instruction 权重 0.20,multistep 权重 0.15)复现排名,并利用 Phase B 中的任务完成率与效率指标(平均调用轮次、生成令牌数)进行综合评估。对于希望复现实验的研究者,完整的测试代码与实施细节均托管于 llm-bench-rig 代码库的 lib/agentic/ 目录下。
背景与挑战
背景概述
Hermes Pairing基准测试(hermes-pairing-bench)由NousResearch团队于2024年创建,旨在评估本地大语言模型(LLM)在智能体(agent)任务中的表现,特别是与Hermes Agent(一种基于CodeAct的代理框架)的配对效果。该数据集聚焦于一个核心研究问题:在资源受限的本地环境中(如单张NVIDIA RTX 5090 32GB显卡),如何量化并比较不同模型在代码执行、长上下文检索、指令遵循和多步推理四个维度上的代理能力。通过合成阶段(Phase A)和真实验证阶段(Phase B)的双层设计,该基准揭示了模型大小、效率与代理性能之间的复杂关系。其影响力在于为本地LLM的代理能力评估提供了可复现的标准化方法,并推动了针对单卡部署场景的模型选择与优化研究。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,本地LLM代理推理的核心挑战是平衡模型容量与资源限制,例如大模型(如36B)在64K上下文长度下因显存不足(OOM)而失效,而小模型可能牺牲多步推理能力;同时,代理任务的评价维度(代码执行、长上下文、指令遵循、多步循环)难以通过单一指标统一衡量,合成排名与真实性能存在偏离(如Phase A中并列第一的模型在Phase B中效率差异显著)。在构建过程中,挑战包括:合成阶段难以捕捉真实代理循环中的效率差距(如生成token数量差异可达3.7倍),以及真实验证阶段需设计14个多步任务并执行126次运行以获得统计有效的结论;此外,不同模型在各类任务上的失败模式差异(如解析逻辑与变换链)增加了结果解释的复杂性。
常用场景
经典使用场景
Hermes Pairing Benchmark 专为评估本地大语言模型(LLM)在代理任务中的驱动能力而设计,其经典使用场景聚焦于衡量模型在 CodeAct 范式下的表现。该基准要求模型通过编写 Python 代码来编排工具,而非依赖传统的 JSON 函数调用,从而真实反映模型在沙箱环境中执行多步操作、长上下文检索和指令遵循等复杂代理行为的效能。
解决学术问题
该数据集系统性地解决了当前学术界在评估本地 LLM 代理能力时缺乏标准化、可复现指标的困境。它通过引入四维评分体系(codeact、long-context、instruction、multistep),量化了模型在代码驱动、长记忆上下文、指令忠诚度及循环稳定性等方面的表现,揭示了模型大小与代理效能之间的非单调关系,以及 VRAM 限制对长上下文任务的瓶颈,为代理模型的设计与优化提供了实证依据。
衍生相关工作
围绕 Hermes Pairing Benchmark,衍生了一系列重要工作,包括其配套的评测框架 llm-bench-rig,该工具实现了从合成阶段到真实环境验证的完整流水线。此外,该基准催生了针对 CodeAct 代理的优化研究,如调整系统提示词以减少“提示税”(heavy-prompt tax),以及探索模型压缩与量化策略(如 GGUF)对代理性能的影响。这些工作共同推动了本地化、高能效代理系统的发展,并为跨模型对比分析奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务