遇见数据集

Orionfold/hermes-brain-bench-v0.1

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Hermes Brain Bench v0.1是一个小型、多样化、基于分级评分标准的基准测试,用于在本地Spark部署中选取OpenAI兼容工具使用助手的代理大脑(最初针对Hermes Agent开发,但该测试套件与工具无关——任何支持OpenAI工具格式的运行器均可使用)。它通过10个提示(其中8个为核心提示,2个为条件提示)和7个字节确定性的种子固定装置,评估代理在工具调用、多步推理、诚实性、JSON格式遵守等方面的表现。该基准旨在回答单一流吞吐量基准无法解决的问题:在相同评分标准下,哪个本地服务通道实际上能产生更正确的代理?它提供了参考分数和详细评分方法,适用于比较不同本地服务通道的代理性能。

A small, diverse, graded-rubric benchmark for picking the agent brain behind a local-only Spark deployment of an OpenAI-compatible tool-using assistant (developed against Hermes Agent, but the suite is harness-agnostic — any OpenAI-tool-format runner works). It measures agent performance through 10 prompts (8 core, 2 conditional) and 7 bytes-deterministic seeded fixtures, focusing on tool calling, multi-step reasoning, honesty, JSON format adherence, and more. The bench answers the question: which local serving lane actually produces the more correct agent under the same rubric, run-to-run? It includes reference scores and detailed scoring methodology for comparing agent performance across different local serving lanes.

提供机构:
Orionfold
搜集汇总
数据集介绍
Orionfold/hermes-brain-bench-v0.1 数据集图片
构建方式
Hermes Brain Bench v0.1 是一个专注于评估本地化工具调用型智能体(agent brain)性能的小型多样化基准测试集。其构建基于一个关键问题:单流吞吐量基准无法揭示不同本地服务通道下智能体的真实正确性差异。因此,该数据集精心设计了10个提示(prompt),其中8个为核心提示(cross-lane comparable),2个为条件提示(conditional on MCP / RAG)。每个提示均附带明确的确定性检查(如子串匹配、JSON键验证、正则表达式、诚实性判定等)以及预期的工具调用列表。此外,数据集包含7个字节级确定性的种子固定文件(seeded fixtures),确保各测试通道面对完全一致的世界状态,从而消除外部变量干扰。
特点
该数据集的核心特点在于其精细化的分级评分体系(graded-rubric)与多维度聚合指标。每个提示经过默认5次重复测试,汇总出通过率(pass_rate)、一致性(agreement)、正确工具调用率(correct_tool_rate)、超时率(runaway_rate)及壁钟时间等指标,最终形成每个测试通道的脑评分卡(BrainScorecard)。评分卡包含核心通过率、一致性、诚实性通过率、JSON格式通过率,并辅以吞吐量探测与GPU内存遥测数据。其排序规则别具匠心:以诚实性为闸门,依次比较核心通过率、一致性、超时率,最后才以令牌生成速度为打破平局的因素,凸显了智能体正确性优先于速度的设计哲学。
使用方法
使用该数据集需首先安装 fieldkit 库,并部署一个支持 OpenAI 工具调用格式的本地服务通道(如 llama-server、vLLM 或 NVIDIA NIM)。随后,通过 fieldkit.harness 模块的 evaluate_brain 函数加载提示套件与种子文件,并指定测试通道的端点地址与模型名称。该函数会自动运行提示套件,收集智能体的 Hermes 会话日志,按照互斥的最后槽位规则(last-slot rule)对工具调用与最终答案进行分桶评分,并输出完整的脑评分卡。用户只需将新通道的评分结果存放于 results 目录下,即可实现与官方参考通道的苹果对苹果对比,而无需担忧提示套件版本、种子文件或运行器版本的不一致问题。
背景与挑战
背景概述
Hermes Brain Bench v0.1 诞生于2025年,由NousResearch团队及其合作者构建,旨在解决本地化部署环境中智能代理(agent)大脑选择这一核心研究问题。在分布式计算与边缘推理日益普及的背景下,传统吞吐量基准无法衡量不同本地服务通道(serving lane)在相同规则下生成更正确代理行为的能力差异。该基准聚焦于评估本地Spark部署下OpenAI兼容工具调用助手(如Hermes Agent)的脑部(brain)质量,通过一套包含10个提示的精细评分体系(graded-rubric),测量模型在多步工具链、诚实性拒绝、严格格式遵循等维度的表现。其对领域的影响在于填补了本地化代理评估的空白,为开发者提供了可重复、自比较的评估方法,尤其适用于DGX Spark等边缘计算场景。
当前挑战
该数据集所解决的领域问题核心挑战在于,单一流吞吐量基准无法捕获代理行为正确性与一致性,传统评估方法忽略了工具调用链的复杂性、诚实性门槛以及格式纪律等关键维度。构建过程中,团队面临多重挑战:首先,提示设计需兼具判别力与可复现性,确保每个提示具备显式的确定性检查(如子串、JSON键、正则匹配),并设置硬性判别器(如p2_multistep_chain)以区分不同能力层级;其次,需要构建字节确定性(bytes-deterministic)的种子夹具文件,保证所有服务通道面对完全相同的世界状态,消除数据漂移;此外,评分机制需引入相互排斥的最后一槽规则(last-slot rule)以防止重复计数,并设计诚实性作为门槛门控(honesty-as-a-gate)机制,确保只有通过诚实性检验的模型才进入最终排名。这些挑战共同塑造了该基准在本地代理评估领域的独特价值。
常用场景
经典使用场景
Hermes Brain Bench v0.1是一款专为评估本地化智能体"大脑"性能而设计的小型多样化基准测试集。在本地部署的开源大型语言模型(LLM)智能体系统中,选择一个合适的服务通道作为智能体的核心推理引擎至关重要。该基准测试通过十组精心设计的提示,涵盖了单工具调用、多步骤工具链、算术推理、诚实性拒答、严格格式约束、代码微任务、MCP工具调用、RAG检索、多文件联合计算以及歧义消解等典型场景,能够深刻反映不同服务通道在相同评估标准下的智能体行为表现差异。
衍生相关工作
Hermes Brain Bench v0.1的发布催生了一系列重要的衍生工作。其配套的Field Notes项目提供了fieldkit.eval与fieldkit.harness两个核心库,分别封装了分级提示套件(GradedPromptSuite)、检查规范(CheckSpec)、评分卡(BrainScorecard)以及智能体评估流水线(evaluate_brain),这些工具已被社区广泛采纳用于构建自定义评估框架。此外,该基准直接促使了更大的服务通道对比基准项目Orionfold/spark-hermes-profile的诞生,用于深度剖析不同服务通道在吞吐和延迟方面的表现。伴随的深度技术文章《Picking the Hermes Brain on a DGX Spark》系统梳理了套件设计思路与三通道对比结论,为本地智能体运维领域提供了兼具理论深度与工程实践价值的指导性文献。
数据集最近研究
最新研究方向
该数据集聚焦于评估本地化工具调用型智能体(Agent)的推理质量与行为一致性,尤其关注在受限硬件环境(如DGX Spark)下,不同服务管道(serving lane)对智能体核心能力的影响。前沿研究方向已从传统的单一吞吐量基准测试,转向对智能体决策质量、诚实性、多步推理链与格式规约遵从性的综合判据。该基准通过细粒度评分规则(如诚实性门控、工具调用正确率与运行一致性)揭示了模型规模与量化策略对智能体行为鲁棒性的显著制约,其发布的参考分数揭示了4-bit量化在节省显存的同时可能引入超时风险,而FP8推理则在无逃逸前提下要求三倍统一内存。这一方法论的提出,为边缘部署场景下智能体头脑的理性选择提供了标准化评估框架,推动了工具增强型语言模型在实际本地化服务中的可信度检验与优化方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务