遇见数据集

exolabs/swe-bench-pro-hermes-eval-data

收藏
Hugging Face2026-06-04 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是SWE-Bench Pro Hermes Agent vLLM评估追踪数据集,用于记录在swe-bench-pro编码基准测试中,通过Margin harness(使用OpenCode代理在每案例docker容器中运行)针对自托管vLLM策略的每轮评估工件。数据集捕获了所有模型调用(通过代理角色和服务策略的日志代理),并重塑为矩阵模式。评估奖励(reward)设置为1.0当且仅当案例测试通过。数据集包含多个文件,如rollouts.jsonl、overall_summary.{json,md}、domain_summary.json(按案例类别分类)、all_tasks_usage.{json,csv}、proxy_calls.jsonl(包含缓存/未缓存提示令牌拆分的每请求捕获)、case_id_map.json、DONE.json和telemetry.tar.gz(每案例的agent_requests.jsonl和trajectory.json)。此外,数据集还提供了模型性能指标(如平均奖励、中位数奖励、通过率和零奖励计数)、MTP草案令牌接受率(按位置)和令牌使用情况(代理侧每轮总计)的统计表格。该数据集主要用于评估人工智能代理在软件工程任务中的性能。

This dataset is the SWE-Bench Pro Hermes Agent vLLM Evaluation Tracking Dataset, used to record per-round evaluation artifacts for self-hosted vLLM policies during the SWE-Bench-Pro coding benchmark test, executed via the Margin harness (using the OpenCode Agent running within per-case Docker containers). The dataset captures all model invocations (via log agents for agent roles and service policies) and reshapes them into a matrix format. The evaluation reward is set to 1.0 if and only if the corresponding task case passes all tests. The dataset includes multiple files, such as rollouts.jsonl, overall_summary.{json,md}, domain_summary.json (categorized by task case categories), all_tasks_usage.{json,csv}, proxy_calls.jsonl (captures per-request breakdowns of cached/uncached prompt tokens), case_id_map.json, DONE.json, and telemetry.tar.gz (containing agent_requests.jsonl and trajectory.json for each individual case). Additionally, the dataset provides statistical tables for model performance metrics including average reward, median reward, pass rate, and zero-reward count, MTP draft token acceptance rate (by position), and token usage statistics (total per round on the agent side). This dataset is primarily used to evaluate the performance of AI Agents on software engineering tasks.

提供机构:
exolabs
搜集汇总
数据集介绍
exolabs/swe-bench-pro-hermes-eval-data 数据集图片
构建方式
该数据集源自针对SWE-Bench Pro编程基准测试的评估流程,采用Margin harness框架,在每例独立的Docker容器中部署OpenCode智能体,并通过自托管的vLLM策略进行推理。所有模型调用经由common/proxy/openai_logging_proxy.py捕获至网络层面,随后由common/margin_postprocess.py重新塑造为矩阵模式。每条记录的奖励值(reward)为1.0当且仅当对应测试用例通过,确保评估信号清晰可靠。
特点
数据集以每轮运行目录为单位,存储了丰富的评估产物,包括rollouts.jsonl、overall_summary.{json,md}、domain_summary.json、all_tasks_usage.{json,csv}、proxy_calls.jsonl、case_id_map.json和DONE.json,以及包含每例agent_requests.jsonl和trajectory.json的telemetry.tar.gz。其中,proxy_calls.jsonl承载着关键的逐请求捕获信息,涵盖缓存与未缓存提示词令牌的拆分细节。此外,数据集跟踪了多令牌预测(MTP)草稿令牌的逐位置接受率与令牌使用统计,为模型效率分析提供了多维视角。
使用方法
用户可直接利用rollouts.jsonl文件按行解析每条智能体的交互轨迹,结合overall_summary.json获取平均奖励与pass@1等聚合指标。通过domain_summary.json按案例类别深入分析模型在不同领域的表现差异,而proxy_calls.jsonl则用于细粒度地研究提示词缓存策略与令牌消耗模式。对于需要复现或二次分析的场景,可加载case_id_map.json与DONE.json确认案例完整性,并解压telemetry.tar.gz以检视每例的完整决策路径与请求日志。
背景与挑战
背景概述
SWE-Bench Pro Hermes Agent vLLM Evaluation Traces 数据集由Margin机构在2025年构建,聚焦于评估大语言模型在复杂软件工程任务中的自主编码能力。该数据集基于swe-bench-pro基准,通过OpenCode智能体在每例Docker容器中运行,并采用自托管vLLM策略进行推理。其核心研究问题在于量化模型在真实软件缺陷修复场景下的端到端表现,以pass@1和平均奖励值为关键指标。该数据集的出现为自动程序修复、智能体评估及模型推理效率分析提供了细粒度的评估框架,尤其通过捕获每次模型调用的token消耗与缓存命中率,推动了编码智能体领域从结果导向到过程透明的范式转变。
当前挑战
该数据集首要解决的领域挑战在于如何准确度量语言模型在复杂软件工程任务中的实际执行能力,区别于传统文本生成基准,它要求模型在动态Docker环境中通过多步交互完成测试用例验证,涉及了代码理解、错误定位、补丁生成与测试验证的完整闭环。构建过程中遭遇的挑战包括:确保不同模型在同一任务上的评价公平性,需隔离基础设施失败(infra_failures)以避免噪声干扰;精确追踪每个智能体请求的token使用,区分缓存与未缓存提示,以分析模型推理的经济性与效率;以及设计灵活的评分机制(reward = 1.0仅当测试通过),在低通过率(如0.1000)条件下保持评估统计置信度,这些工作共同构成了数据集可靠性保障的关键壁垒。
常用场景
经典使用场景
在软件工程与自然语言处理的交叉领域,SWE-Bench Pro Hermes Agent vLLM Evaluation Traces数据集为评估大语言模型驱动的代码智能体在自动化软件修复任务中的表现提供了标准化基准。其最经典的使用场景是通过多轮交互轨迹,系统性地测度模型在真实代码仓库中定位缺陷、生成补丁并通过测试验证的能力。研究者可借助该数据集复现端到端代理评估流程,比较不同策略下模型在pass@1、平均奖励等指标上的差异,从而检验智能体在复杂软件工程环境中的决策质量与执行效率。
衍生相关工作
该数据集衍生了一系列聚焦于代码智能体高效推理与量化部署的经典工作。一方面,研究者基于其记录的代理请求日志与奖励模型,开发了面向长上下文的轻量级微调方法,使得小参数模型在特定仓库修复任务上逼近大模型性能。另一方面,数据集中的token消耗矩阵催生了自适应缓存策略,通过动态复用历史上下文显著降低推理成本。此外,基于失败案例的根因分析催生了对比学习框架,利用正负轨迹对增强模型对边界错误的识别能力。这些工作共同推动了代码智能体从实验原型向工业级应用的转化进程。
数据集最近研究
最新研究方向
基于大规模语言模型的自主编程智能体性能评估正成为软件工程与人工智能交叉领域的前沿热点。该数据集聚焦于SWE-Bench Pro基准测试,通过Margin工具链与OpenCode智能体在vLLM推理框架下的协同,量化了不同量化策略(如FP8、AWQ)对大模型代码修复能力的影响。实验数据显示,尽管模型规模与推理优化技术持续演进,当前智能体在真实软件缺陷修复任务中的pass@1指标仍然偏低(最高仅0.1),凸显了从代码理解到测试验证全链条中存在的深层挑战。该评估框架不仅记录了奖励信号与基础设施故障,还细致捕捉了多令牌推测解码的接受长度与缓存效率,为构建更可靠的代码生成与自动调试系统提供了关键实证,也间接呼应了近期关于AI辅助软件工程可复现性与鲁棒性的重要讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务