遇见数据集

burrito-evals

收藏
github2026-09-01 更新2026-09-10 收录
官方服务:

资源简介:

用于gpt-oss的完整评估套件和数据集,包含320,192次运行、3.49B tokens、在单个RTX 3090上耗时1,062 GPU小时。数据集包括eval_results.csv(每行对应一次运行,包含后端、API、工具架构模式、推理努力、种子、token计数、延迟、正确性等字段),以及原始模型输出和推理轨迹、Jinja模板、评估规范、报告和44个图表。

A complete evaluation suite and dataset for gpt-oss, consisting of 320,192 runs, 3.49B tokens, and consuming 1,062 GPU hours on a single RTX 3090. The dataset includes eval_results.csv, where each row corresponds to one run and contains fields such as backend, API, tool architecture pattern, inference effort, seed, token count, latency, correctness, etc., alongside raw model outputs and inference trajectories, Jinja templates, evaluation specifications, reports, and 44 charts.

创建时间:
2026-09-01
原始信息汇总

数据集概述

burrito-evals 是一个公开的评估数据集与评估套件,用于记录论文/项目 gpt-oss 的推理基准测试结果。该数据集包含 320,192 次运行,对应 34.9 亿 tokens 的推理数据,总计消耗 1,062 GPU 小时(在单张 RTX 3090 上完成)。

核心内容

  • data/eval_results.csv — 主数据集:320,192 行,每一行为一次运行的详细记录,包含后端、API 类型、工具 schema 模式、工具标志、推理努力程度、随机种子、各类 token 计数(输入/输出/推理/回复)、延迟、正确性、工具调用次数、多轮任务簿记以及错误/失败模式。
  • data/gpt_oss/data/bfcl_v4/ — 每次运行的原始模型输出(含完整推理踪迹),按运行配置和种子分目录存储。
  • artifacts/ — 包含两个 Jinja 聊天模板(默认版本与修复版本)以及全部的评估规格说明(eval_specs.xlsx)。
  • report/ — 完整的实验报告(含七个主要发现)、公开文章、推理深度分析、全部 44 张图的规范记录以及详细数据参考文档。
  • plots/ — 44 张评估图,涵盖各阶段的 5 个可靠性指标(平均准确率、pass@8、pass^8、fail^8、错误率)。
  • 代码 — 包含评分/聚合引擎(eval_aggregator.py)、分析与绘图套件(eval_helpers.py)、可复现全部图表的 Jupyter Notebook(eval_report.ipynb)以及各后端的服务配置脚本。

主要发现

  1. 配置比模型能力更重要 — 相同权重的模型得分可从约 0% 变化到约 87%,取决于模板、工具格式、API 类型和努力程度。
  2. 默认 Jinja 模板会破坏模型性能 — 在无工具场景下,修正模板可将实测准确率从约 3% 提升至约 40%。
  3. API 类型影响显著 — vLLM 上 /v1/responses 在多轮任务中的错误率(73.5–83.5%)远高于 /v1/chat/completions(29.0–36.0%)。
  4. 结构化工具 schema 可大幅提升多轮任务准确率 — 相比 AST 解析方式,多轮准确率可提升至原来的三倍(后者几乎降为 0%)。
  5. 推理努力程度不仅改变长度,更影响答案质量 — 固定约 1.4K 推理 token 预算下,AIME25 在低/中/高努力下准确率分别为 38%/97%/100%。
  6. 原生 Python 工具可额外提升 10–24 个百分点的准确率,同时降低 token 使用量。

实验设置

  • 模型与硬件 — gpt-oss-20b(MXFP4 量化,128K 上下文),单张 RTX 3090,batch size 1,temperature 1.0。
  • 规模 — 320,192 次运行 = 40,024 个(配置, 问题)对 × 8 个随机种子。
  • 评估阶段:每个阶段报告 5 个指标(平均准确率、pass@8、pass^8、fail^8、错误率)。
  • 测试后端(7 个) — burrito over llama.cpp / vLLM(各有保留思考变体)、vanilla llama.cpp(默认与修复模板)、vanilla vLLM。
  • 基准测试 — BFCL v4(三种模式:非实时、实时、多轮基础)+ AIME25 + GPQA(来自 OpenAI GPT-OSS 推理套件)。
  • 实验维度 — 两种 API(/v1/chat/completions/v1/responses)、两种工具定义模式(结构化 schemas vs AST 解析)、三种推理努力程度(低/中/高)、是否启用 python / browser 工具。

复现方法

数据集分析无需 GPU,整个报告仅从 CSV 派生。用户可通过 uv sync 安装依赖后打开 eval_report.ipynb 重算标题数字并重新生成全部 44 张图。重新运行完整评估则需要 GPU 及对应后端。

许可证

MIT 许可证,涵盖本仓库中所有数据、轨迹与工件。

搜集汇总
数据集介绍
burrito-evals 数据集图片
构建方式
burrito-evals数据集是围绕gpt-oss模型推理性能的系统性评估产物,其构建过程严谨而庞大。研究者通过固定模型权重(gpt-oss-20b,MXFP4量化,128K上下文),在单一RTX 3090上执行了超过32万次独立运行,累计消耗1062 GPU小时。每个配置-问题组合均采用8个固定随机种子重复实验,以支撑多维度可靠性指标的统计需求。数据采集覆盖七种后端服务(基于llama.cpp与vLLM的burrito变体、原始llama.cpp及vLLM等),并沿三个基准维度(BFCL v4、AIME25、GPQA)展开,同时系统性地操纵了工具调用模式(结构化模式与AST解析)、推理努力级别(低/中/高)、API风格(chat/completions与responses)等关键变量,最终形成包含320,192条记录的eval_results.csv核心数据集。
特点
该数据集的显著特征在于其全面性与透明度。它不仅记录了每项运行的后端、API类型、工具模式、推理努力和随机种子等配置参数,还详细捕获了输入输出令牌数、推理令牌数、响应延迟、正确性、工具调用次数以及多轮任务中的逐轮状态,使得每个数据点都可追溯至基础模型输出和完整推理轨迹(存放于data/gpt_oss及data/bfcl_v4目录)。尤为值得一提的是,数据集揭示了远超模型能力本身的配置敏感性:同一组权重在不同的模板、工具格式和API组合下,得分可从接近0%跃升至87%,清晰表明推理部署细节对最终性能具有决定性影响。此外,所有被排除的运行(如bot拦截或错误批处理)均保留于__discard_目录,确保了研究的可审计性与可复现性。
使用方法
该数据集的使用门槛极低,且路径清晰。对于希望复现报告结论或深入分析的用户,无需GPU即可运行分析流程:通过uv sync安装依赖后,执行或打开eval_report.ipynb,即可从data/eval_results.csv直接重新计算所有关键数值(包括令牌总数、运行次数、种子数、GPU小时),并重新生成全部44幅图表,这些图表覆盖了每个阶段(非实时、实时、多轮、AIME25、GPQA)的五个可靠性指标。若需复现实际的评估过程,则需配备GPU及相应的后端服务,可参考scripts/目录中每个后端的精确服务配置以及artifacts/eval_specs.xlsx列出的所有运行规范。数据集的MIT许可证允许自由使用,而report/下的多份文档(如dataset.md、report.md)则提供了详尽的数据字典和完整的发现报告,方便研究者按需检索与引用。
背景与挑战
背景概述
在大型语言模型推理系统迅猛演进的当下,模型权重之外的配置因素对实际性能的影响往往被低估。burrito-evals 数据集于2026年应运而生,由研究者 iamskeole 及其团队构建,依托 gpt-oss-20b 模型,在单一 RTX 3090 上历时 1,062 GPU 小时,系统性地执行了 320,192 次推理运行,累计生成 34.9 亿个标记,旨在探究推理堆栈中模板、工具格式、接口协议及推理努力程度等因素对模型效能的综合作用。该数据集不仅揭示了同一权重在不同配置下性能可从近乎零分跃升至 87% 的惊人现象,更首创性地区分了模板缺陷、接口错误等细微根因,为推理系统设计与评估提供了宝贵资源,其详尽记录与可复现性对领域内后续研究产生了深远影响。
当前挑战
该数据集所应对的核心挑战在于:首先,领域内普遍存在的‘模型能力决定论’认知偏差,忽视了配置细节的至关重要性,burrito-evals 通过实测数据有力证明了配置因素往往比模型选择更为关键。其次,多轮对话场景中接口协议的脆弱性,例如 vLLM 的 /v1/responses 接口在多轮任务中错误率高达 73.5-83.5%,而 /v1/chat/completions 仅为 29.0-36.0%,突显了协议兼容性的严峻考验。此外,构建过程中面临多重技术难关:需在单一消费级 GPU 上平衡算力与时间成本,采用高效功率管理服务;需精确控制八个随机种子以计算 pass@8 等指标,分解任务中的随机性与可靠性;还需应对实时基准测试中的网络爬虫封锁等外部干扰,并透明记录被剔除的运行以维护数据完整性,这些均构成了数据集创建过程中的显著挑战。
常用场景
经典使用场景
burrito-evals数据集聚焦于大规模语言模型推理配置的深度评估,其经典使用场景涵盖对模型服务后端(如llama.cpp与vLLM)、API接口风格、工具定义模式及推理努力水平等多元维度进行系统性的对照剖析。该数据集以320,192次独立运行记录,囊括了从准确率、token消耗到延迟及多轮任务成功率的细粒度指标,为研究者提供了在单一可控环境下量化推理配置影响的可复现基准,尤其适用于探究模型权重不变时,服务层面参数对输出质量与稳定性的决定性作用。
解决学术问题
该数据集解决了学术界长期忽视的推理基础设施配置与模型能力间的耦合难题,揭示了在固定模型权重下,配置差异可导致性能从近零至87%的剧烈波动,有力驳斥了‘模型权重即性能’的简化认知。它系统性地分离了模板设计、工具schema结构及推理努力等变量,为解释多轮任务中高错误率与工具调用失效提供实证,促进了关于模型鲁棒性、评估协议标准化及复现性研究的理论完善,对构建更可靠的模型评估方法论具有奠基性意义。
衍生相关工作
该数据集催生了多项关联性工作,包括对推理努力水平与答案质量非线性关系的深度分析(如AIME25准确率随努力档位跃迁),以及基于其多种子聚合指标(pass@8, pass^8等)的任务难度分解研究,从而区分了稳定解决、偶然幸运与系统性失败。其公开的评估聚合器与绘图套件亦为社区提供了标准化的分析工具,推动了关于后训练推理校准、工具增强开源模型能力边界以及跨后端起兼容性等后续探索,形成了从实证记录到理论洞察再到实践改进的良性研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务