遇见数据集

frontier-allocation-metrics

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集名为 Frontier Allocation Metrics(前沿分配指标),专注于预算有限的大语言模型推理分配实验。它提供了来自两个提供商/模型快照(Azure OpenAI 的 gpt-4.1-mini 和 Google Vertex Gemini 的 gemini-2.5-flash)在四个推理基准(GSM8K、MATH-500、GPQA-Diamond、StrategyQA)上的每查询结果测量,所有测量均基于固定的逻辑推理调用预算(6次)。数据集包含四个配置:(1) per_query_outcomes(7,184行),是主要的方法级结果表,每行代表一个评估方法在一个不透明基准示例上的结果,包含方法、提供商、模型、基准、示例ID、token计数、延迟、估计成本、正确性及验证元数据;(2) aggregate_matrix(32行),由 per_query_outcomes 直接重算的提供商×模型×基准×方法汇总;(3) search_trace_summary(1,992行),记录 Google Vertex Gemini 运行的详细逐查询执行摘要,包括是否扩展搜索树;(4) search_trace_nodes(3,092行),节点级搜索树跟踪,记录步骤深度、优先级分数和战略决策,完全无文本且可通过唯一跟踪哈希链接到汇总表。数据集不包含基准问题文本、答案、提示、原始模型输出、API负载、私有端点、账户元数据或提供商请求标识符。字段包括 benchmark、example_uid、provider、model、method、method_source_id、budget_logical_calls、input_tokens、output_tokens、total_tokens、latency_seconds、estimated_cost_usd、exact_match、gold_in_tree、parse_extraction_failure、trust_tier、validation_status、acquisition_date、source_cell_id 等。搜索跟踪配置还包含 trace_uid、node_id、parent_node_id、depth、action_type、priority、continuation_value、diversity_bonus、duplicate_cost、coverage_gain、semantic_overlap、force_explore、gate_intervened、plausibility_score、base_priority_score、expansion_order、strategy_family 等字段。该数据集支持研究预算有限下的 LLM 推理分配、成本/准确率/延迟权衡、每查询方法选择、历史提供商/模型行为以及 Frontier Allocation 方法比较的可重复性,可避免未来研究者重复进行付费 API 评估。同时,结构化的跟踪配置允许进行搜索树拓扑分析、预算分配效率、停止与延迟行为、优先级引导评估以及 Frontier 行为可重复性等深入研究。该数据集不应被用作通用模型质量排行榜,也不应尝试逆向不透明ID或视模型输出为人工标注。

This dataset, named Frontier Allocation Metrics, focuses on budget-constrained LLM inference allocation experiments. It provides per-query result measurements from two provider/model snapshots (Azure OpenAIs gpt-4.1-mini and Google Vertex Geminis gemini-2.5-flash) across four reasoning benchmarks (GSM8K, MATH-500, GPQA-Diamond, StrategyQA), all based on a fixed logical reasoning call budget of 6. The dataset contains four configurations: (1) per_query_outcomes (7,184 rows), the main method-level results table with method, provider, model, benchmark, example ID, token counts, latency, estimated cost, correctness, and validation metadata; (2) aggregate_matrix (32 rows), a provider×model×benchmark×method summary recomputed from per_query_outcomes; (3) search_trace_summary (1,992 rows), detailed per-query execution summaries for Google Vertex Gemini runs, including whether the search tree was expanded; (4) search_trace_nodes (3,092 rows), node-level search tree traces recording step depth, priority scores, and strategic decisions, fully text-free and linkable via unique trace hashes. The dataset excludes benchmark question text, answers, prompts, raw model outputs, API payloads, private endpoints, account metadata, or provider request identifiers. Fields include benchmark, example_uid, provider, model, method, method_source_id, budget_logical_calls, input_tokens, output_tokens, total_tokens, latency_seconds, estimated_cost_usd, exact_match, gold_in_tree, parse_extraction_failure, trust_tier, validation_status, acquisition_date, source_cell_id, etc. The search trace configurations also include trace_uid, node_id, parent_node_id, depth, action_type, priority, continuation_value, diversity_bonus, duplicate_cost, coverage_gain, semantic_overlap, force_explore, gate_intervened, plausibility_score, base_priority_score, expansion_order, strategy_family, etc. This dataset supports reproducible research on budget-constrained LLM inference allocation, cost/accuracy/latency trade-offs, per-query method selection, historical provider/model behavior, and Frontier Allocation method comparison, avoiding future researchers repeating paid API evaluations. The structured trace configurations enable in-depth analysis of search tree topology, budget allocation efficiency, stopping and delay behavior, priority-guided evaluation, and reproducibility of Frontier behavior. This dataset should not be used as a general model quality leaderboard, nor should attempts be made to reverse opaque IDs or treat model outputs as human annotations.

创建时间:
2026-08-14
原始信息汇总

Frontier Allocation Metrics 数据集详情

数据集概述

Frontier Allocation Metrics 是一个面向预算受限的大语言模型(LLM)推理分配实验的纯指标研究数据集,版本为 v1。该数据集包含来自两个提供商/模型快照和四个推理基准的匹配预算运行的脱敏逐查询结果测量,不包含基准问题文本、答案文本、提示词、原始模型补全内容、API 载荷、私有端点、账户元数据或提供商请求标识符。数据集采用 CC BY 4.0 许可。

数据配置

数据集包含四个配置,全部为 Parquet 格式,均使用 train 分割:

配置名 行数 内容说明
per_query_outcomes 7,184 行 主要的方法级结果表,一行代表某个被评估方法在某个不透明基准示例、某个提供商/模型及固定预算下的一个结果记录
aggregate_matrix 32 行 提供商 × 模型 × 基准 × 方法的汇总表,直接从 per_query_outcomes 重新计算得出
search_trace_summary 1,992 行 Google Vertex Gemini 运行的逐查询执行摘要,记录通用元数据及搜索树是否展开
search_trace_nodes 3,092 行 节点级逐步搜索树轨迹,记录步长深度、优先级分数和策略决策,完全无文本,可通过唯一轨迹哈希与摘要表关联

覆盖范围

  • 提供商/模型快照:Azure OpenAI gpt-4.1-mini;Google Vertex Gemini gemini-2.5-flash
  • 基准数据集:GSM8K、MATH-500、GPQA-Diamond、StrategyQA
  • 推理方法Frontierdirect_reserve_semantic_frontier_v2)、L1external_l1_max)、S1external_s1_budget_forcing)、TALEexternal_tale_prompt_budgeting

排除项

Cohere 和 Fireworks 的行在 v1 中被排除;Fireworks × GPQA-Diamond 因协议不收敛未被纳入性能数据。GPQA-Diamond 仅以派生指标和项目本地不透明示例标识符的形式包含,原始 GPQA ID、问题文本、选项和答案标签均未分发。

关键指标与注意事项

  • 逻辑调用预算:固定为 6,但不代表六次完全相同的模型调用
  • 估算成本estimated_cost_usd):基于日志记录的分词数和定价假设的估算值,非审计账单
  • 延迟latency_seconds):方法级记录的运行时间,可能包含客户端/运行时开销,非提供商 SLA
  • 正确性exact_match):基准归一化的正确性指标,原始问题、答案和模型输出均未发布

主要数据字段

per_query_outcomes 核心字段包括:benchmarkexample_uid(不透明 ID)、providermodelmethodbudget_logical_callsinput_tokensoutput_tokenstotal_tokenslatency_secondsestimated_cost_usdexact_matchgold_in_treeparse_extraction_failuretrust_tiervalidation_statusacquisition_datesource_cell_id

search_trace_nodes 核心字段包括:trace_uidnode_idparent_node_iddepthaction_typeexpanddirect_reserve)、prioritycontinuation_valuediversity_bonusduplicate_costcoverage_gainsemantic_overlapforce_exploregate_intervenedplausibility_scorebase_priority_scoreexpansion_orderstrategy_family

研究用途

该数据集支持预算约束下的 LLM 推理分配、成本/准确率/延迟权衡、逐查询方法选择、历史提供商/模型行为等研究,可避免重复付费 API 实验。结构轨迹配置支持搜索树拓扑分析、预算分配效率、停止与延迟行为、优先级引导评估等研究方向。

非预期用途与局限性

  • 不应用作通用模型质量排行榜
  • 测量结果仅反映特定时间点的提供商/模型快照、基准子集、方法实现和单一预算
  • 不应将不透明 ID 用作基准 ID 或尝试逆向还原
  • 不应将模型生成的结果视为人类标注

发布日期与引用

数据集版本为 v1,不可变科学发布修订版本号为 8f2093cf646fe61064321e6464d852cc55ebe0b4。相关论文为 Soroush Vahidi 于 2026 年发表的 Selective Deferral for Budgeted LLM Answer Selection: Failure-Trace Signals under Matched-Budget Evaluation(Research Square 预印本,DOI: 10.21203/rs.3.rs-9783817/v1)。源代码/项目仓库位于:https://github.com/SoroushVahidi/frontier-allocation-for-budgeted-llm-inference

搜集汇总
数据集介绍
frontier-allocation-metrics 数据集图片
构建方式
该数据集源自对预算受限的大语言模型推理分配实验的系统性度量,采用匹配预算(六次逻辑推理调用)的对照设计,在Azure OpenAI的gpt-4.1-mini与Google Vertex Gemini的gemini-2.5-flash两种前沿模型快照上,针对GSM8K、MATH-500、GPQA-Diamond及StrategyQA四项推理基准进行规范化评估。数据构建严格遵循匿名化与脱敏原则,仅保留查询级的量化结果,包括令牌计数、延迟、成本估算、正确性判定及验证元数据,完全排除提示文本、模型输出、原始基准内容等敏感信息。数据仓库以Parquet格式存储,细分为四个配置表:主结果表(per_query_outcomes)、聚合摘要表(aggregate_matrix)、搜索轨迹汇总表(search_trace_summary)及节点级搜索树追踪表(search_trace_nodes),各表通过不透明标识符或哈希值实现关联,确保科学可复现性的同时维护隐私边界。
使用方法
研究者可通过Hugging Face平台直接加载该数据集的四个配置(如使用load_dataset函数指定configs参数),依据数据字典进行定制化分析。推荐的探索路径包括:基于per_query_outcomes开展跨方法、跨基准的性能对比与成本效益回归分析;利用aggregate_matrix快速获取方法梗概,辅助研究假设的初步筛选;深入search_trace_summary与search_trace_nodes的关联查询,可揭示搜索树拓扑结构如何随问题领域变化,探究门控干预与强制探索标志对推理路径选择的影响。数据集设计支持无需重跑付费API实验即可复现前沿分配方法比较,尤其适用于预算分配效率、终止策略优化及优先级引导评估等研究方向。使用时应遵循CC BY 4.0许可,并注意上游基准的条款约束,避免将不透明ID误作原始标识符或进行逆向工程。
背景与挑战
背景概述
在大规模语言模型(LLM)推理成本日益攀升的背景下,预算约束下的推理分配策略成为优化成本、延迟与准确率权衡的关键研究方向。该数据集由Soroush Vahidi于2026年创建,旨在为预算化LLM推理实验提供标准化的度量基准,涵盖Azure OpenAI和Google Vertex Gemini两大模型快照,以及GSM8K、MATH-500、GPQA-Diamond和StrategyQA四个推理基准。其核心研究问题在于,如何在不同推理方法和预算限制下,实现成本、延迟与准确率的系统比较与优化。通过提供每查询级别的脱敏度量数据,该数据集填补了现有资源在细粒度预算分配实验上的空白,为后续研究提供了可复现的基准,降低了重复付费API实验的成本,推动了推理分配领域的科学进步。
当前挑战
该数据集面临的挑战主要源自领域问题与构建过程。领域层面,预算化推理分配需在固定预算内平衡成本、延迟与准确率,而现有方法(如Frontier、L1、S1和TALE)在不同基准上表现各异,缺乏统一度量标准,导致方法选择与资源分配困难。构建过程中,数据采集面临严格的隐私与合规约束,需去除所有敏感内容(如原始问题、答案和模型输出),仅保留脱敏度量,同时确保数据可复现性。此外,不同供应商的API行为差异、日志记录不一以及估计成本与实测账单的偏差,均对数据一致性和可靠性构成挑战。最终,构建团队通过多轮审查与验证,克服了这些困难,确保了数据集的科学严谨性与实用性。
常用场景
经典使用场景
在大型语言模型推理成本日益攀升的背景下,该数据集聚焦于预算受限的推理分配问题,为每查询级别的成本、延迟与准确率权衡提供标准化度量。研究者可借助其细粒度的逐查询结果表,在固定逻辑调用预算(如六次)下评估不同方法(如Frontier、L1、S1、TALE)的性能表现。该数据集尤其适合用于复现预算化推理实验,避免重复调用付费API,从而大幅降低研究成本。其结构化的搜索轨迹配置进一步支持对搜索树拓扑、节点扩展效率及终止行为的深度剖析,为推理策略的精细优化提供了坚实的数据基础。
解决学术问题
该数据集直击大型语言模型推理中的资源分配优化难题,解决了传统评估中缺乏匹配预算条件下多维度度量的问题。它使得研究者能够在一致的成本与延迟约束内,系统比较不同推理分配策略的准确率表现,填补了现有基准与路由数据集在细粒度、指标化比较上的空白。通过提供去标识化的逐查询结果与搜索轨迹元数据,它支持对预算分配效率、停止机制触发条件及优先级引导搜索的学术探索,为构建更为经济高效的推理系统提供了实证依据,推动了该领域从经验性评估向可复现科学研究的范式转变。
实际应用
在实际应用中,该数据集为云服务提供商与企业用户提供了一份精准的推理成本审计与优化指南。基于真实提供商(如Azure OpenAI与Google Vertex Gemini)的模型快照评测,其测量结果直接服务于API选型、预算规划与延迟敏感型应用的部署决策。工程师可依据每条查询的令牌消耗、延迟与成本估算,在性能与开销之间进行精细化权衡,从而设计出更具成本效益的推理路由策略。此外,其搜索轨迹数据可辅助开发直观的调试工具,用于识别推理流程中的无效扩展或过早终止,进而提升生产环境中大模型服务的整体可靠性。
数据集最近研究
最新研究方向
该数据集聚焦于预算受限的大语言模型推理分配策略,最新研究方向涵盖搜索树拓扑分析、预算分配效率评估、停止与延迟行为机制以及基于优先级的引导评估。通过提供逐查询的成本、延迟、准确率与结构化搜索轨迹数据,支持在不重复付费API实验的前提下,深入研究模型在严格资源预算下的推理路径选择与性能权衡。其独特之处在于仅发布脱敏的元数据与指标,避免了基准测试内容的再分发,为低成本复现与可扩展的推理优化研究提供了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务