frontier-allocation-metrics
收藏资源简介:
该数据集名为 Frontier Allocation Metrics(前沿分配指标),专注于预算有限的大语言模型推理分配实验。它提供了来自两个提供商/模型快照(Azure OpenAI 的 gpt-4.1-mini 和 Google Vertex Gemini 的 gemini-2.5-flash)在四个推理基准(GSM8K、MATH-500、GPQA-Diamond、StrategyQA)上的每查询结果测量,所有测量均基于固定的逻辑推理调用预算(6次)。数据集包含四个配置:(1) per_query_outcomes(7,184行),是主要的方法级结果表,每行代表一个评估方法在一个不透明基准示例上的结果,包含方法、提供商、模型、基准、示例ID、token计数、延迟、估计成本、正确性及验证元数据;(2) aggregate_matrix(32行),由 per_query_outcomes 直接重算的提供商×模型×基准×方法汇总;(3) search_trace_summary(1,992行),记录 Google Vertex Gemini 运行的详细逐查询执行摘要,包括是否扩展搜索树;(4) search_trace_nodes(3,092行),节点级搜索树跟踪,记录步骤深度、优先级分数和战略决策,完全无文本且可通过唯一跟踪哈希链接到汇总表。数据集不包含基准问题文本、答案、提示、原始模型输出、API负载、私有端点、账户元数据或提供商请求标识符。字段包括 benchmark、example_uid、provider、model、method、method_source_id、budget_logical_calls、input_tokens、output_tokens、total_tokens、latency_seconds、estimated_cost_usd、exact_match、gold_in_tree、parse_extraction_failure、trust_tier、validation_status、acquisition_date、source_cell_id 等。搜索跟踪配置还包含 trace_uid、node_id、parent_node_id、depth、action_type、priority、continuation_value、diversity_bonus、duplicate_cost、coverage_gain、semantic_overlap、force_explore、gate_intervened、plausibility_score、base_priority_score、expansion_order、strategy_family 等字段。该数据集支持研究预算有限下的 LLM 推理分配、成本/准确率/延迟权衡、每查询方法选择、历史提供商/模型行为以及 Frontier Allocation 方法比较的可重复性,可避免未来研究者重复进行付费 API 评估。同时,结构化的跟踪配置允许进行搜索树拓扑分析、预算分配效率、停止与延迟行为、优先级引导评估以及 Frontier 行为可重复性等深入研究。该数据集不应被用作通用模型质量排行榜,也不应尝试逆向不透明ID或视模型输出为人工标注。
This dataset, named Frontier Allocation Metrics, focuses on budget-constrained LLM inference allocation experiments. It provides per-query result measurements from two provider/model snapshots (Azure OpenAIs gpt-4.1-mini and Google Vertex Geminis gemini-2.5-flash) across four reasoning benchmarks (GSM8K, MATH-500, GPQA-Diamond, StrategyQA), all based on a fixed logical reasoning call budget of 6. The dataset contains four configurations: (1) per_query_outcomes (7,184 rows), the main method-level results table with method, provider, model, benchmark, example ID, token counts, latency, estimated cost, correctness, and validation metadata; (2) aggregate_matrix (32 rows), a provider×model×benchmark×method summary recomputed from per_query_outcomes; (3) search_trace_summary (1,992 rows), detailed per-query execution summaries for Google Vertex Gemini runs, including whether the search tree was expanded; (4) search_trace_nodes (3,092 rows), node-level search tree traces recording step depth, priority scores, and strategic decisions, fully text-free and linkable via unique trace hashes. The dataset excludes benchmark question text, answers, prompts, raw model outputs, API payloads, private endpoints, account metadata, or provider request identifiers. Fields include benchmark, example_uid, provider, model, method, method_source_id, budget_logical_calls, input_tokens, output_tokens, total_tokens, latency_seconds, estimated_cost_usd, exact_match, gold_in_tree, parse_extraction_failure, trust_tier, validation_status, acquisition_date, source_cell_id, etc. The search trace configurations also include trace_uid, node_id, parent_node_id, depth, action_type, priority, continuation_value, diversity_bonus, duplicate_cost, coverage_gain, semantic_overlap, force_explore, gate_intervened, plausibility_score, base_priority_score, expansion_order, strategy_family, etc. This dataset supports reproducible research on budget-constrained LLM inference allocation, cost/accuracy/latency trade-offs, per-query method selection, historical provider/model behavior, and Frontier Allocation method comparison, avoiding future researchers repeating paid API evaluations. The structured trace configurations enable in-depth analysis of search tree topology, budget allocation efficiency, stopping and delay behavior, priority-guided evaluation, and reproducibility of Frontier behavior. This dataset should not be used as a general model quality leaderboard, nor should attempts be made to reverse opaque IDs or treat model outputs as human annotations.
Frontier Allocation Metrics 数据集详情
数据集概述
Frontier Allocation Metrics 是一个面向预算受限的大语言模型(LLM)推理分配实验的纯指标研究数据集,版本为 v1。该数据集包含来自两个提供商/模型快照和四个推理基准的匹配预算运行的脱敏逐查询结果测量,不包含基准问题文本、答案文本、提示词、原始模型补全内容、API 载荷、私有端点、账户元数据或提供商请求标识符。数据集采用 CC BY 4.0 许可。
数据配置
数据集包含四个配置,全部为 Parquet 格式,均使用 train 分割:
| 配置名 | 行数 | 内容说明 |
|---|---|---|
per_query_outcomes |
7,184 行 | 主要的方法级结果表,一行代表某个被评估方法在某个不透明基准示例、某个提供商/模型及固定预算下的一个结果记录 |
aggregate_matrix |
32 行 | 提供商 × 模型 × 基准 × 方法的汇总表,直接从 per_query_outcomes 重新计算得出 |
search_trace_summary |
1,992 行 | Google Vertex Gemini 运行的逐查询执行摘要,记录通用元数据及搜索树是否展开 |
search_trace_nodes |
3,092 行 | 节点级逐步搜索树轨迹,记录步长深度、优先级分数和策略决策,完全无文本,可通过唯一轨迹哈希与摘要表关联 |
覆盖范围
- 提供商/模型快照:Azure OpenAI
gpt-4.1-mini;Google Vertex Geminigemini-2.5-flash - 基准数据集:GSM8K、MATH-500、GPQA-Diamond、StrategyQA
- 推理方法:
Frontier(direct_reserve_semantic_frontier_v2)、L1(external_l1_max)、S1(external_s1_budget_forcing)、TALE(external_tale_prompt_budgeting)
排除项
Cohere 和 Fireworks 的行在 v1 中被排除;Fireworks × GPQA-Diamond 因协议不收敛未被纳入性能数据。GPQA-Diamond 仅以派生指标和项目本地不透明示例标识符的形式包含,原始 GPQA ID、问题文本、选项和答案标签均未分发。
关键指标与注意事项
- 逻辑调用预算:固定为 6,但不代表六次完全相同的模型调用
- 估算成本(
estimated_cost_usd):基于日志记录的分词数和定价假设的估算值,非审计账单 - 延迟(
latency_seconds):方法级记录的运行时间,可能包含客户端/运行时开销,非提供商 SLA - 正确性(
exact_match):基准归一化的正确性指标,原始问题、答案和模型输出均未发布
主要数据字段
per_query_outcomes 核心字段包括:benchmark、example_uid(不透明 ID)、provider、model、method、budget_logical_calls、input_tokens、output_tokens、total_tokens、latency_seconds、estimated_cost_usd、exact_match、gold_in_tree、parse_extraction_failure、trust_tier、validation_status、acquisition_date、source_cell_id。
search_trace_nodes 核心字段包括:trace_uid、node_id、parent_node_id、depth、action_type(expand 或 direct_reserve)、priority、continuation_value、diversity_bonus、duplicate_cost、coverage_gain、semantic_overlap、force_explore、gate_intervened、plausibility_score、base_priority_score、expansion_order、strategy_family。
研究用途
该数据集支持预算约束下的 LLM 推理分配、成本/准确率/延迟权衡、逐查询方法选择、历史提供商/模型行为等研究,可避免重复付费 API 实验。结构轨迹配置支持搜索树拓扑分析、预算分配效率、停止与延迟行为、优先级引导评估等研究方向。
非预期用途与局限性
- 不应用作通用模型质量排行榜
- 测量结果仅反映特定时间点的提供商/模型快照、基准子集、方法实现和单一预算
- 不应将不透明 ID 用作基准 ID 或尝试逆向还原
- 不应将模型生成的结果视为人类标注
发布日期与引用
数据集版本为 v1,不可变科学发布修订版本号为 8f2093cf646fe61064321e6464d852cc55ebe0b4。相关论文为 Soroush Vahidi 于 2026 年发表的 Selective Deferral for Budgeted LLM Answer Selection: Failure-Trace Signals under Matched-Budget Evaluation(Research Square 预印本,DOI: 10.21203/rs.3.rs-9783817/v1)。源代码/项目仓库位于:https://github.com/SoroushVahidi/frontier-allocation-for-budgeted-llm-inference





