遇见数据集

CodeRouterBench

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

CodeRouterBench是一个基准数据集,与Agent-as-a-Router方法一同发布,专门用于代码相关任务的模型路由评估。其核心数据单元是一个完整的任务-模型结果矩阵,每个基准任务记录了八个典型后端模型的性能结果。数据集包含分布内(ID)和分布外(OOD)两种任务类型,主要文件包括长格式的CSV结果文件(如id_results_long.csv、ood176_results_long.csv)和JSONL格式的任务元数据文件(如id_tasks.jsonl、ood176_tasks.jsonl)。数据规模方面,ID任务包含9,999个任务(分为7,080个探测任务和2,919个ID测试任务),OOD任务包含176个任务,每个任务对应8个模型,总计产生超过80,000行模型执行结果记录。每条结果记录包含任务ID、数据分割、任务维度、模型名称、性能分数、计算成本(美元)、输入/输出令牌数、总令牌数、延迟(毫秒)以及成本来源等详细字段。该数据集旨在为代码生成领域的模型选择与路由策略研究提供标准化的评估基准,支持对模型性能、效率和经济成本进行多维度分析。

CodeRouterBench is a benchmark dataset released alongside the Agent-as-a-Router method, specifically designed for model routing evaluation in code-related tasks. Its core data unit is a complete task-model result matrix, where each benchmark task records the performance results of eight typical backend models. The dataset includes both in-distribution (ID) and out-of-distribution (OOD) task types, with main files comprising long-format CSV result files (e.g., id_results_long.csv, ood176_results_long.csv) and JSONL-format task metadata files (e.g., id_tasks.jsonl, ood176_tasks.jsonl). In terms of data scale, ID tasks consist of 9,999 tasks (divided into 7,080 probing tasks and 2,919 ID test tasks), OOD tasks consist of 176 tasks, each corresponding to 8 models, resulting in over 80,000 rows of model execution result records. Each result record includes detailed fields such as task ID, data split, task dimension, model name, performance score, computational cost (USD), input/output token counts, total token count, latency (milliseconds), and cost source. This dataset aims to provide a standardized evaluation benchmark for model selection and routing strategy research in the code generation field, supporting multi-dimensional analysis of model performance, efficiency, and economic cost.

创建时间:
2026-06-22
原始信息汇总

数据集名称

CodeRouterBench

任务类型

  • 文本生成(text-generation)

语言

  • 英语(en)

许可证

  • MIT

标签

  • code、benchmark、model-routing、tabular、arxiv:2606.22902

数据集简介

CodeRouterBench 是与论文 Agent-as-a-Router 一同发布的基准测试数据。其核心是一个完整的任务×模型结果矩阵:每个基准任务都记录了在八个标准后端模型上的结果。

相关资源

数据集文件与配置

配置:default

  • probing 分割id_probing_results_long.csv(7,080 个探测任务 × 8 个模型 = 56,640 行结果)
  • id_test 分割id_test_results_long.csv(2,919 个 ID 测试任务 × 8 个模型 = 23,352 行结果)
  • ood176 分割ood176_results_long.csv(176 个 OOD 任务 × 8 个模型 = 1,408 行结果)

配置:id_full

  • all 分割id_results_long.csv(9,999 个分布内任务 × 8 个模型 = 79,992 行结果)

配置:task_metadata

  • id_all 分割id_tasks.jsonl(ID 任务元数据,包含分割和维度信息)
  • probing 分割id_probing_tasks.jsonl
  • id_test 分割id_test_tasks.jsonl
  • ood176 分割ood176_tasks.jsonl(OOD176 任务提示与元数据)

其他关键文件

  • models.json:标准模型列表及美元定价元数据
  • summary.json:计数、源路径及完整性检查

数据集模式(Schema)

id_results_long.csv

  • task_id
  • splitprobingid_test
  • source_split:原始内部分割,值为 trainvaltest
  • dimension
  • model
  • score:路由 oracle 使用的任务得分/性能
  • cost_usd
  • input_tokens
  • output_tokens
  • total_tokens
  • latency_ms
  • cost_sourcetoken_log_pricingmissing_token_recordmissing_token_record_zero_total

ood176_results_long.csv

  • task_id
  • source_splitold112new64
  • bench
  • original_task_id
  • dimension
  • model
  • resolved
  • apply_ok
  • graded
  • in_tok
  • out_tok
  • calls
  • cost_usd
  • cost_source
  • source_status

数据分割(Splits)

  • probing:7,080 个任务
  • id_test:2,919 个任务
  • ood176:176 个任务(当前公开的 OOD 基准)
  • 较旧的 OOD112/SWE-MiniSandbox 数据仅作为遗留补充保留在仓库中。

成本计算说明

  • 对于 ID 行,cost_usd 根据 data/id/tokens.jsonldata/matrices/phase1_id/model_pricing.json 计算。当前导出中有 148 行遗留数据,计算出的 ID 成本总计为 408.082583 USD。
  • 对于 OOD176 行,cost_usd 根据 in_tokout_tok 和相同的定价表重新计算。当前导出中 OOD176 成本总计为 422.147494 USD。

源矩阵

长格式表格是从 GitHub 仓库中保存的嵌套矩阵导出的:

  • data/matrices/phase1_acrouter_v2/obs_matrix_clean.json
  • data/matrices/phase2_ood/unified/matrix_acrouter_ood176.json
搜集汇总
数据集介绍
CodeRouterBench 数据集图片
构建方式
CodeRouterBench 是伴随 Agent-as-a-Router 研究发布的基准数据集,核心构建单元为任务-模型结果矩阵,涵盖每个任务在八个经典后端模型上的完整表现记录。数据集基于 GitHub 仓库中嵌套的观测矩阵导出,其中同分布任务源自 phase1_acrouter_v2 阶段,跨分布任务则来自 phase2_ood 阶段。通过将原始矩阵展平为长表格格式,保留了任务标识、模型名称、评分、成本及延迟等关键字段,同时从 token 记录和定价元数据中计算出成本与令牌使用量,形成了结构化的多维度评估数据。
特点
该数据集涵盖约一万个同分布任务与一百七十六个跨分布任务,每个任务均包含八个模型的推理结果,共计逾十万条记录。数据以长表格形式组织,便于按模型或任务维度进行查询与聚合。同分布数据被划分为探测集与测试集,跨分布数据则按来源分为旧版与新版分组。此外,数据集附有任务元数据文件,提供了任务维度归属与提示信息,支持灵活的基准测试拆分与针对性评估。
使用方法
用户可通过 Hugging Face datasets 库直接加载默认配置,获得探测集、同分布测试集及跨分布测试集的主数据表。亦可使用 hf download 命令将完整快照下载至本地,结合 GitHub 仓库中的复现脚本运行路由实验。数据集支持按任务标识、模型名称或成本字段进行筛选与分析,同时提供了任务元数据文件,便于与外部模型路由算法进行联合训练或评估,从而复现论文中的路由性能比较。
背景与挑战
背景概述
CodeRouterBench是一个面向代码任务的大语言模型路由基准数据集,由LanceZPF等研究团队于2025年发布。该数据集的核心研究问题在于如何高效地在一组异构的模型中动态选择最佳模型以完成特定编程任务,从而在性能与成本之间取得最优平衡。通过构建包含9,999个分布内任务与176个分布外任务、横跨八个经典后端模型的完整任务-模型结果矩阵,CodeRouterBench为模型路由领域提供了一个标准化的评估平台。其关联论文“Agent-as-a-Router”提出了将智能体作为路由器的创新范式,显著推动了代码自动补全、程序修复等下游任务的自动化决策研究。
当前挑战
CodeRouterBench所解决的领域挑战在于,现有的大语言模型面对多样化的代码任务时,往往缺乏统一的模型选择机制,导致资源浪费与性能不稳定。该数据集的构建过程亦面临诸多困难:首先,如何设计一个覆盖广泛代码任务类型且具备高多样性的任务集合,以确保路由器的泛化能力;其次,在收集八种模型的推理结果时,需处理不同模型的定价、延迟和输出长度等异构信息,形成标准化的代价与性能指标;最后,分布外任务的界定与评估需要严谨的设计,以验证路由策略在未知场景下的鲁棒性,避免过拟合于已知任务分布。
常用场景
经典使用场景
CodeRouterBench作为一个专注于代码任务的模型路由基准数据集,其经典使用场景在于评估和比较多种大语言模型在编程挑战中的表现。具体而言,研究者可利用该数据集提供的完整任务-模型结果矩阵,包含近一万个分布内任务和一百七十六个分布外任务,覆盖八种主流后端模型,从而系统性地分析不同模型在代码生成、调试、理解等子任务上的性能差异。这一基准为设计智能路由策略提供了坚实的实验平台,使得模型选择过程得以量化,并推动了路由算法从静态规则向自适应、基于任务特征的动态决策演进,成为衡量代码领域模型路由效能的标尺。
衍生相关工作
基于CodeRouterBench衍生出的经典工作包括“Agent-as-a-Router”框架,该工作提出了一个代理式路由模型,通过在线学习与任务上下文感知,动态选择最优模型处理编程任务。研究者还进一步发展了如“ACRouter”等轻量级路由适配器,能在保持高准确率的前提下减少推理时的计算开销。此外,围绕该基准涌现出多项关于分布外任务泛化、路由策略鲁棒性分析的研究,以及结合成本敏感学习的模型调度方法。这些工作不仅丰富了模型路由的理论体系,还催生了将路由机制嵌入更广泛推理系统的趋势,推动了代码代理领域从静态模型选择迈向自适应的智能演进。
数据集最近研究
最新研究方向
CodeRouterBench作为“Agent-as-a-Router”范式的核心基准测试,聚焦于代码任务中的智能模型路由机制。该数据集通过构建涵盖9,999个分布内任务和176个分布外任务的完整任务-模型结果矩阵,为评估多模型协作下的路由决策提供了标准化框架。前沿研究正围绕其提出的路由适配器(Router Adapter)展开,探索如何根据任务特征动态选择最优模型以平衡性能与成本,这一方向与当前大语言模型(LLM)在代码生成与自动修复领域的高效部署需求紧密契合。CodeRouterBench的出现,推动了从单一模型泛化向多模型智能调度的研究转型,其影响体现在两个方面:一方面,通过代理性路由机制提升了代码任务的准确性与鲁棒性,为AI辅助编程工具如SWE-bench等提供了可复现的评估基础;另一方面,其公开的定价与延迟元数据开启了成本感知型模型路由的实证研究,契合了产业界对大规模推理系统经济性的迫切关注。该基准的发布,标志着代码智能领域从模型能力竞赛向系统级优化策略的范式转移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务