遇见数据集

bun-server-bench

收藏
github2026-06-21 更新2026-07-17 收录
官方服务:

资源简介:

bun-server-bench是一个基准测试和轨迹数据集,用于训练小型专用编码模型以进行Bun后端开发。它包含50个版本化任务,每个任务都经过精心设计,以测试HTTP语义、身份验证、SQLite事务、幂等性、并发性、速率限制、队列、可观察性、WebSockets和上传等生产环境中的边缘情况。数据集提供公开和隐藏测试套件、参考解决方案、Harbor包导出和轨迹数据,旨在评估编码代理在真实Bun服务器工程中的正确性和鲁棒性。

bun-server-bench is a benchmarking and trace dataset for training small, specialized coding models for Bun backend development. It contains 50 versioned tasks, each meticulously designed to test production-grade edge cases including HTTP semantics, authentication, SQLite transactions, idempotence, concurrency, rate limiting, queues, observability, WebSockets, and file uploads. The dataset provides public and hidden test suites, reference solutions, Harbor package exports, and trace data, aiming to evaluate the correctness and robustness of coding agents in real-world Bun server engineering practices.

创建时间:
2026-06-16
原始信息汇总

数据集概述

bun-server-bench 是一个用于评估编码智能体(coding agent)构建正确后端服务能力的基准测试(benchmark)与轨迹数据集(trajectory dataset)。它专注于真实的 Bun 服务端工程领域,包含 50 个版本化的任务,每个任务都设计有“表面正确但实际错误”的陷阱。

核心目标

  • 衡量:编码智能体编写的代码是否能通过生产环境中的边缘情况考验,而不仅仅是看起来正确。
  • 定位:前沿模型在通用编码套件上已接近满分,该数据集通过缩小领域至生产级别的 Bun 服务来保持区分度。
  • 数据来源:TinyComputer 的研究项目,用于探索小型专业化模型在狭窄工程领域能否媲美前沿模型的行为。

关键特点

  • 任务设计:每个任务都包含公开和隐藏两套测试用例。一个看似合理但有缺陷的实现可能通过公开测试,但会在隐藏测试中失败。
  • 禁止联网:每个任务在运行时网络被禁用,且不允许任何运行时依赖项。智能体必须自行实现功能,而非导入外部包。
  • 执行引擎:使用 Harbor 作为规范的执行引擎来运行和评分。

数据集规模与构成

属性 数量
任务总数 50
导出的 Harbor 包 50
公开 / 隐藏测试套件 50 / 50
参考解决方案 50
每个任务允许的运行时依赖 0
  • 难度分布(1 最易 → 5 最难):1→7,2→3,3→2,4→20,5→18
  • 数据划分train 4 个,dev 44 个,public_eval 0 个,private_eval 2 个

评分机制

评分采用“门控”机制,没有“接近正确”的中间分数:

  • 公开和隐藏测试均通过:100 分
  • 公开测试通过,隐藏测试失败:25 分
  • 公开测试失败,或安装/启动/超时失败:0 分

Harbor 包通过 reward.txt 文件输出相同结果(1.0 / 0.25 / 0.0)。

涵盖的技术领域

任务覆盖了真实服务端工程的多个高要求领域,包括:

  • HTTP 语义
  • 身份验证
  • SQLite 事务
  • 幂等性
  • 并发控制
  • 速率限制
  • 消息队列
  • 可观测性
  • WebSocket
  • 文件上传

使用场景与指南

  • 评估智能体:参考 docs/guides/evaluate-your-agent.md
  • 基于轨迹训练模型:参考 docs/guides/train-on-trajectories.md
  • 贡献新任务:参考 docs/guides/contribute-a-task.md
  • 了解防作弊机制:参考 docs/integrity.md
  • 规范参考:参考 docs/reference/

安装与运行

  • 运行一个任务的参考解决方案bun run run:reference tasks/http-apis.todo-health.v1
  • 使用指定智能体运行任务bun run run:agent --task tasks/authentication.jwt-verify.v1 --agent claude-code
  • 通过 Harbor 运行发布包harbor run -p harbor/databases-optimistic-version-v1 --agent oracle -e docker -y

为何选择 Bun 技术栈

  • 功能压缩Bun.serve 提供 HTTP 和 WebSocket 原语,bun:sqlite 实现持久化和事务。
  • 原生 TypeScript:保持任务循环简洁。
  • 记忆化压力低:Bun 运行时较新,智能体难以通过记忆化来作弊。
  • 领域专注性:足够狭窄以训练专家模型,又足够丰富以考验工程判断力。

许可协议

所有任务均声明为 Apache-2.0 许可。在重新分发任务、Harbor 包或数据集导出时,需保留许可元数据。

搜集汇总
数据集介绍
bun-server-bench 数据集图片
构建方式
bun-server-bench是一个专为评估代码智能体在真实后端工程场景中表现而设计的基准与轨迹数据集。其构建核心在于精心编排了50个版本化的任务,每个任务均聚焦于Bun服务器开发中的关键领域,如HTTP语义、认证、SQLite事务、幂等性、并发控制、速率限制、队列、可观测性、WebSocket及文件上传等。每个任务不仅包含公开测试用例,更设计了隐藏测试套件,旨在捕捉那些看似正确实则存在边界缺陷的实现。任务的难度从1到5分级,其中多数任务集中在4和5难度级别,确保了基准的区分度。此外,数据集附带了参考解决方案和导出的Harbor包,以支持标准化执行与评分。
特点
该数据集的核心特征在于其对代码正确性的严苛衡量标准,超越了传统通过性测试的局限。每个任务均嵌入了针对生产环境中边缘案例的陷阱,例如通过并发请求检测幂等性实现中的锁缺失。评分机制采用门控式设计:仅当公开与隐藏测试均通过时方获得满分100分,任何隐藏测试失败仅得25分,而公开测试失败或运行时错误则直接计0分,彻底杜绝了部分正确带来的得分。所有任务均声明零运行时依赖且禁用网络,迫使智能体自行实现核心功能,而非依赖外部库。这种设计使得数据集在高分饱和的通用编码基准之外,依然能提供持续信号,尤其适用于评估和训练专注于狭窄工程领域的专业模型。
使用方法
使用bun-server-bench时,用户需先通过`bun install`安装依赖并使用`bun run validate`验证所有任务的结构完整性。运行单个任务的参考解决方案以查看端到端执行结果可使用`bun run run:reference`命令,指定任务路径即可。用户若需评估自己的编码智能体,则使用`bun run run:agent`命令,并指定任务名称(如`tasks/authentication.jwt-verify.v1`)和智能体类型(如`claude-code`)。此外,通过Harbor执行引擎运行已发布的数据包非常便捷,命令为`harbor run -p`后跟包名和代理类型。每次运行都会在`runs/`目录下生成详细工件,包括提示、补丁、日志和得分,便于后续分析和模型训练。详细的快速入门指南、并发执行及结果导出等高级用法可在文档的quickstart章节中找到。
背景与挑战
背景概述
bun-server-bench基准测试数据集诞生于2024年,由TinyComputer研究团队构建,旨在评估编码智能体在生产级Bun服务工程中的真实能力。随着前沿模型在通用编码测试中趋于饱和,传统基准已难以揭示智能体的深层缺陷。该数据集聚焦于HTTP语义、认证、SQLite事务、幂等性、并发控制等五十个版本化任务,每个任务均精心设计了表面通过但隐藏测试失败的陷阱,以衡量代码从“看似正确”到“真正正确”的鸿沟。其核心研究问题是:编码智能体能否构建出经得起生产环境边缘情况考验的后端服务?这一问题对评估和训练面向特定工程领域的编码智能体具有重要价值,也为小规模专业模型追赶前沿行为提供了可量化基准。
当前挑战
该数据集所解决的领域核心挑战在于:通用编码基准已无法区分智能体的真实能力差异,模型可能通过记忆模式获得高分,却难以应对生产环境中的微妙契约错误。具体而言,每个任务均需智能体处理如并发请求下的幂等性保障——同步操作中检测和防止重复支付的并发锁机制,以及零运行时依赖和网络禁用的严格限制,迫使智能体必须从零实现功能而非依赖库。数据集构建过程中面临的挑战包括:既要保证隐藏测试足够敏感以揭露实现缺陷,又要避免不切实际的复杂度;同时需要平衡50个任务在1至5级难度上的分布,确保训练集、开发集和评估集之间的信息不泄露,维持基准的长期信号价值。
常用场景
经典使用场景
在人工智能辅助编程领域,bun-server-bench数据集被精心设计用于评估代码生成智能体在构建真实生产级后端服务时的鲁棒性与正确性。该数据集包含50个版本化任务,每个任务均围绕Bun运行时的核心能力展开,如HTTP语义实现、身份认证、SQLite事务处理、幂等性保障、并发控制、速率限制、消息队列、可观测性、WebSocket通信及文件上传等。这些任务通过构造看似正确但实际存在隐藏缺陷的“陷阱”实现,使得仅通过公开测试的代码在触及并发竞态、边界条件和状态一致性的隐式测试时暴露问题,从而精准量化智能体从“代码看似正确”到“代码本质正确”之间的鸿沟。
解决学术问题
该数据集直面当前前沿编码模型在通用编程基准上趋于饱和、分数趋同而失去区分度的学术困境。通过将领域收窄至Bun服务器工程这一高信号、高信息密度的垂直场景,bun-server-bench在每个任务中人为嵌入细粒度的契约性缺陷(如校验顺序错误、事务缺失、游标越界等),从而在评分体系中维持足够的鉴别力。它解决的学术研究问题核心在于:如何设计一种可复现、可量化且难以作弊的评估范式,以揭示智能体在真实生产环境中对微妙语义的理解能力,而非仅检验其对常见模式的机械记忆。该数据集的发布为编码智能体在可靠性维度的评估提供了具有统计显著性的新基准。
衍生相关工作
该数据集的发布催生了若干重要的衍生研究。其核心方法论——即在任务中部署多层不可见的“陷阱”来区分表面正确与本质正确的实现——被后继工作借鉴用于构建更广泛领域的鲁棒性评估基准。围绕bun-server-bench的轨迹数据(包括提示词、补丁、日志和评分),研究人员开发了针对Bun服务器工程的专用小模型训练方案,探索如何通过狭窄领域的专家轨迹实现超越通用前沿模型的效果。此外,基于该基准的完整性保障机制,出现了若干关于代码生成基准中数据泄露防范的研究,而数据集附带的Harbor包和标准化执行引擎也被复用为其他运行时(如Node.js、Deno)下编码智能体评估的底层基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务