遇见数据集

faibench_Frontier_Infra_Bench

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

Φ-Bench(Frontier AI Infrastructure Benchmark,亦称FAI-Bench / ΦBench)是一个前沿AI基础设施基准测试,旨在评估大语言模型(LLM)和自主编码智能体在真实ML系统与LLM基础设施工程中的能力。该基准测试包含85个开源LLM基础设施工程任务,涵盖三个逐层扩展的设置:Kernel Function Completion(KFC,55个任务,GPU内核实现与优化)、Long-Horizon Implementation(LHI,20个任务,长周期仓库级开发)和End-to-End Optimization(E2EO,10个任务,端到端系统优化)。任务源自前沿系统研究中的实际问题,并基于真实开源仓库构建,覆盖LLM训练与推理的广泛基础设施,包括GPU/CUDA内核优化、分布式训练、推理与部署(vLLM)、低精度与量化、通信与集合、检查点与存储、MoE路由、注意力与状态空间内核等。每个任务提供自包含的公共Dockerfile,通过git clone和docker build可完全复现环境;所有任务均为离线运行,评分系统与包一同发布,支持离线评分。数据集包含机器可读的任务索引(tasks_index.json)和评分公式(SCORING.md),并提供参考实现或Oracle补丁(83个任务)。该基准测试采用Apache-2.0许可证,但vendored上游代码保留原有许可证。

Φ-Bench (Frontier AI Infrastructure Benchmark, also known as FAI-Bench / ΦBench) is a frontier AI infrastructure benchmark designed to evaluate the capabilities of large language models (LLMs) and autonomous coding agents in real ML systems and LLM infrastructure engineering. The benchmark includes 85 open-source LLM infrastructure engineering tasks across three progressively scaled settings: Kernel Function Completion (KFC, 55 tasks, GPU kernel implementation and optimization), Long-Horizon Implementation (LHI, 20 tasks, long-horizon repository-level development), and End-to-End Optimization (E2EO, 10 tasks, end-to-end system optimization). The tasks are derived from practical problems in frontier systems research and are built on real open-source repositories, covering a broad range of LLM training and inference infrastructure, including GPU/CUDA kernel optimization, distributed training, inference and deployment (vLLM), low-precision and quantization, communication and collectives, checkpointing and storage, MoE routing, attention and state-space kernels, etc. Each task provides a self-contained public Dockerfile, allowing full environment reproduction via git clone and docker build; all tasks run offline, and the scoring system is released with the package, supporting offline scoring. The dataset includes a machine-readable task index (tasks_index.json) and scoring formulas (SCORING.md), and provides reference implementations or Oracle patches (83 tasks). The benchmark is licensed under Apache-2.0, with vendored upstream code retaining their original licenses.

创建时间:
2026-08-13
原始信息汇总

Φ-Bench (FAI-Bench) 数据集详情

数据集概述

Φ-Bench (Frontier AI Infrastructure Benchmark) 是一个用于评估前沿大语言模型(LLM)和自主编码代理在真实世界ML系统和LLM基础设施工程中能力的基准测试集。该数据集包含 85个开源的LLM基础设施工程任务,覆盖GPU/CUDA内核优化、分布式训练、推理与服务(vLLM)、低精度与量化、通信/集合通信、检查点与存储、MoE路由、注意力与状态空间内核等领域。

基本信息

  • 名称: Φ-Bench: Frontier AI Infrastructure Benchmark
  • 许可证: Apache-2.0
  • 语言: 英语、中文
  • 数据集规模: n<1K(少于1000个样本)
  • 标签: benchmark, llm-infra, llm-systems, infrabench, kernelbench, docker, cuda, gpu
  • 任务数量: 85个
  • 官网: http://llminfrabench.com/

任务分类

数据集任务分为三个子集,覆盖从局部到全局的工程范围:

子集 任务数 任务类型
KFC (Kernel Function Completion) 55 单内核实现与优化
LH (Long-Horizon Implementation) 20 长时程仓库级开发
E2E (End-to-End Optimization) 10 端到端系统优化

任务设计特点

  • 完全离线: 所有任务设置 allow_internet = false,求解和评分均离线运行,所有依赖(包括模型权重和数据集)在 docker build 时固化到镜像中。
  • Docker 可复现: 每个任务附带自包含的公共 Dockerfile,通过 git clone + docker build 即可复现环境。
  • 评分机制: 任务包中附带评分器(grader),通过 tests/test.shcompute_reward.py 进行评分。
  • 性能锚点: 奖励函数形式为 min(1, ln(speedup/ref_speedup)/ln(ref_speedup)),需超过参考加速比才能获得正分数;77个任务带有性能锚点。

包结构

  • tasks_index.json: 85个任务的机器可读索引(包根路径、布局、GPU、范围、锚点、oracle可用性)
  • SCORING.md: 两类奖励的评分公式
  • scripts/verify_package.py: 包自检脚本
  • tasks/kfc/, tasks/lh/, tasks/e2e/: 三个子集的任务目录
  • 每个任务的包根目录包含: instruction.md(模型唯一可见输入)、task.toml(资源配置)、Dockerfile、environment/(含挖掘出的工作树)、tests/(评分面)、solution/(参考实现)

运行方式

  1. 构建镜像: docker buildx build -f environment/Dockerfile -t <image> .
  2. 运行容器让代理求解: docker run --rm [--gpus all] -it <image>
  3. 评分: docker run --rm [--gpus all] -v "$PWD/tests:/tests:ro" <image> bash /tests/test.sh
  4. 查看奖励: cat /logs/verifier/reward.json

也可使用 scripts/run_task.py 任务运行器自动化整个流程(构建→代理→评分→奖励),该脚本为单文件且仅依赖标准库。

重要约定

  • tests/ 与镜像一起发布但永不嵌入镜像,仅在评分时挂载(隐藏测试用例、强基线和校准锚点均在其中)。
  • 工作树式提交合同: 代理直接编辑允许的文件并保留在工作树中的更改,评分读取树与基线提交的diff;代理不得执行 git commit
  • 代理CLI在运行时注入:镜像不附带任何代理,通过 --agent-bin 挂载或 --agent-install 安装。
  • 83个任务附带参考补丁/oracle,可通过 --agent oracle 路径验证参考得分。

可复现性与验证

  • 挖掘出的工作树是自证的:oracle.patch 必须在 environment/repo/ 上正向干净应用且反向应用失败,以证明该树正是参考补丁所针对的基线。
  • scripts/verify_package.py 提供只读自检,验证必需文件、task.toml 解析、Dockerfile 可解析、锚点和注意事项一致性、树自证等。

许可说明

  • 自有工作(任务规范、评分器、参考方案、loop16框架、运行器和自检脚本、文档)采用 Apache 2.0 许可证。
  • 从公共源获取的供应商上游代码(如 nanoGPT、torchtitan、vLLM、llama.cpp、Megatron-LM、ColossalAI等)及模型权重/数据集(如 Qwen2.5、all-MiniLM-L6-v2、wikitext等)保留其原始许可证和版权,不包含在 Apache-2.0 授权范围内。
搜集汇总
数据集介绍
faibench_Frontier_Infra_Bench 数据集图片
构建方式
Φ-Bench(Frontier AI Infrastructure Benchmark)是一套专为评估前沿大语言模型在机器学习系统与LLM基础设施工程领域能力而设计的基准测试集。其构建方式匠心独运,每个任务均以自包含的公共Docker镜像形式封装,通过'git clone'与'docker build'即可复现完整环境,且求解与评分均离线进行,所有依赖(含模型权重与数据集)在镜像构建时即已固化。基准包含85项任务,自真实开源仓库中挖掘提炼,横跨三个层次:内核函数补全(KFC,55项)、长程实现(LHI,20项)与端到端优化(E2EO,10项),从局部CUDA/GPU内核开发延伸至仓库级系统优化,全面覆盖LLM训练与推理基础设施栈。
特点
该数据集的核心特色在于其开放性与可复现性。每项任务均附带公开Dockerfile,评分面(tests/)与参考答案(solution/)随包发布,但均不嵌入镜像,确保评测的公正性。性能锚点(ref_speedup)作为校准常量,要求求解者必须超越基线方能得分,且锚点解析链严谨,避免静默回退。值得一提的是,工作区采用'工作树风格'提交,智能体直接编辑文件而非提交commit,便于各类编码脚手架无缝接入。此外,任务集覆盖GPU内核优化、分布式训练、推理服务、量化等广泛领域,且所有任务均禁用互联网,确保环境封闭可控。
使用方法
使用Φ-Bench需遵循固定的操作流程。首先进入任务包根目录,使用Docker BuildKit构建镜像,然后启动容器供智能体离线求解,最后挂载tests/目录执行评分脚本并读取奖励值。官方提供scripts/run_task.py单文件运行器,支持将构建、求解、评分串联为一条命令,并可指定代理模式(如claude-code、codex)或执行oracle自检。为保障可复现性,包内自带验证脚本,用于检查Dockerfile可解析性、锚点有效性及挖掘树的自证性。用户可按需抽样或全量运行85项任务,输出结果以标准化日志形式存档,便于对比分析。
背景与挑战
背景概述
Φ-Bench(Frontier AI Infrastructure Benchmark)由Φ-Bench贡献者于2026年创建,旨在系统评估前沿大语言模型(LLM)在LLM基础设施工程中的能力。该基准填补了现有基准(如KernelBench、TritonBench)仅聚焦于孤立的GPU内核或预定义优化目标的空白,首次将评估扩展到开放、长周期的系统级工程场景。其85项任务覆盖内核函数补全(KFC)、长周期实现(LHI)和端到端优化(E2EO)三个层次,从局部CUDA内核优化到仓库级开发,全面模拟真实基础设施工程挑战。该基准通过Docker自包含环境与离线评分机制确保可复现性,为LLM在自主优化AI基础设施方面的潜力提供了系统性评测工具,对该领域的研究具有重要推动作用。
当前挑战
Φ-Bench面临的核心挑战包括:一是领域问题的挑战,即现有基准无法衡量模型在开放、长周期工程任务中的表现,而Φ-Bench要求模型在真实代码库中导航、识别瓶颈并迭代优化,超越了传统单一操作符或函数的评估范围;二是构建过程的挑战,包括确保所有任务在离线环境下可复现,需将依赖、权重和数据集完全嵌入Docker镜像,同时需处理不同任务对网络构建的依赖差异。此外,性能锚点的校准依赖特定硬件(如NVIDIA H20),硬件变化需重新校准,且评分机制要求模型必须超越参考性能才能获得非零分数,这对模型能力提出了严苛要求。
常用场景
经典使用场景
Φ-Bench(Frontier AI Infrastructure Benchmark)作为前沿AI基础设施基准测试,其核心应用场景在于系统化评估大语言模型及自主编码代理在真实机器学习系统与LLM基础设施工程中的综合能力。该基准涵盖85项开源任务,横跨Kernel函数补全(KFC)、长周期实现(LHI)及端到端优化(E2EO)三个递进层次,从局部CUDA内核编写至仓库级系统优化,构建了从微观算子到宏观系统的完整评估维度。每项任务均封装于自包含的Docker镜像中,支持离线求解与评分,确保了评估的可复现性与公平性,为研究社区提供了衡量前沿模型在基础设施工程领域能力的标准化测试平台。
衍生相关工作
Φ-Bench的发布催生了若干值得关注的研究方向。其一,基于其长周期任务设计,研究者开始探索将强化学习与程序合成技术应用于仓库级代码优化,衍生出面向基础设施的自主智能体训练范式的探讨。其二,其校准锚点与评分公式促进了关于模型加速比公平度量方法的研究,例如在不同硬件平台上重新校准性能基准的实践。其三,该基准的Docker化与离线框架被后续工作借鉴,推动了可复现AI系统评估标准的发展,例如在隐私敏感场景下利用隔离环境进行模型能力测试的变异研究。此外,关于模型在开放式优化任务中暴露的局限性,也引发了对大模型推理边界与工程决策能力更深度的学术探讨。
数据集最近研究
最新研究方向
Φ-Bench(Frontier AI Infrastructure Benchmark)标志着大语言模型评估从孤立的编码任务向开放式、长周期基础设施工程的范式跃迁。该基准聚焦于LLM能否自主驾驭支撑其自身的算力基座,涵盖从CUDA内核补全到仓库级端到端系统优化的85项真实任务,尤其强调在离线、免网络环境下的可复现Docker化评测。这一方向呼应了当前AI系统研究中对自主优化与自举式基础设施演进的迫切需求,为评估前沿模型在复杂系统级问题上的持久探索、瓶颈定位与迭代调优能力提供了严苛的试验场。其开源发布和严格的自证验证机制,有望推动LLM从被动代码生成迈向主动的基础设施工程师角色,深刻影响未来AI算力栈的自主设计和运维范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务