遇见数据集

CodeGolf Bench

收藏
arXiv2026-05-28 更新2026-06-02 收录
数据链接:
官方服务:

资源简介:

CodeGolf Bench是由独立研究者Vedant Padwal创建的一个多语言代码生成基准数据集,旨在评估大型语言模型在60种编程语言中生成简洁高效代码的能力。该数据集基于代码高尔夫(code golf)竞赛平台,包含115个涵盖艺术、计算、游戏、数学、序列和转换等六类问题,每个问题均配有标准测试用例和实时人类解决方案基线。数据集的构建过程通过自动化API从code.golf平台获取问题陈述、语言支持和验证框架,确保了数据的动态更新与低污染风险。该数据集主要应用于评估LLM在资源受限环境(如物联网设备)下的代码优化能力,解决现有基准在语言覆盖度、静态问题集和人类基线动态性方面的局限性。

CodeGolf Bench is a multilingual code generation benchmark dataset created by independent researcher Vedant Padwal, aiming to evaluate the capability of large language models (LLMs) to generate concise and efficient code across 60 programming languages. Built upon the code golf competition platform, this dataset contains 115 problems spanning six categories: art, computing, games, mathematics, sequences, and transformations. Each problem is equipped with standard test cases and real-time human solution baselines. The dataset's construction process retrieves problem statements, language support information and validation frameworks from the code.golf platform via automated APIs, ensuring dynamic data updates and low contamination risk. This benchmark is mainly used to assess the code optimization ability of LLMs in resource-constrained environments such as IoT devices, addressing the limitations of existing benchmarks in terms of language coverage, static problem sets and the dynamism of human baselines.

提供机构:
独立研究者
创建时间:
2026-05-28
搜集汇总
数据集介绍
CodeGolf Bench 数据集图片
构建方式
在代码高尔夫这一追求极致字符精简的编程竞赛背景下,CodeGolf Bench基准测试应运而生。其构建依托于code.golf平台的丰富生态,通过API接口系统性地获取了涵盖60种编程语言的115道编程题目。每一道题目均包含详尽的描述、示例输入输出以及用于验证的隐藏测试用例。构建过程自动化地抓取并结构化存储所有题目元数据,确保了基准测试能够与平台同步演进,便于后续的动态扩展与更新。
特点
该基准测试的核心特色在于其无与伦比的语言覆盖广度与动态性。它横跨60种编程语言,远超现有任何基准测试,填补了多语言代码生成评估的巨大空白。更独特的是,CodeGolf Bench引入了实时人类基线,通过对比持续更新的社区高手解决方案分布,以百分位数直观衡量模型在“字符数”这一严苛约束下的效率与创造力,提供了一个不断进化、反映真实人类竞技水平的能力标尺。
使用方法
使用CodeGolf Bench进行评估时,研究者需通过其提供的API或自建服务器环境,向模型输入特定的代码高尔夫题目及目标编程语言。模型需生成尽可能简短的代码,随后提交至code.golf平台执行验证。系统不仅判定代码的正确性,还会将其字符或字节数与平台上所有人类提交的解答进行比对,计算其在人类成绩分布中的百分位数,从而综合评估模型的正确性与极简编码能力。
背景与挑战
背景概述
CodeGolf Bench 是一个由独立研究者 Vedant Padwal 于2025年创建的多语言代码生成基准测试,旨在评估大型语言模型在60种编程语言中生成简洁代码的能力。该基准基于代码高尔夫(code golf)这一追求最少字符或字节解决方案的休闲编程竞赛范式,为评估LLM在严格约束下的代码优化能力提供了独特视角。与现有固定问题集和有限语言覆盖的基准不同,CodeGolf Bench 利用 code.golf 平台的动态生态系统,持续引入新问题并获取实时人类表现基线,从而突破传统静态评估的局限。其核心研究问题聚焦于:推理型模型与非推理型模型在生成既正确又极简的高效代码方面是否存在显著差异。实验表明,推理模型在C++和Python任务中均大幅领先,最佳平均百分位达70.97%,有力证明了逻辑推理在代码紧凑性生成中的关键作用。该基准对评估LLM在资源受限场景(如物联网)中的实用编程能力具有重要推动作用。
当前挑战
CodeGolf Bench 面临的挑战体现在多个层面。在领域问题层面,现有代码生成基准普遍存在语言覆盖有限、问题集静态且易饱和、缺乏动态人类基线等缺陷,难以真实反映LLM在跨语言代码优化中的性能差异,尤其忽略了代码简洁性这一关键维度。构建过程中,挑战包括:需从 code.golf 平台大规模采集并标准化115个问题与60种语言的元数据,确保测试案例隐蔽性和结果可比性;设计既能验证功能正确性又能衡量字符级精简的评估框架,引入百分位排名等新颖指标;克服API调用限制与计算资源瓶颈,完成多模型、多轮次的高吞吐量代码生成与验证。此外,部分小众语言可能缺乏充足的人类提交样本,导致基线不够准确,且在有限资源下仅对Python与C++进行了全面评估,60种语言的全覆盖仍待实现。
常用场景
经典使用场景
在代码生成与程序合成领域,CodeGolf Bench 作为一项横跨60种编程语言的创新基准,其经典使用场景在于评估大语言模型生成极简代码的能力。基于代码高尔夫(Code Golf)这一竞技编程范式,该基准以字符或字节最小化为核心优化目标,不仅要求模型输出功能正确的代码,更强调在极端简洁性约束下的创造性表达。研究者利用此基准,可系统考察模型在Python、C++等语言上的Pass@k与百分位排名等指标,尤其关注其对资源受限环境下高效编码的适应能力。通过将模型性能置于人类解法分布的动态背景下,CodeGolf Bench 为探究推理型与非推理型模型在简洁代码生成任务中的本质差异提供了独特且可泛化的实验平台。
解决学术问题
CodeGolf Bench 直面当前代码生成基准在语言覆盖广度与人类基线动态性方面的双重缺失。传统基准如HumanEval、MBPP等局限于少数主流语言,且问题集静态固化后易发生饱和与数据泄露;而CodeGolf Bench 通过整合code.golf平台的持续更新机制,支持60种语言的多样化挑战,并首次引入实时变化的人类成果分布作为比较基准。这一设计有效解决了评测污染与能力天花板问题,使得学术研究能够更客观地刻画模型在多语言环境下的效率优化表现。该基准揭示了推理能力对于处理C++等语法严格语言中精简代码任务的关键作用,为非推理模型的短板提供了明确定量的证据,推动了关于语言特征与模型推理机制之间关联的深入探讨。
衍生相关工作
CodeGolf Bench 的提出已催生了一系列衍生研究工作。在基准建构层面,后续工作可效仿其动态更新与实时人类基线策略,将类似框架扩展至算法效率评测领域,如融合时间与空间复杂度约束的全局优化基准。在模型分析方面,该基准关于推理与非推理模型性能分化的发现,激发了针对显式推理链增强零样本简洁代码生成的研究,并启发了对跨语言代码压缩泛化能力的系统探索。此外,基于该基准对错误分布的细致剖析(如NameError与ValueError的语言特异性表现),相关研究正着手开发更鲁棒的语法级代码修复策略与紧凑型预训练目标函数,从而构建更贴近实际高效编程需求的下一代代码智能体评估体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务