遇见数据集

ShahzebKhoso/local-code-arena-starcoder2_15b

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“Local Code Arena Telemetry: MBPP Benchmark on StarCoder2 15B (Base)”,存储了在旗舰StarCoder2 15B基础模型上运行“Mostly Basic Python Problems (MBPP)”基准测试所捕获的原始评估指标、执行遥测日志和结构语法输出。其核心目标是记录在对话评估循环中扩展原始未对齐基础权重的最终限制,为跨代对齐溢价分析建立一个绝对基线。数据集包含500个任务(测试分割),每个任务代表一个完全评估的结构化代码生成实例,特征架构包括任务ID、提示文本、标准参考解决方案、测试断言、模型元数据、原始生成输出、解析后的代码以及评估指标(如功能通过率、沙箱反馈、CodeBLEU分数、生成速度和延迟)。该数据集可用于比较研究,分析基础模型与指令调优模型在代码生成性能上的差异,并支持通过Hugging Face datasets库进行本地评估分析。

This dataset, titled Local Code Arena Telemetry: MBPP Benchmark on StarCoder2 15B (Base), hosts the raw evaluation metrics, execution telemetry logs, and structural syntax outputs captured from running the Mostly Basic Python Problems (MBPP) benchmark against the flagship StarCoder2 15B base foundational model. It aims to document the final limits of scaling raw, unaligned foundational weights inside conversational evaluation loops, establishing an absolute baseline for cross-generational alignment premium analysis. The dataset covers 500 tasks (test split), with each row representing a fully evaluated, structured code generation instance. The feature schema includes fields such as task_id, prompt, canonical_reference, test_assertions, model_metadata, raw_generation, parsed_code, and evaluation_metrics (e.g., functional_pass, sandbox_feedback, codebleu_overall, generation_speed_tps, latency_seconds). It is designed for comparative research to analyze performance differences between base and instruction-tuned models in code generation, and can be streamed into local evaluation notebooks using the Hugging Face datasets library.

提供机构:
ShahzebKhoso
搜集汇总
数据集介绍
构建方式
本数据集基于StarCoder2 15B基础模型,在本地消费级硬件环境(Alienware m18笔记本,配备NVIDIA GeForce RTX 4090 Laptop GPU)上,通过Ollama服务器运行MBPP基准测试的500个任务构建而成。每条记录包含任务标识符、提示文本、标准参考代码、测试断言、模型元数据、原始生成输出、解析后的代码片段以及深度评估指标,其中评估指标涵盖功能通过率、沙箱反馈、CodeBLEU结构相似度分数、生成速度(令牌/秒)和端到端延迟等维度,并以Parquet格式存储。
特点
该数据集的核心价值在于量化了未经过对话对齐的原始基础模型在零样本功能任务上的性能极限,StarCoder2 15B的Pass@1准确率仅为1.4%,但其本地推理吞吐量高达50.67令牌/秒,展现出优异的计算效率。与参数规模相近的指令调优模型Qwen2.5-Coder 14B(48.6%准确率)的对比,凸显了对话对齐层在代码生成任务中的不可或缺性,验证了先进预训练架构无法替代显式对齐的必要性。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集:使用`load_dataset("ShahzebKhoso/local-code-arena-mbpp-starcoder2-15b")`命令流式获取评测日志。每条记录均包含完整的执行遥测数据,便于深入分析模型在本地环境中的代码生成行为、执行沙箱反馈及结构化语法配置。该数据集适用于跨代际模型对齐增益分析、基础模型与指令模型性能对比研究,以及本地推理效率基准测试等工作流。
背景与挑战
背景概述
大规模代码生成模型的飞速发展,使得评估其在特定任务上的真实能力成为研究焦点。本地代码竞技场(Local Code Arena)数据集应运而生,由研究者Shahzeb Khoso创建,旨在系统性地评估StarCoder2 15B基础模型在MBPP(Mostly Basic Python Problems)基准上的表现。该数据集记录了原始、未对齐的基础模型在对话式评估中的极限性能,为后续的对齐优化提供了明确的基线。其核心研究问题在于揭示未经指令微调的代码补全模型在零样本功能任务上的真实局限,并量化跨代对齐所带来的性能增益。作为BigCode项目的重要补充,该数据集通过高透明度的遥测日志,为代码生成领域的评估标准设立了新的参照点。
当前挑战
该数据集所解决的领域挑战在于,广泛采用的基础模型(如StarCoder2 15B)虽在代码补全上表现优异,却因缺乏对话对齐层而难以解析零样本指令,导致在功能正确性上表现极低(Pass@1仅1.4%),凸显了预训练架构无法替代对齐的必要性。构建过程中,数据集面临着在消费级硬件(RTX 4090笔记本电脑)上稳定运行500个测试任务并捕获精确执行遥测的工程挑战,包括2秒硬超时控制、沙箱隔离以确保安全执行,以及从原始生成中准确解析出干净代码块以进行功能评估的复杂后处理流程。
常用场景
经典使用场景
在代码生成模型的评估领域,local-code-arena-starcoder2_15b数据集扮演着基准测试与性能审计的核心角色。它专门记录了StarCoder2 15B基础模型在Mostly Basic Python Problems(MBPP)基准上的原始评测指标与执行遥测日志,涵盖了功能通过率、生成速度、代码结构相似度等关键量化参数。该数据集尤其适合用于对比不同配置模型——如原始基础模型与指令微调模型——在零样本函数生成任务上的表现差异,为研究者提供了从原始生成文本到解析代码、再到沙盒执行反馈的全链路结构化信息,是衡量代码大语言模型在本地硬件环境下实际编码能力的标准化参照系。
解决学术问题
该数据集精准回应了当前代码智能领域一个核心争议:先进的架构预训练是否能够弥补对深层对话对齐层的缺失。通过记录StarCoder2 15B在未经过任何指令微调时仅1.4%的功能通过率,并以量化方式呈现其与参数相近的指令微调模型(如Qwen2.5-Coder 14B,48.6%通过率)之间高达数十倍的性能鸿沟,数据集确凿证明了即便拥有最前沿的基础架构和超50 TPS的高速生成能力,缺少显式的对话对齐层仍会导致零样本任务严重失效。这一发现对理解基础模型与对齐模型之间的‘对齐溢价’具有深远的理论意义,并为后续跨代模型的性能对比提供了不可动摇的实证依据。
衍生相关工作
该数据集催生了一系列关于基础模型与对齐模型性能边界的重要对比研究。其明确的性能矩阵——功能通过率、CodeBLEU结构与生成速率的联合记录——为后续工作提供了标准化的评估范式。相关衍生的学术探索包括:基于该数据集提出的‘对齐溢价’概念,促使研究者系统性分析在不同的参数量级和架构下指令微调带来的收益衰减曲线;利用数据集中精细的沙盒错误反馈,衍生出针对基础模型零样本失败模式(如格式混乱而非逻辑错误)的分类与修正策略;此外,该数据集中的本地化硬件遥测数据也直接支撑了关于如何在边缘设备上平衡模型规模与推理速度的实证分析,推动了面向消费者硬件的轻量级对齐技术发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务