遇见数据集

ShahzebKhoso/local-code-arena-mbpp-starcoder_7b

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该存储库托管了针对旧版 **StarCoder 7B** 基础基础模型运行 **Mostly Basic Python Problems (MBPP)** 基准测试时捕获的原始评估指标、执行遥测日志和结构语法输出。

This repository hosts the raw evaluation metrics, execution telemetry logs, and structural syntax outputs captured from running the **Mostly Basic Python Problems (MBPP)** benchmark against the legacy **StarCoder 7B** base foundational model.

提供机构:
ShahzebKhoso
搜集汇总
数据集介绍
ShahzebKhoso/local-code-arena-mbpp-starcoder_7b 数据集图片
构建方式
本数据集聚焦于对StarCoder 7B基础模型在MBPP基准测试上的表现进行系统性评估。通过Ollama服务器在本地硬件环境(Alienware m18笔记本,配备NVIDIA GeForce RTX 4090 16GB GPU)上执行500个测试任务的代码生成,并采用2.0秒硬超时限制的多线程Python执行沙箱进行隔离验证。每条记录详细捕获了任务ID、原始prompt、标准参考解、测试断言集合、模型元数据、未编辑的原始生成文本、去除了对话标记的解析代码以及深度评估指标。最终以Parquet格式存储,包含功能通过率、沙箱反馈、CodeBLEU结构评分、生成速度及延迟等字段。
特点
该数据集的核心特点在于揭示了未经指令微调的基础模型与经过对话对齐的指令模型之间的显著性能鸿沟。StarCoder 7B虽然展现了极高的生成效率(约98.74 Tokens/秒),但其功能Pass@1准确率仅为1.0%,远低于参数规模相近的Qwen2.5-Coder 7B指令模型(51.0%)。这表明基础模型在缺乏对话后训练对齐的情况下,难以处理结构化markdown语法要求或在零样本提示框架下优雅终止生成,从而产生功能性崩溃。数据集详细记录了每次生成的执行轨迹、结构语法匹配度以及沙箱环境中的具体错误类型,为分析指令对齐缺口提供了珍贵的锚点。
使用方法
研究者可通过Hugging Face的datasets库直接加载该数据集进行下游分析:from datasets import load_dataset; dataset = load_dataset('ShahzebKhoso/local-code-arena-mbpp-starcoder-7b')。每条记录可通过索引访问,例如获取首条记录的生成速度:dataset['train'][0]['evaluation_metrics']['generation_speed_tps']。该数据适用于对比不同模型架构的代码生成能力、分析基础模型与指令模型的行为差异、评估后训练对齐策略的收益,以及研究本地硬件环境下模型推理效率与生成质量的权衡关系。数据集采用BigCode OpenRAIL-M v1许可证发布。
背景与挑战
背景概述
随着大型语言模型在代码生成领域的广泛应用,如何系统性地评估基础模型在结构化编程任务中的表现成为关键议题。该数据集由研究者在2024年前后创建,聚焦于StarCoder 7B基础模型在Mostly Basic Python Problems(MBPP)基准上的执行性能,旨在揭示未经指令对齐的原始权重模型在自动化代码评估流程中的行为特征。作为BigCode项目的一部分,该数据集为理解参数规模与微调范式之间的性能鸿沟提供了锚点,其记录的低至1.0%的Pass@1准确率与高效推理速度形成鲜明对比,深刻影响了后续对代码模型后训练策略的研究。
当前挑战
该数据集所解决的领域核心挑战在于,基础模型虽具备代码生成能力,却因缺乏对话式后训练对齐而难以在零样本条件下生成符合结构要求的代码,导致功能性输出崩溃。构建过程中面临多重技术难题:包括设计250个包含严格断言测试的评估任务,确保测试环境在2.0秒硬超时限制下隔离执行并捕获沙箱反馈,以及从原始API流中无歧义地解析出代码片段。此外,需同步记录生成速度、延迟和CodeBLEU结构评分等多维指标,以支撑后续与指令微调模型的精细化对比分析。
常用场景
经典使用场景
在代码生成模型的评估体系构建中,该数据集作为承载StarCoder 7B基础模型在MBPP基准上全量评估结果的性能归档,为研究未经指令微调的大规模原始模型在零样本编程任务中的行为特征提供了标准化锚点。其核心使用价值在于记录模型生成的原始代码片段、解析后的可执行代码块以及结构化的执行反馈信息,使研究者能够精确剖析基础模型在函数级编程任务上的功能通过率、生成速度与语法结构一致性之间的深层关联。通过对比同一参数量级下的微调模型表现,该数据集成为量化对齐训练效果、诊断原始模型输出模式缺陷的关键分析工具。
解决学术问题
该数据集系统性地揭示了大规模代码生成模型在缺乏对话式后训练对齐时面临的三大核心学术问题:其一,原始基础模型即使在拥有接近100 TPS的高效推理速度下,因缺乏结构化指令理解能力,在零样本场景中无法准确解析任务格式,导致功能通过率骤降至1.0%,这挑战了传统认为模型规模直接决定性能的假设;其二,数据集通过精细的错误类型编码与沙箱执行日志,精准定位了语法输出与非功能性终止模式等失败根源,为研究对齐训练的技术边界提供了实证基础;其三,确立了对齐训练效率的量化评估框架,推动领域内对计算资源分配策略的重新审视。
衍生相关工作
围绕该数据集记录的StarCoder 7B原始模型与Qwen2.5-Coder等现代指令模型的性能鸿沟,研究社区已衍生出多项标志性工作:基于LoRA的参数高效微调方法被广泛用于验证少量训练数据即可显著弥合这一对齐差距,部分工作进一步探索了量化感知训练与结构化剪枝技术在保持生成质量前提下缩减模型规模的可能性。同时,数据集中细粒度失败模式分析启发了对抗性提示生成与鲁棒性增强方法的设计,推动了多阶段代码生成管道(如生成-验证-修正循环)的发展。这些衍生工作共同证实了原始基础模型代码能力的巨大潜力,以及后训练对齐在释放这种潜能中的核心催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务