遇见数据集

ShahzebKhoso/local-code-arena-starcoder2_7b

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集托管了原始评估指标、执行遥测日志和结构语法输出,这些数据来自对下一代StarCoder2 7B基础模型运行Mostly Basic Python Problems (MBPP)基准测试的结果。具体来说,它记录了现代中端原始基础权重在自动化对话评估工作流程中的行为动态,定义了原始代码能力和聊天后调优之间的明确界限。数据集包括500个任务(测试分割)的评估结果,涵盖功能通过率、平均生成速度等核心性能指标,并提供了详细的架构和特征模式,如任务ID、提示、标准参考、测试断言、模型元数据、原始生成、解析代码和评估指标等字段。

This repository hosts the raw evaluation metrics, execution telemetry logs, and structural syntax outputs captured from running the Mostly Basic Python Problems (MBPP) benchmark against the next-generation StarCoder2 7B base foundational model. This specific partition documents the behavioral dynamics of modern, mid-tier raw foundational weights inside automated conversational evaluation workflows, defining the clear boundaries between raw code capacity and chat post-tuning. The dataset includes evaluation results for 500 tasks (test split), covering core performance metrics such as functional pass rate and average generation speed, and provides detailed architecture and feature schemas, including fields like task_id, prompt, canonical_reference, test_assertions, model_metadata, raw_generation, parsed_code, and evaluation_metrics.

提供机构:
ShahzebKhoso
搜集汇总
数据集介绍
ShahzebKhoso/local-code-arena-starcoder2_7b 数据集图片
构建方式
本数据集基于StarCoder2 7B基座模型在本地Ollama服务器上运行MBPP基准测试而构建。通过向模型输入500个测试任务,系统记录了原始生成输出、解析后的代码片段以及执行沙箱反馈信息。数据集中的每条记录均包含任务标识符、自然语言提示、标准参考代码、测试断言集合以及模型元数据等字段,并配套详尽的结构化评估指标,如功能通过率、CodeBLEU分数、生成速度及延迟时间,形成完整的评估闭环。
使用方法
用户可借助Hugging Face datasets库直接加载本数据集,例如通过`load_dataset("ShahzebKhoso/local-code-arena-mbpp-starcoder2-7b")`快速获取评估记录。每条记录中的`evaluation_metrics`结构可用于复现性能分析,包括功能通过判定、生成速度及CodeBLEU评分。研究者可基于这些遥测数据进行多维度对比实验,或将其作为基线评估指标,进一步研究对话对齐策略对代码生成任务的影响。
背景与挑战
背景概述
在大型语言模型(LLM)时代,代码生成能力已成为评估基础模型性能的关键维度之一。local-code-arena-starcoder2_7b数据集由研究人员Shahzeb Khoso创建,旨在系统评估StarCoder2 7B基础模型在Mostly Basic Python Problems(MBPP)基准上的原始代码生成行为。该数据集记录了从Ollama服务器运行评估的完整遥测日志,包括功能通过率、生成速度和结构语法输出。通过对500个测试任务的深入分析,研究者旨在揭示未经会话调优的现代基础模型在自动化代码评估中的性能边界。该工作对于理解架构预训练与对齐层之间的差异具有重要参考价值,为本地部署的LLM应用提供了关键性能基线。
当前挑战
该数据集的核心挑战在于解决原始基础模型在自然语言指令理解与代码生成任务之间的结构性矛盾。领域问题方面,StarCoder2 7B作为面向仓库补全任务优化的未对齐模型,在面对多步推理或函数级生成时,其功能通过率(Pass@1)仅达到1.0%,与经过指令调优的模型存在显著差距。构建过程中,评估需在有限硬件资源下实施严格的隔离沙箱环境,设置2.0秒硬超时限制以模拟真实低延迟场景,同时捕获原始生成文本与解析代码的完整链路,确保评估指标的精确性和可复现性。此外,跨模型性能对比要求统一硬件配置和标准化遥测字段,进一步增加了数据收集与处理的复杂度。
常用场景
经典使用场景
在代码生成与评估的学术探索中,local-code-arena-starcoder2_7b数据集被广泛用于衡量未对齐基础模型在编程任务上的原始能力。该数据集基于Mostly Basic Python Problems基准,记录了StarCoder2 7B模型在500项测试任务中的执行轨迹,包括功能通过率、生成速度、CodeBLEU结构评分及沙箱运行时反馈。研究者借助这些细粒度指标,可以精确评估模型在自然语言指令下提取并执行可运行代码片段的优劣,进而对比其与指令微调模型的差异。这一经典用法为理解纯预训练模型与对齐模型之间的性能鸿沟提供了扎实的量化基础。
解决学术问题
该数据集直击代码生成领域长期悬而未决的核心学术问题——基础模型为何在缺乏指令对齐层时性能严重退化。通过展示StarCoder2 7B仅1.0%的功能通过率与超过97 TPS的生成速度并存的现象,它清晰揭示了架构先进性与任务适应性之间的深刻矛盾。数据集提供的结构级一致性评分和运行时错误回溯,使研究人员能够系统追溯模型在解析、代码分段和终止机制上的薄弱环节。这一发现不仅量化了指令微调对代码生成能力的提升幅度,更推动了学界对预训练与对齐阶段优化策略的重新审视。
实际应用
在实际工程部署中,该数据集为本地化代码生成系统的性能基准测试提供了关键参考基准。开发者可借助其中记录的多维度指标,如延迟秒数、生成速度与功能通过率,对自有模型在消费级硬件(如RTX 4090笔记本GPU)上的表现进行横向比较。数据集特别适用于评估未调优基础模型在受限计算资源下的代码补全与生成效率,从而指导模型选择与部署决策。例如,在构建低延迟代码辅助工具时,工程师可依据数据集中17.5%的CodeBLEU得分与沙箱超时记录,权衡推理速度与代码质量之间的关系。
数据集最近研究
最新研究方向
当前研究聚焦于评估未经指令调优的基础代码生成模型的原始能力边界,特别是在自然语言驱动的对话式基准测试中的表现。通过对比StarCoder2 7B与Qwen2.5-Coder 7B等模型,揭示了基础模型虽在硬件效率上表现优异(如生成速度达97.22 TPS),但在功能准确率上存在显著差距(Pass@1仅1.0%),凸显了后训练对齐层对于提升模型在复杂指令下生成可靠代码的关键作用。该数据集为本地化部署场景下,权衡模型架构、效率与对齐策略提供了重要实证,推动了代码生成领域从原始能力评估向系统化对齐优化的研究转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务