遇见数据集

ShahzebKhoso/local-code-arena-starcoder_15b

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集托管了针对重量级StarCoder 15B基础基础模型运行Mostly Basic Python Problems (MBPP)基准测试所捕获的原始评估指标、执行遥测日志和结构语法输出。该特定分区记录了对话基准测试循环中未对齐基础权重的绝对扩展限制,为对齐溢价跟踪建立了大规模基线。数据集包含核心性能摘要(如功能通过率1.4%、平均生成速度54.35令牌/秒)、参数扩展与对齐矩阵对比、硬件配置详情(如Alienware m18笔记本、NVIDIA RTX 4090 GPU),以及详细的数据集架构和特征模式(例如task_id、prompt、canonical_reference、test_assertions、model_metadata、raw_generation、parsed_code、evaluation_metrics等字段)。评估指标细分包括functional_pass(布尔值,指示代码是否通过测试)、sandbox_feedback(运行时反馈字符串)、codebleu_overall(结构相似性分数)、generation_speed_tps(生成速度令牌/秒)和latency_seconds(延迟秒数)。数据集旨在支持本地评估分析,可通过Hugging Face datasets库加载,并遵循BigCode OpenRAIL-M v1许可证。

--- license: bigcode-openrail-m task_categories: - 文本生成 tags: - 代码 - 代码生成 - 评估 - 大语言模型评估 - 本地大语言模型 - 多数基础Python问题基准测试(Mostly Basic Python Problems,MBPP) - StarCoder - BigCode - 遥测 size_categories: - n < 1K --- # 本地代码竞技场遥测:基于StarCoder 15B(基础版)的MBPP基准测试 本仓库存储了针对重量级**StarCoder 15B**基础大语言模型运行**多数基础Python问题基准测试(Mostly Basic Python Problems,MBPP)**所捕获的原始评估指标、执行遥测日志以及结构化语法输出结果。 该特定数据集分区记录了非对齐基础权重在对话基准测试循环中的绝对缩放极限,为对齐溢价追踪建立了大型基准基线。 ## 📊 核心性能总结 - **评估目标:** `starcoder:15b`(通过Ollama服务器部署) - **单样本通过率(Pass@1):** **1.4%** ⚠️ - **平均生成速度:** **54.35 Token/秒** ⚡ - **评估窗口:** 500个任务(测试划分集) --- ## 📈 参数缩放与对齐矩阵 将该重量级基线与其现代参数匹配的指令微调版本并列对比,可凸显对话微调所带来的巨大性能差异: | 模型标签 | 参数规模 | 模型配置类型 | Pass@1准确率 | 本地吞吐量(Token/秒) | | :--- | :--- | :--- | :--- | :--- | | **`starcoder:15b`** | **155亿** | **传统原生基础模型** | **1.4%** 🎯 | **54.35 Token/秒** | | `qwen2.5-coder:14b` | 140亿 | 现代指令专用模型 | **48.6%** 🏆 | **48.70 Token/秒** | *核心技术洞察:* StarCoder 15B具备出色的处理吞吐量,在本地消费级硬件上可维持超过54 Token/秒的生成速度。然而,由于缺乏对话后训练对齐,其难以在结构化Markdown语法包装中隔离输出内容,或在零样本自然语言提示下优雅终止生成。与对齐模型相比,这导致了显著的功能性能下降,证明了后训练指令层对于将原始参数容量转化为可验证的执行成功至关重要。 --- ## 💻 基线硬件配置 所有遥测记录均在单一本地环境中编译得到: - **主机系统:** Alienware m18 高性能笔记本电脑 - **GPU加速卡:** NVIDIA GeForce RTX 4090 移动版GPU(16GB GDDR6显存 / 最大175W TGP) - **驱动 / CUDA栈:** NVIDIA Driver 581.95 | CUDA 13.0 - **隔离引擎:** 多线程Python代码执行沙箱(2.0秒硬壁钟超时限制) --- ## 📂 数据集架构与特征模式 数据集中的每一行均代表一个经过完整评估的结构化代码生成实例。下表列出了Parquet记录中可用的字段schema: | 列字段 | 数据类型 | 功能描述 | | :--- | :--- | :--- | | `task_id` | `int64` | MBPP数据集条目的原始源跟踪指针。 | | `prompt` | `string` | 传递给本地大语言模型实例的文本指令字符串。 | | `canonical_reference` | `string` | 基础数据集提供的标准Python参考解。 | | `test_assertions` | `list` | 包含显式运行时Python `assert`验证操作的字符串数组。 | | `model_metadata` | `struct` | 记录`model_id`与宿主硬件参数的JSON字典。 | | `raw_generation` | `string` | 直接从本地API流接收的未编辑原始返回字符串。 | | `parsed_code` | `string` | 剥离所有对话式Markdown文本包装后提取的代码块。 | | `evaluation_metrics` | `struct` | 跟踪结构化与执行遥测的深度指标集。 | ### 🛠️ 评估指标细分 在`evaluation_metrics`结构化子字段中,各字段对应精确的跟踪标准: * **`functional_pass`** (`bool`):若代码可正常编译并100%通过关联的测试断言字符串,则取值为`true`。 * **`sandbox_feedback`** (`string`):隔离运行时环境捕获的精确标准输出消息或回溯信息(例如`Execution Timeout`(执行超时)、`NameError`(名称错误)或`Success`(成功))。 * **`codebleu_overall`** (`float`):用于评分的聚合结构指标,对比抽象语法树匹配与数据流语法布局配置与参考目标的契合度。 * **`generation_speed_tps`** (`float`):在本地RTX 4090上捕获的精确Token每秒生成效率得分。 * **`latency_seconds`** (`float`):模型推理响应字符串的绝对往返执行延迟(单位:秒)。 --- ## 🚀 如何使用此数据集 您可通过Hugging Face `datasets`库将该遥测数据集流式传输至本地评估分析笔记本中: python from datasets import load_dataset # 将本地代码竞技场性能日志直接流式传输至您的DataFrame dataset = load_dataset("ShahzebKhoso/local-code-arena-mbpp-starcoder-15b") # 访问单个记录块 first_entry = dataset['train'][0] print(f"记录的矩阵吞吐量:{first_entry['evaluation_metrics']['generation_speed_tps']} Token/秒") ## 📄 许可与引用 本数据集基于BigCode OpenRAIL-M v1许可证分发。若您在对比研究工作中使用了这些原始遥测文件,请引用本Hub仓库。

提供机构:
ShahzebKhoso
搜集汇总
数据集介绍
ShahzebKhoso/local-code-arena-starcoder_15b 数据集图片
构建方式
该数据集基于StarCoder 15B基础模型在MBPP基准测试上的评估过程构建,记录了模型在本地计算环境中对500个Python编程问题的生成与执行结果。每个样本包含原始提示、标准参考解法、测试断言集合、模型元数据、未编辑的生成内容、解析后的代码块以及深层评估指标。评估过程中,模型通过Ollama服务器部署于配备NVIDIA RTX 4090笔记本电脑GPU的系统上,代码执行由多线程Python沙箱以2.0秒硬超时限制进行隔离运行,确保结果的可复现性与稳定性。
使用方法
用户可通过Hugging Face的`datasets`库便捷地加载该数据集,直接将其流式读取至分析工作流中。例如,使用`load_dataset("ShahzebKhoso/local-code-arena-mbpp-starcoder-15b")`即可获取完整记录,进而访问每个样本的评估指标字段,如生成速度、延迟或功能通过状态。数据集适用于比较不同参数规模与对齐策略下模型性能的对比研究,支持对代码生成模型的原始能力与微调效果进行量化分析,为本地部署大语言模型的评估与优化提供扎实数据支撑。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的当下,代码生成任务成为评估模型编程能力的重要试金石。由ShahzebKhoso等人创建的local-code-arena-starcoder_15b数据集,发布于2024年末,聚焦StarCoder 15B基础模型在MBPP基准上的表现,旨在量化未对齐预训练权重在零样本代码生成中的极限。该数据集记录了模型在消费级硬件上的执行遥测数据,包括功能通过率、生成速度等,为后续对齐研究提供了基线参考。其影响力在于揭示了缺乏指令微调的巨大性能鸿沟,推动了参数规模与对齐技术协同优化的研究。
当前挑战
该数据集核心挑战在于化解两大领域难题。首先,代码生成任务中模型需精准理解自然语言描述并产出可执行代码,而StarCoder 15B因未对齐指令,在结构化输出和终止生成上表现脆弱,功能通过率仅1.4%,暴露了基础模型在零样本推理中无法满足预期。其次,构建过程中需在RTX 4090等受限硬件上稳定采集500个任务的生成与执行日志,平衡推理速度与沙箱超时限制(2秒),并精确解析原始输出中的代码片段,这对遥测架构的鲁棒性提出了严苛要求。
常用场景
经典使用场景
在代码生成与大型语言模型评估的研究领域中,local-code-arena-starcoder_15b数据集为衡量基础模型在编程任务上的原始性能提供了宝贵基准。该数据集基于MBPP基准测试,系统记录了StarCoder 15B模型在零样本自然语言提示下生成Python代码的完整执行遥测数据,包括功能通过率、生成速度及语法结构评分等核心指标。研究团队可借助此数据集深入剖析未经过对话对齐的基础模型在代码生成任务中的局限性,尤其关注其面对结构化输出要求时的功能坍缩现象。每条数据记录均包含原始生成文本、解析后代码块及沙盒执行反馈,为模型行为分析提供了多维度视角,适用于对比不同规模与校准策略的代码生成模型表现。
解决学术问题
该数据集精准解决了学术研究中关于基础模型与指令微调模型性能差异的量化难题。通过展示StarCoder 15B在MBPP上仅1.4%的功能通过率,揭示了即便拥有庞大参数量,缺乏对话后训练对齐的模型也难以将参数容量转化为可靠的代码执行能力。这一发现有力论证了指令微调层在提升模型实用性中的关键作用,为理解模型对齐溢价提供了实证基础。数据集还通过参数缩放矩阵直观对比了基础模型与现代指令专家模型的性能鸿沟,推动了关于模型训练范式与推理效率之间权衡的研究。其系统记录的遥测数据为评估模型在不同硬件环境下的实际表现提供了可靠参考,助力优化学术评估方法论。
实际应用
在实际应用中,本数据集为代码生成模型的部署与优化提供了重要指导。开发者可利用其详尽的执行遥测日志评估模型在本地消费级硬件上的运行效率,例如StarCoder 15B在RTX 4090上每秒54.35个令牌的生成速度,为资源受限场景下的模型选型提供依据。数据集中包含的沙盒反馈信息(如执行超时、名称错误等)可协助工程团队诊断模型输出的常见故障模式,从而改进提示工程策略或设计更鲁棒的后处理流水线。此外,跨模型性能对比数据为企业决策者提供客观标准,帮助其在追求代码生成质量与降低计算成本之间找到平衡点,推动代码智能助手等产品的实际落地。
数据集最近研究
最新研究方向
当前,以StarCoder 15B为代表的大型代码基座模型在本地部署与零样本编程场景中正面临严峻的功能对齐挑战。本数据集精确记录了该基座模型在MBPP基准测试中仅获1.4%的Pass@1准确率,凸显了缺乏指令微调与对话对齐时,庞大参数容量难以直接转化为可验证代码执行能力的结构性瓶颈。与参数规模相近的现代化指导模型(如Qwen2.5-Coder 14B的48.6%准确率)形成鲜明对比,该数据集为量化对齐增强带来的性能溢价提供了关键基线。前沿研究正聚焦于如何通过轻量级后训练策略或混合推理范式,在不显著牺牲生成吞吐量(本模型达54.35 TPS)的前提下,提升代码生成的功能正确性与结构化输出能力,从而推动代码大模型在实际开发环境中的实用化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务