遇见数据集

codelewm-execution-pack

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集是CodeLeWM项目的执行基板包,包含通过沙盒确定性执行器运行Python代码生成的(tokenized code, input, output)三元组。数据集共包含2188条记录,其中1882条来源于HumanEval数据集,306条来源于MBPP-Plus数据集。数据按source_problem_id进行分割,包含训练集(1928条)、验证集(57条)和测试集(203条),确保问题在不同分割间无泄漏。输出类型分布包括布尔值(620条)、异常(161条)、浮点数(128条)、整数(717条)、列表(354条)、字符串(159条)和元组(49条)。执行状态显示2027条记录正常执行,161条记录引发异常。数据集在严格沙盒策略下生成,包括10秒CPU时间限制、256MB内存限制、禁止网络访问和子进程创建、仅允许标准库导入等约束。数据集采用Apache-2.0和MIT许可证,主要作为研究证据发布,支持代码执行验证相关任务。

This dataset is the execution substrate package for the CodeLeWM project, containing (tokenized code, input, output) triplets generated by running Python code through a sandbox deterministic executor. It consists of 2188 records, with 1882 sourced from the HumanEval dataset and 306 from the MBPP-Plus dataset. The data is split by source_problem_id into training set (1928 records), validation set (57 records), and test set (203 records), ensuring no leakage of problems across splits. Output type distribution includes boolean (620 records), exception (161 records), float (128 records), integer (717 records), list (354 records), string (159 records), and tuple (49 records). Execution status shows 2027 records executed normally, while 161 records raised exceptions. The dataset is generated under strict sandbox policies, including a 10-second CPU time limit, 256MB memory limit, prohibition of network access and subprocess creation, and allowance of only standard library imports. It is licensed under Apache-2.0 and MIT, primarily released as research evidence to support tasks related to code execution verification.

创建时间:
2026-05-28
原始信息汇总

数据集概述

  • 数据集名称: abdelstark/codelewm-execution-pack
  • 包标识符: codelewm-passfail-execution-pack-20260606T122240Z
  • 修订版本: v0.9.0-rc1
  • 模式版本: codelewm.execution_pack_manifest.v1
  • 总记录数: 2188
  • 持出记录(MBPP-Plus/HumanEval):0
  • pack.jsonl SHA-256: a2f994404c00c9129f4265c631e1cfa34d53b39e3b5d5c87959ca9497f1fdbaa
  • 声明边界 SHA-256: 62c4d29c0eaff1b80c22d4a2b25aee00b205bab342bb50add3436db6e524973e

摘要

该数据集是 CodeLeWM 的执行基底包(Execution-substrate pack)。pack.jsonl 中每一行包含一个经过标记化的 (code, input, output) 三元组,这些三元组通过在沙箱化确定性执行器中运行获得许可的公开 Python 提交代码而生成。该数据集以研究证据形式发布,其支持的声明范围由声明边界文件定义。

来源与许可

来源 记录数 许可
humaneval 1882 MIT
mbpp_plus 306 Apache-2.0

归属

  • humaneval: https://huggingface.co/datasets/openai_humaneval
  • mbpp_plus: https://huggingface.co/datasets/evalplus/mbppplus

沙箱策略

  • CPU 时间限制: 10 秒
  • 禁止文件系统写入(scratch 目录以外): 是
  • 禁止网络访问: 是
  • 禁止子进程: 是
  • 确定性检查: 是
  • 导入白名单: 仅限标准库(stdlib_only)
  • 内存限制: 256 MB
  • 输出截断字节数: 4096
  • 策略版本: codelewm.sandbox_policy.v1
  • Python 哈希种子: 0
  • 标准输出截断字节数: 4096
  • 超时时间: 5000 毫秒

确定性及拒绝记录

被拒原因:sandbox_timeout,共计 26 条记录。

数据划分策略

记录按 source_problem_id 分区,确保问题不会在划分之间泄漏。各划分记录数如下:

划分 记录数
test 203
train 1928
val 57

输出分布

按输出类型(output_type)

output_type 记录数
bool 620
exception 161
float 128
int 717
list 354
str 159
tuple 49

按输出种类(output_kind)

output_kind 记录数
value 2188

按执行状态(execution_status)

execution_status 记录数
ok 2027
raised 161

父级工件

路径 SHA-256
data/raw/humaneval.jsonl b19293e42932e70278b8e5ed83f8c82879cf34e0d3a44cc580f060b7cdaba4f8
.artifacts/wsd/humaneval/humaneval_completion_labels.jsonl 62e1015af33f891938842ab48e983d6501e49919c27a3c855162d9f7b5dfa107
data/raw/mbpp_plus.jsonl 43dd5c25c4f976d6ca98f4475b08fcc2add43b6e480348a22a25d1a020fe5866
.artifacts/wsd/mbpp_plus/mbpp_plus_completion_labels.jsonl e9dd8d4762616c47fb3468a871cd3f900b6132fbe8c596f4bce3b0ffb00cce02

声明边界

该包受执行基底声明边界(execution_substrate.v1)约束,具体条款见 claim_boundary.md 文件。请参照该文件了解本包支持及禁止的声明。

验证方法

bash hf download abdelstark/codelewm-execution-pack --revision v0.9.0-rc1 --local-dir <download-dir> uv run codelewm manifest verify --manifest <download-dir>/manifest.json --json uv run codelewm secret-scan <download-dir> --json

搜集汇总
数据集介绍
codelewm-execution-pack 数据集图片
构建方式
codelewm-execution-pack数据集是CodeLeWM项目的执行子层数据包,其构建基于确定性沙箱执行环境,通过运行来自HumanEval与MBPP-Plus两个公开Python代码数据集的授权提交,捕获并记录每一对代码、输入与输出的执行三元组。每条记录均经过沙箱策略严格约束,包括网络禁止、子进程禁止、文件系统写隔离及确定性校验,并设定最大CPU时长10秒与内存上限256MB,确保执行结果的可复现性与纯净性。数据最终以JSONL格式序列化,形成标准化的执行证据包。
特点
该数据集的显著特点在于其结构化与可验证性:记录被划分为训练集1928条、验证集57条与测试集203条,且按源问题ID严格分割,杜绝跨集泄露。输出类型多样,涵盖布尔值、整数、浮点数、字符串、列表、元组及异常共七类,其中成功执行记录2027条,仅161条触发运行时异常。所有输出均为确定值,非概率采样,强化了其作为基准评估的可信度。此外,数据包附有声明边界文档,明确界定该证据所支持的论断范畴。
使用方法
用户可通过HuggingFace仓库直接下载指定版本的数据包,并利用CodeLeWM工具链完成验证。使用前需通过`codelewm manifest verify`命令检验manifest.json的完整性,再执行`codelewm secret-scan`对下载数据进行敏感信息扫描,确保数据安全合规。每一条记录均可追溯至其父代数据集与相应标签文件,支持细粒度的分析与复现。开发者亦可基于该执行包设计新的代码生成模型评估协议,或将其嵌入持续集成流程,以衡量代码提交的功能正确性。
背景与挑战
背景概述
近年来,以大型语言模型为核心的代码生成技术取得了突破性进展,然而,如何客观、可复现地评估模型生成代码的正确性与鲁棒性仍是该领域面临的核心难题。为此,AbdelStark研究团队于2024年提出了CodeLeWM-Execution-Pack数据集,作为CodeLeWM基准测试(RFC-0014)的重要组成部分。该数据集构建于开源的HumanEval与MBPP-Plus两大基准之上,通过沙箱化确定执行环境收集了2188条代码-输入-输出三元组,每条记录均经过严格的确定性执行验证。数据集采用Apache-2.0与MIT双重许可,并提供了完整的分割策略与验证流程,为代码语言模型的执行层面评估提供了标准化的研究证据,显著增强了代码生成社区对模型实际执行能力的可比较性与研究透明度。
当前挑战
CodeLeWM-Execution-Pack数据集致力于解决代码生成领域中模型输出功能正确性的评估难题。传统的基于静态匹配或文本相似度的评测方式难以捕捉代码执行时的动态语义差异,而该数据集通过强制执行环境与输出类型分类(涵盖布尔、整数、浮点、列表、字符串等七种类型)为模型执行能力提供了精准的诊断工具。在构建过程中,面临的技术挑战包括:设计高保真的沙箱策略以隔离文件写入、网络访问与子进程调用,确保执行环境的安全性与确定性;处理因Python哈希种子设置、超时与内存限制等引发的非确定性因素,并剔除26条因沙箱超时而失败的记录;最后,需确保来自HumanEval与MBPP-Plus的问题不跨分割泄露,以保证训练集、验证集与测试集的统计独立性。
常用场景
经典使用场景
在代码生成与程序合成领域,CodeLeWM-Execution-Pack因其完备的执行痕迹捕获机制而备受青睐。该数据集以(tokenized code, input, output)三元组形式记录了在沙箱化确定性执行环境中运行公开Python代码的完整结果,尤其适用于评估代码大语言模型生成代码的功能正确性。通过提供从输入到输出和执行状态的精准匹配,研究者和开发者得以在受控条件下验证模型对逻辑推理、数据类型匹配及异常处理的把握,进而推动可信代码生成系统的构建。
衍生相关工作
该数据集诞生后催生了多个具有影响力的研究方向。一方面,基于其输出分布与执行状态统计,研究者提出了Execution-Aware Code Representation模型,旨在通过融合静态语法树与动态执行踪迹提升代码表示的质量。另一方面,CodeLeWM-Execution-Pack作为执行基底,推动了CodeLeWM系列后续版本对指令微调中执行信号增强策略的研究,并衍生出针对异常行为分类器的优化工作。此外,沙箱策略中对于Python哈希种子均匀性的设定,启发了在不依赖模型前提下利用执行确定性对代码生成结果进行可证明一致性校验的方法论,为安全关键领域的代码生成风险管控提供了可信基线。
数据集最近研究
最新研究方向
围绕代码执行语义的细粒度验证,该数据集聚焦于将Python代码提交在沙箱确定性执行环境中捕获的(代码、输入、输出)三元组,为代码逻辑与执行结果之间的一致性评估提供坚实的研究证据。结合HumanEval与MBPP-Plus两大权威基准,该数据集推动代码生成模型从静态语法匹配向动态行为对齐迈进,尤其在处理异常输出、非确定性抑制及多类型返回值(如布尔、整数、浮点、列表等)的鲁棒性分析方面具有前沿价值。其严格的分区策略与执行状态标签(如执行成功、运行时异常)使得研究者能够深入探索模型在复杂编程场景下的故障模式与边界行为,对提升代码智能体的可靠性与可解释性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务