遇见数据集

mopsa-dataset-debug-v10

收藏
Hugging Face2026-05-24 更新2026-05-25 收录
官方服务:

资源简介:

该数据集包含8,925个训练样本,专门用于代码分析与程序理解相关任务。数据集提供多个结构化字段:样本标识符(id)、来源数据集(dataset)、代码片段(code)及其原始版本(original_code)、程序输出(output)、输入参数赋值列表(input_assignments,包含变量名、类型和值)、输出类型(output_type)。核心特征为执行轨迹(trace),其中包含代码执行状态、错误检查结果(通过状态和类型)、执行过程、交错执行信息等。此外还提供自然语言描述的执行轨迹(trace_natural)、自然语言执行过程(trace_natural_execution)、原始错误信息(errors_raw)以及错误标识(has_error)。数据格式支持对代码行为、执行路径和错误模式的深入分析。

This dataset contains 8,925 training samples specifically designed for code analysis and program understanding tasks. It includes multiple structured fields: sample identifier (id), source dataset (dataset), code snippet (code) and its original version (original_code), program output (output), input assignment list (input_assignments, containing variable names, types, and values), and output type (output_type). The core feature is the execution trace (trace), which includes code execution status, error checking results (pass status and type), execution process, interleaved execution information, etc. Additionally, it provides natural language descriptions of the execution trace (trace_natural), natural language execution process (trace_natural_execution), raw error information (errors_raw), and error flag (has_error). The data format supports in-depth analysis of code behavior, execution paths, and error patterns.

创建时间:
2026-05-23
原始信息汇总

数据集概述

数据集名称: mopsa-dataset-debug-v10

数据集地址: https://huggingface.co/datasets/giovannidemuri/mopsa-dataset-debug-v10

数据集规模:

  • 总下载大小:16,774,519 字节(约16 MB)
  • 数据集总大小:124,883,426 字节(约119 MB)
  • 包含 1 个训练集(split: train)
    • 样本数量:8,925 条
    • 该分片大小:124,883,426 字节

数据特征

数据集包含以下字段:

字段名 数据类型 说明
id string 样本唯一标识符
dataset string 所属数据集名称
code string 代码内容
original_code string 原始代码
output string 输出结果
input_assignments list of objects 输入赋值列表,每个对象包含 type(类型)、value(值)、var(变量名)
output_type string 输出类型
trace list of objects 执行追踪信息,每个对象包含 code(代码)、error_checks(错误检查列表,含 pass 和 type 字段)、execution(执行内容)、interleaved(交错内容)、interleaved_execution(交错执行内容)、static(静态内容)
trace_natural string 自然语言形式的追踪
trace_natural_execution string 自然语言形式的执行追踪
errors_raw string 原始错误信息
has_error bool 是否存在错误

配置信息

  • 配置名称:default
  • 数据文件路径:data/train-*(匹配所有以 train- 开头的文件)
搜集汇总
数据集介绍
mopsa-dataset-debug-v10 数据集图片
构建方式
该数据集名为mopsa-dataset-debug-v10,专注于程序调试领域,旨在为代码错误分析与修复提供结构化训练数据。其构建基于对原始代码片段进行系统性错误注入与追踪,每条样本包含唯一标识符、数据集来源、原始代码与待调试代码,以及程序执行后的输出结果。特别地,数据集中引入了输入赋值信息与执行轨迹,轨迹中详细记录了每步执行的代码、错误检查结果(包括是否通过及错误类型)、动态执行与静态分析内容,并辅以自然语言描述的轨迹解释。通过整合原始错误信息及是否存在错误的布尔标记,该数据集形成了一套完整的、多层次的代码调试知识体系。
使用方法
该数据集适用于多种代码智能任务,包括自动程序修复、运行时错误分类与解释生成。用户可基于`code`与`original_code`字段的差异训练模型生成修正补丁,或利用`has_error`标签构建二分类模型以检测代码是否存在错误。更进一步,通过解析`trace`中的`error_checks`与`execution`信息,可开发面向错误定位与分析的解释性模型,而`trace_natural`字段则支持自然语言调试描述生成。数据以Parquet格式分片存储在`data/train-*`路径下,仅提供训练集,适合直接加载至HuggingFace Datasets库进行模型微调与评估。
背景与挑战
背景概述
在程序合成与代码生成领域,如何确保生成代码的正确性与可执行性始终是一个核心难题。现有数据集多聚焦于静态代码结构或简单输入输出对,缺乏对程序动态执行行为(如状态追踪、错误校验)的细粒度标注。MOPSA数据集(调试版本v10)由相关研究机构于近期创建,旨在通过引入丰富的执行轨迹(trace)与错误检查(error_checks)信息,为程序合成模型提供从代码到动态行为的完整映射。该数据集包含约8900个训练样本,每个样本囊括源代码、程序输出、输入变量赋值及多维度执行轨迹,尤其关注程序执行中的错误检测与修复。其发布为理解神经模型在动态执行环境下的泛化能力开辟了新的评估路径,对程序修复、程序综合及可解释代码生成研究具有重要推动作用。
当前挑战
当前数据集面临的核心挑战来自两个方面。在领域问题层面,代码生成模型往往依赖静态语法或常见模式,难以捕捉程序执行中的动态语义与异常状态,例如变量类型错误、运行时崩溃等;MOPSA数据集尝试通过精细的trace与error_checks标注为模型提供错误定位能力,但如何从稀疏的错误信号中学习鲁棒的修复策略仍是一个开放难题。在构建过程中,数据集的创建需协调多维度标注(如静态代码、执行结果、自然语言描述执行过程),确保不同来源的标注一致性极富挑战,尤其调试版本(v10)可能包含未完全清洗的噪声标注,影响模型对程序行为与错误模式的准确学习。
常用场景
经典使用场景
在程序合成与代码修复的学术探索中,mopsa-dataset-debug-v10数据集以其丰富的程序执行轨迹和错误标注,成为研究者剖析程序行为的重要资源。该数据集包含了近九千条训练样本,每条样本详尽记录了从源代码、原始代码到执行输出、输入分配以及细粒度的执行跟踪信息,尤其涵盖静态分析、动态执行与错误检查的多元视图。其最经典的使用场景在于训练和评估基于深度学习的程序调试模型,通过对代码与错误轨迹的联合学习,实现自动化的缺陷定位与修复方案生成。
解决学术问题
该数据集精准回应了软件工程领域中智能调试与程序修复的核心挑战——如何从复杂多变的代码执行过程中自动捕捉错误模式。传统调试依赖手工规则或静态分析,难以应对现代软件的高动态性与多样性。mopsa-dataset-debug-v10通过提供经严谨标注的执行轨迹与错误标记,使得研究者能够训练模型学习代码结构与运行时行为的映射关系,从而推动无监督或弱监督下的程序异常检测与解释性修复方法的发展。这种数据驱动的范式显著提升了自动调试技术在真实代码库中的泛化能力和实用价值。
实际应用
在实际开发环境中,mopsa-dataset-debug-v10衍生的模型可融入持续集成流水线与集成开发环境,为开发者提供即时代码缺陷预警与修复建议。例如,当工程师提交代码后,系统能自动分析执行轨迹,识别潜在错误类型并给出修复范本,大幅缩减人工审查时间。此外,在在线编程教育平台,该数据集驱动的工具可对学生提交的代码进行智能错误归因,提供个性化的学习反馈,尤其在教授动态语言特性与内存错误调试时展现出卓越的辅助教学效果。
数据集最近研究
最新研究方向
在程序合成与代码理解领域,mopsa-dataset-debug-v10数据集为细粒度的代码错误检测与修复研究提供了崭新的实验平台。该数据集包含了近九千个带有丰富标注的代码片段,涵盖原始代码、执行轨迹、错误检查与自然语言描述等多维信息,尤其聚焦于变量赋值与输出类型的动态分析。其前沿研究方向体现在利用执行追踪与自然语言轨迹的融合,探索大语言模型在程序调试中的推理能力,关联近期AI辅助编程与自动化调试工具的热点事件,推动从静态代码分析向动态语义理解的范式转变,对提升代码质量与开发效率具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务