遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g2_run1_metrics

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于编程任务评估和代码分析的数据集,包含164个训练样本。每个样本代表一个编程任务,具有多个特征,包括任务ID、入口点、可执行状态、正确性标志、通过和失败的测试数量、测试运行时间(当前为null)、错误类型,以及一系列软件度量指标,如Halstead复杂度度量(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比率(TTR)、令牌字典、香农熵、平均预测熵、最大预测熵、定义函数数量,以及入口点是否重复的布尔标志。这些特征可用于评估代码质量、复杂性和执行性能,适用于软件工程、机器学习模型训练或代码生成任务的研究。

This dataset is designed for programming task evaluation and code analysis, containing 164 training examples. Each example represents a programming task with multiple features, including task ID, entry point, executable status, correctness flag, number of tests passed and failed, test run time (currently null), error type, and a set of software metrics such as Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and a boolean flag for entry point repetition. These features are useful for assessing code quality, complexity, and execution performance, and can be applied in software engineering research, machine learning model training, or code generation tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g2_run1_metrics 数据集图片
构建方式
该数据集源自代码生成模型的系统性评估实践,以Python编程任务为基本单元,通过执行生成的代码并记录其行为表现来构建。具体而言,针对每个任务样本,数据集采集了代码能否成功执行、测试用例通过与否、错误类型等运行时信号,并借助静态分析工具提取Halstead度量、圈复杂度、可维护性指数及代码行统计等软件工程指标,同时纳入基于语言模型的预测熵特征,从而形成对代码质量与模型行为的多维度刻画。
特点
数据集的核心特点在于将程序执行结果与代码结构度量、词汇多样性及模型不确定性信号进行了整合。字段涵盖任务标识、入口函数、可执行性、正确性、测试通过/失败数量、错误类型等执行层面信息,并辅以Halstead系列指标、圈复杂度、可维护性指数、注释比例、词型/词例比、香农熵以及平均与最大预测熵等。这些特征共同支持对代码生成质量、复杂性与模型置信度的联合分析,适用于错误模式挖掘与评估策略研究。
使用方法
该数据集以HuggingFace Datasets格式发布,仅包含一个训练分片,用户可通过load_dataset接口直接加载并访问全部字段。使用时可根据研究目标选取相应列,例如以is_correct和tests_passed衡量生成正确性,以halstead_*、cyclomatic_complexity和maintainability_index分析代码结构质量,以mean_predictive_entropy等熵指标探讨模型不确定性。由于样本规模为164条,适合作为方法验证或案例分析的数据基础,不建议直接用于大规模训练。
背景与挑战
背景概述
在代码生成与程序合成的学术前沿,对模型输出进行细粒度评估已成为推动领域发展的关键。该数据集源于Qwen3-8B模型在策略信任设置下的采样运行(t0.75, run1),由相关研究团队于近期构建,旨在通过多维度指标揭示模型生成代码的质量与执行特性。其核心研究问题在于超越传统通过率指标,融合Halstead度量、圈复杂度、可维护性指数及预测熵等软件工程与信息论特征,系统刻画生成代码的结构与不确定性。该数据集为代码大模型的可靠性分析与可解释性研究提供了实证基础,对自动化编程及模型评估方法学具有潜在影响。
当前挑战
该数据集所应对的领域问题在于代码生成任务的评估困境:传统单一通过率无法反映代码的可维护性、复杂度与模型置信度。其构建过程亦面临多重挑战,包括在高度信任采样策略下确保执行环境稳定与测试用例充分性,精确计算多种软件度量指标(如Halstead参数与预测熵)需兼顾计算效率与准确性,以及处理运行时间缺失、错误类型归类等噪声问题。这些挑战共同构成了数据集在推动代码生成模型细粒度诊断与优化时必须克服的技术壁垒。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集凭借细粒度的执行反馈与多维度代码度量指标,构筑了评估大语言模型编程能力的经典试验场。其核心使用场景聚焦于对模型生成的代码进行正确性判定与质量剖析,通过is_executable、is_correct及tests_passed等字段,精确刻画代码能否运行、是否通过测试用例,从而为模型性能对比提供可量化的依据。
解决学术问题
针对代码生成研究中长期存在的评估偏差与指标单一问题,该数据集通过整合Halstead度量、圈复杂度、可维护性指数及信息熵等多元特征,解决了传统仅依赖通过率进行评价的局限性。其意义在于将功能正确性与代码风格、复杂度、可读性等软件工程属性并置,为学术社区探究生成代码的质量全貌提供了实证基础,推动了评估范式从二元判定向多维剖析的演进。
衍生相关工作
基于该数据集的结构化度量与执行结果,后续研究催生了若干经典工作,包括面向代码生成模型的细粒度错误归因分析、基于信息熵的生成不确定性量化方法,以及融合Halstead特征与神经网络的代码质量预测模型。这些工作在不同程度上拓展了数据集的应用边界,并促进了程序理解与自动修复领域的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务