遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个样本,用于代码执行和代码质量分析任务。每个样本包括任务ID(task_id)、入口点(entry_point)、可执行状态(is_executable)、正确性(is_correct)、通过和失败的测试数量(tests_passed, tests_failed)、测试运行时间(test_run_time_ms)、错误类型(error_type),以及多个代码度量指标,如Halstead复杂度(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc, sloc)、注释百分比(comment_percentage)、TTR(Type-Token Ratio)、token字典(token_dict)、香农熵(shannon_entropy)、平均和最大预测熵(mean_predictive_entropy, max_predictive_entropy)、定义函数数量(n_func_defined)和入口点重复性(entry_point_repeated)。数据集仅包含训练划分(train),适用于机器学习模型训练,以评估代码性能、错误检测或代码复杂度分析。

This dataset contains 164 samples for code execution and code quality analysis tasks. Each sample includes task ID (task_id), entry point (entry_point), executable status (is_executable), correctness (is_correct), number of tests passed and failed (tests_passed, tests_failed), test run time (test_run_time_ms), error type (error_type), and multiple code metrics such as Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity (cyclomatic_complexity), maintainability index (maintainability_index), lines of code (loc, sloc), comment percentage (comment_percentage), TTR (Type-Token Ratio), token dictionary (token_dict), Shannon entropy (shannon_entropy), mean and max predictive entropy (mean_predictive_entropy, max_predictive_entropy), number of functions defined (n_func_defined), and entry point repetition (entry_point_repeated). The dataset only includes a training split (train) and is suitable for machine learning model training to evaluate code performance, error detection, or code complexity analysis.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run1_metrics 数据集图片
构建方式
该数据集基于自动化代码质量与执行评估流程构建,选取了164个编程任务样本,每个样本均通过Qwen3-4B模型在特定策略下生成代码,并经过严格的执行验证。记录中包含了任务标识符、函数入口点、可执行性与正确性标志,以及通过/失败的测试用例数量与运行时间。此外,系统还集成了Halstead复杂度、圈复杂度、维护性指数和香农熵等十余项代码度量指标,旨在从多维度捕捉生成代码的结构特性与质量特征。
特点
数据集的核心特色在于其多维度的代码评估体系。除了基本的执行结果外,它全面融合了代码复杂度指标(如Halstead volume、cyclomatic_complexity)、代码体积指标(如loc与sloc)、注释密度、词汇多样性(TTR)以及预测熵值。特别地,shannon_entropy与mean_predictive_entropy等指标为理解生成代码的不确定性与信息量提供了独特视角,使该数据集成为研究代码生成模型行为与输出质量之间关系的宝贵资源。
使用方法
使用者可通过HuggingFace Datasets库便捷加载该数据集,其包含单一的'train'分割,内含164条样本。每条样本以字典形式呈现,可直接访问所有评估字段。适用于两类场景:一是作为基准测试集,对比不同代码生成模型的性能;二是用于分析代码质量指标与执行正确性之间的关联性。研究者可根据需要筛选字段,例如仅使用'is_correct'与各类复杂度指标进行统计分析,或利用完整特征集训练预测模型。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g3_run1_metrics,由autophagycode团队于近期创建,旨在评估和度量Qwen3-4B模型在代码生成任务中的性能表现。数据集包含164个训练样本,记录了模型在特定策略(trust策略,温度系数1.25,生成次数3)下生成的代码片段的执行结果与多种软件度量指标,如Halstead复杂度、圈复杂度、可维护性指数、香农熵等。其核心研究问题聚焦于如何通过多维度代码度量指标量化大型语言模型生成代码的质量与可靠性,从而推动代码智能领域的评估标准从单一的正确性判断向综合性质量分析演进。该数据集为研究模型在代码执行、错误类型分布及代码复杂度等方面的表现提供了细粒度、结构化的数据支撑,对代码生成模型的可信评估与优化具有重要参考价值。
当前挑战
该数据集主要面临以下挑战:首先,在领域问题层面,当前代码生成模型的评估多依赖于最终的正确性,缺乏对代码可读性、可维护性及执行效率等深层质量维度的量化,该数据集虽引入了Halstead与圈复杂度等指标,但如何将这些度量有效整合为统一的评估框架仍是一大难点。其次,在数据构建过程中,由于仅包含164个样本,较小的规模可能导致统计偏差,难以全面反映模型在不同代码任务上的泛化性能;此外,度量指标的计算依赖预设的代码解析规则,对于不规则或非标准化的生成代码可能产生误差,且部分字段(如test_run_time_ms)存在空值,增加了数据清洗与分析的复杂性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与优化,尤其适用于研究大语言模型在编程任务上的执行力与代码质量。其中包含丰富的代码度量指标,如圈复杂度、维护性指数、Halstead复杂度系列等,使研究者能够从多个维度剖析模型生成代码的可维护性、可读性与运行效率。经典的使用场景包括对代码生成模型进行细粒度的性能诊断,通过分析测试通过率、错误类型与代码复杂度之间的关系,揭示模型在特定编程任务上的优势与短板。这种多维度评测方式为构建更可靠的代码生成系统提供了扎实的实证基础。
衍生相关工作
基于该数据集衍生出的经典工作主要集中在代码生成模型的鲁棒性评估与可解释性分析方向。研究者利用其中丰富的量化指标,开展了关于模型输出代码结构与人类编程习惯一致性的对比研究,提出了基于复杂度特征的模型诊断框架。另一项有影响力的工作则探索了代码复杂度与模型规模、训练数据分布之间的内在关联,通过分析圈复杂度和Halstead体积随模型参数的演变规律,为理解大语言模型的代码学习机制提供了新视角。这些工作不仅深化了对代码生成模型行为模式的认识,也为后续构建更透明、更可控的编程助手奠定了方法论基础。
数据集最近研究
最新研究方向
在大规模语言模型代码生成能力评估的前沿探索中,该数据集聚焦于对模型输出的可执行性、正确性及代码质量进行多维度量化分析。通过引入Halstead复杂度、圈复杂度、可维护性指数等软件工程度量指标,并结合香农熵与预测熵来刻画模型输出的不确定性特征,研究者得以深入剖析模型在解决具体编程任务时的可靠性与鲁棒性。这一方向紧密关联当前AI代码生成领域的热点事件——即如何从单纯追求通过率转向对代码结构性缺陷与逻辑漏洞的细粒度诊断。数据集的结构化设计为构建更严谨的代码生成基准评测体系提供了关键支撑,其意义在于推动自主模型在可信赖与可解释性维度的实质性跃升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务