遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,专注于代码分析和评估任务。每个示例由多个特征组成,包括任务标识符(task_id)、入口点函数(entry_point)、代码可执行性(is_executable)和正确性(is_correct)的布尔标志、测试通过和失败的数量(tests_passed、tests_failed)、测试运行时间(test_run_time_ms,当前为null值)以及错误类型(error_type)。此外,数据集还提供了广泛的代码复杂度度量,如Halstead词汇量、长度、体积、难度、努力度和时间(halstead_vocabulary等)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc和sloc)、注释百分比(comment_percentage)、词汇多样性(TTR)、Shannon熵和预测熵(shannon_entropy、mean_predictive_entropy、max_predictive_entropy)、定义函数数量(n_func_defined)以及入口点重复标志(entry_point_repeated)。数据以字典形式存储(token_dict),可能用于进一步分析。整体上,该数据集适用于代码质量评估、程序理解和机器学习任务,强调代码的静态和动态特性。

This dataset contains 164 training examples focused on code analysis and evaluation tasks. Each example comprises multiple features, including a task identifier (task_id), an entry point function (entry_point), boolean flags for code executability (is_executable) and correctness (is_correct), counts of tests passed and failed (tests_passed, tests_failed), test run time (test_run_time_ms, currently null), and error type (error_type). Additionally, the dataset provides extensive code complexity metrics, such as Halstead vocabulary, length, volume, difficulty, effort, and time (halstead_vocabulary, etc.), cyclomatic complexity (cyclomatic_complexity), maintainability index (maintainability_index), lines of code (loc and sloc), comment percentage (comment_percentage), lexical diversity (TTR), Shannon entropy and predictive entropy (shannon_entropy, mean_predictive_entropy, max_predictive_entropy), number of defined functions (n_func_defined), and an entry point repetition flag (entry_point_repeated). Data is stored in dictionary format (token_dict) for potential further analysis. Overall, this dataset is suitable for code quality assessment, program comprehension, and machine learning tasks, emphasizing both static and dynamic code characteristics.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run2_metrics 数据集图片
构建方式
该数据集依托Qwen3-4B大语言模型,采用mercury蒸馏策略与trust置信度机制(阈值t=1.25, 生成次数g=9)进行代码生成与评估。通过两次独立运行(run2)的对比实验,系统性地收集了164个训练样本。每个样本包含字符串型任务标识(task_id)和函数入口点(entry_point),并经过自动化测试流水线获取执行结果(is_executable/is_correct)、通过/失败用例数(tests_passed/tests_failed)、运行时错误类型(error_type)等关键指标。同时,基于代码静态分析工具提取了Halstead复杂度度量(包括词汇量、长度、体积、难度、工作量与时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc/sloc)及注释占比(comment_percentage)等软件工程特征。
特点
本数据集深度融合了代码动态执行质量与静态复杂度特征,构建了多维度的代码评估体系。动态维度涵盖可执行性、正确性及运行时性能指标,静态维度则通过Halstead复杂度、圈复杂度与可维护性指数刻画代码的认知负荷与结构质量。创新性地引入文本多样性度量(TTR)与信息熵指标(shannon_entropy, mean_predictive_entropy, max_predictive_entropy),从词元分布与不确定性角度量化代码语义丰富度。此外,记录函数定义数量(n_func_defined)与入口点重复性(entry_point_repeated),为模型生成代码的模块化与冗余性分析提供支撑。
使用方法
该数据集可直接作为代码智能研究中的多目标评估基准,适用于代码质量预测、可维护性分析及模型生成代码的自动化诊断任务。用户可通过HuggingFace Datasets库加载default配置的train分片,利用数据集提供的25维结构化特征(涵盖布尔型、整型、浮点型及字符串型)构建机器学习模型。特别地,结合tags_passed/tests_failed与Halstead复杂度可研究代码正确性与复杂度的关联规律,而可维护性指数与信息熵特征可服务于代码理解性与一致性的量化评估。数据集规模适中(164条样本),适合作为小样本学习或模型微调验证的标注数据。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run2_metrics,由Qwen团队在2024年基于Mercury策略构建,旨在评估Qwen3-4B模型在代码生成与执行任务中的表现。核心研究问题聚焦于模型生成代码的功能正确性、执行效率以及代码质量的量化分析。数据集包含164个训练样本,涵盖任务标识、执行状态、测试通过/失败数、运行时间、错误类型以及Halstead复杂度、圈复杂度、可维护性指数、香农熵等20余项代码度量指标,为代码智能领域提供了细粒度的模型输出评估基准。该数据集的创建推动了代码生成模型在功能性验证与代码质量权衡方面的研究,对自动化编程工具的可信度评估具有重要参考价值。
当前挑战
面临的核心挑战包括:一、领域问题层面,代码生成模型需同时满足功能正确性与可维护性,数据集通过多维度度量指标揭示了模型在低资源任务上测试通过率与代码复杂性之间的平衡难题,现有模型在复杂逻辑任务上易出现高倾向性错误(如超时、运行时异常)。二、构建过程中,样本规模仅164例,限制了统计显著性;自动执行环境需兼容多种编程语言与库依赖,误判率控制困难;度量指标如Halstead时间、可维护性指数的计算依赖精确的语法解析,而模型输出的非标准代码片段常导致解析失败,需人工校正。此外,预测性熵值随任务复杂度增长波动剧烈,为模型校准带来了额外挑战。
常用场景
经典使用场景
在代码质量评估与自动修复的研究领域中,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run2_metrics数据集为模型生成代码的效能度量提供了精细化的数据支撑。经典使用场景聚焦于利用代码复杂度指标(如圈复杂度和Halstead难度)与可维护性指数,对大型语言模型生成的Python代码片段进行系统性评估。研究者常依赖该数据集的测试通过率、运行时错误类型及预测熵等特征,来审视模型在特定温度参数和信任策略下的代码输出质量,从而精准刻画生成代码在功能正确性与结构健壮性之间的权衡。
解决学术问题
该数据集直面代码生成领域中一个长期悬而未决的学术难题:如何从多维软件工程度量视角,量化分析语言模型输出结果的可靠性。通过整合Halstead复杂度、香农熵与词符重复率等特征,它使得研究者能够超越简单的测试通过率,深入探究生成代码的内在结构复杂度与可理解性。这类数据资源为从统计学角度验证生成代码的维护成本与潜在缺陷倾向提供了坚实依据,有力推动了代码生成模型评估体系从单一正确性向综合性度量范式的演进。
衍生相关工作
围绕该数据集所刻画的代码质量多维特征,学界已衍生出若干具有启发性的经典工作。部分研究以Halstead时间与圈复杂度作为监督信号,引导大型语言模型在推理阶段实现结构更优的轨迹采样。另有工作利用香农熵与最大预测熵,构建了预测置信度与测试通过率之间的概率映射模型,为无需执行即可预判代码正确性的无运行时评估方法奠定了理论基础。此外,该数据集的维护性指数分布促使研究者探索基于反馈的代码自动重构策略,显著深化了代码生成领域中质量感知推理的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务