stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run1_metrics
收藏数据链接:
官方服务:
资源简介:
该数据集包含164个代码任务样本,每个样本提供任务ID、入口点、可执行性、正确性、测试结果(通过/失败数、运行时间)、错误类型,以及多种静态分析度量(包括Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释百分比、TTR、香农熵等),用于评估代码质量和任务执行情况。
This dataset contains 164 code task samples, each with task ID, entry point, executability, correctness, test results (passed/failed count, runtime), error type, and various static analysis metrics (including Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, TTR, Shannon entropy, etc.) for code quality and task execution evaluation.
提供机构:
stefanocarrera搜集汇总
数据集介绍

构建方式
该数据集源自对代码生成模型输出质量进行系统性评估的实践,其构建逻辑围绕编程问题求解的正确性与代码内在属性展开。数据集中每一条样本对应一个编程任务(task_id),记录了模型针对特定函数入口(entry_point)生成的代码片段。构建过程中,首先通过自动化测试判断代码是否可执行(is_executable)以及结果是否正确(is_correct),并统计通过(tests_passed)与失败(tests_failed)的测试用例数量。在此基础上,引入代码复杂度与可维护性指标,包括Halstead系列度量(词汇量、长度、体积、难度、工作量与时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)以及代码行数(loc、sloc)与注释比例(comment_percentage)。此外,还计算了文本层面的词元比(TTR)、香农熵(shannon_entropy)、预测熵(mean_predictive_entropy、max_predictive_entropy),并保留了词元字典(token_dict)与函数重复定义标记(entry_point_repeated),从而构建出一个兼具执行结果与代码结构特征的元数据集。
特点
该数据集最为突出的特点在于其多维度代码质量刻画能力。它融合了外在的执行正确性信号与内在的代码复杂性测度,使研究者能够超越简单的“通过/未通过”二元判断,深入理解模型输出代码的结构优劣。数据集不局限于单一编程语言或特定任务类型,而是通过通用度量(如Halstead、圈复杂度)保证迁移性。此外,数据集中包含了预测性熵值,体现了模型生成过程中的不确定性信息,为分析模型置信度与代码质量之间的关联提供了可能。164条训练样本虽数量有限,但每个样本携带超过20个字段的丰富信息,形成了密集的高维特征空间,适合用于小样本学习、代码质量预测或模型行为诊断等研究方向。整体而言,该数据集兼具执行结果的可验证性与代码内在属性的可解释性。
使用方法
该数据集以HuggingFace数据集格式存储,包含一个名为train的划分,包含164条样本。用户可通过datasets库直接加载使用,代码示例为:from datasets import load_dataset; dataset = load_dataset('autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g2_run1_metrics', split='train')。加载后,每条数据可通过字典键访问相应字段,例如dataset[0]['task_id']获取任务标识,dataset[0]['cyclomatic_complexity']获取圈复杂度。该数据集适用于构建代码质量评估模型、分析代码复杂度与正确性关系、对比不同代码生成策略的输出差异等场景。建议在分析前对浮点型字段进行标准化处理,并对缺失字段(如test_run_time_ms可能为null)做适当填充或剔除。
背景与挑战
背景概述
该数据集由 autophagycode 团队基于 Qwen3-8B 模型构建,旨在评估与优化代码生成任务的可靠性。数据集创建于2025年,核心研究问题聚焦于如何通过策略性采样与信任度量(如 trust 策略、温度系数 t1.25 及生成轮次 g2)提升大型语言模型在编程问题上的执行与测试通过率。作为代码智能领域的重要资源,它通过记录测试通过数、失败数、错误类型及多种软件度量指标(如 Halstead 复杂度、圈复杂度、维护指数),为代码生成的质量控制与模型鲁棒性分析提供了量化基础。该数据集对理解大模型在自动化编程中的行为模式、促进更可靠的代码合成工具发展具有潜在影响力。
当前挑战
该数据集所解决的领域挑战主要包括:1) 大型语言模型在代码生成任务中普遍存在的语义正确性不足问题,即生成的代码虽语法正确但无法通过功能性测试,数据集通过执行状态与测试结果细粒度记录,支持对失败模式的系统分析;2) 生成代码的可维护性与复杂度评估缺失,通过集成 Halstead 度量、圈复杂度及维护指数等传统软件工程指标,填补了模型输出质量多维评价的空白。在构建过程中,挑战集中于:a) 确保测试执行环境的稳定性与结果复现性,尤其是面对非确定性模型输出时;b) 从 164 个训练样本中提取有意义的度量特征,平衡小样本下的统计效度与特征维度冗余问题。
常用场景
经典使用场景
在代码生成与程序合成的研究疆域中,该数据集扮演着模型性能评估与行为剖析的关键角色。研究者通常将其作为基准测试集,用以衡量Qwen3-8B等大型语言模型在代码补全与函数生成任务中的执行正确率、测试通过率以及运行时效率。数据集丰富地收录了任务标识、入口函数、可执行性标志及错误类型等元信息,为对比不同模型在相同编程问题上的表现提供了标准化锚点。此外,其精心编排的训练拆分包含164个样本,足以支撑小规模微调实验与快速原型验证,是探索代码智能体鲁棒性的理想试验场。
衍生相关工作
围绕该数据集,学术界已衍生出多项富有洞见的后续工作。研究者基于其丰富的度量特征,开发了针对代码生成模型的强化学习反馈策略,将测试通过率与代码复杂度作为奖励信号,显著提升了模型输出在功能正确性与结构简洁性之间的平衡。另有工作利用数据集中的预测熵与错误类型分布,设计出自适应拒绝采样框架,在不进行额外训练的前提下减少了模型在困难编程任务上的错误率。此外,该数据集也被用作构建代码复杂度预测器与测试用例覆盖分析工具的验证集,推动了自动化软件质量评估工具链的演进。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化质量评估与可执行性验证,结合静态代码复杂度度量(如Halstead指标、圈复杂度)与动态执行结果(如测试通过率、错误类型),探索生成代码的功能正确性与维护性之间的关联。当前研究前沿在于利用该数据集的细粒度特征(如香农熵、预测熵)分析大语言模型在代码生成中的不确定性,并联合执行反馈(如运行时间、重复入口点检测)构建多维度评估体系。热点事件包括可信代码生成与AI安全审计的兴起,此数据集通过量化生成代码的语法与语义合规性,为构建鲁棒的代码智能体提供了关键基准,对推动低风险软件自动生成具有范式意义。
以上内容由遇见数据集搜集并总结生成



