遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个包含代码分析相关指标的数据集,适用于编程任务评估和代码质量研究。数据集包含164个训练样本,每个样本具有多个特征,如任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过和失败次数(tests_passed、tests_failed)、错误类型(error_type)、代码复杂度指标(如Halstead词汇量、长度、难度、努力值、时间、圈复杂度、可维护性指数)、代码行数(loc、sloc)、注释比例(comment_percentage)、词汇多样性(TTR)、熵值(shannon_entropy、mean_predictive_entropy、max_predictive_entropy)、定义函数数量(n_func_defined)以及入口点重复性(entry_point_repeated)。这些特征可用于分析代码执行结果、错误模式、代码结构和可维护性。

This dataset is a collection of code analysis metrics, suitable for programming task evaluation and code quality research. It contains 164 training examples, each with multiple features such as task ID (task_id), entry point (entry_point), executability (is_executable), correctness (is_correct), test pass and fail counts (tests_passed, tests_failed), error type (error_type), code complexity metrics (e.g., Halstead vocabulary, length, difficulty, effort, time, cyclomatic complexity, maintainability index), lines of code (loc, sloc), comment percentage (comment_percentage), lexical diversity (TTR), entropy values (shannon_entropy, mean_predictive_entropy, max_predictive_entropy), number of defined functions (n_func_defined), and entry point repetition (entry_point_repeated). These features can be used to analyze code execution outcomes, error patterns, code structure, and maintainability.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run1_metrics 数据集图片
构建方式
该数据集源于对Qwen3-8B模型在编程任务上生成结果的系统性评估,聚焦于自噬代码(autophagycode)场景下的代码质量与执行表现。构建过程通过运行大规模代码测试合辑,收集每项任务对应的执行状态、通过测试数量及运行时耗等关键指标。在此基础上,进一步融合了哈斯戴德(Halstead)复杂度度量、圈复杂度、可维护性指数等软件工程领域的多维度量化分析,并纳入信息熵及预测熵等反映代码不确定性的统计特征。数据集共包含164条训练样本,每条样本均涵盖任务标识、代码入口点、执行正确性与错误类型等丰富信息,形成了对模型输出代码从功能正确性到结构复杂度全貌的精细刻画。
使用方法
数据集以HuggingFace数据集格式发布,包含一个名为'train'的拆分,共164条记录。用户可通过加载默认配置轻松获取数据,每条记录包含从任务标识到代码复杂度的多类型字段。典型应用场景包括:利用功能字段(如is_correct、tests_passed)评估模型代码生成的正确率;借助复杂度指标(如圈复杂度、哈斯戴德度量)分析代码质量分布;或结合熵特征研究模型输出不确定性与代码结构的关系。推荐使用Python的datasets库进行加载与预处理,以便快速接入机器学习工作流,进行统计分析、可视化或训练回归与分类模型。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,聚焦于大型语言模型(LLM)在自动化代码生成任务中的评估与优化。基于Qwen3-8B模型,采用trust策略进行微调,旨在探究模型生成代码的可靠性、可执行性及复杂性。数据集包含164个训练样本,涵盖任务标识、代码可执行性、测试通过率、Halstead复杂度、圈复杂度、维护性指数等丰富指标,为代码生成领域提供了细粒度的量化评估工具。其影响力体现在将软件工程中的代码度量标准引入LLM评估体系,为模型性能的可解释性研究开辟了新路径。
当前挑战
该数据集所解决的领域问题在于,现有LLM代码生成评估多依赖粗略的功能正确性判断,缺乏对代码质量、可读性及计算复杂度的系统性考量。构建过程中面临的核心挑战包括:高效整合代码静态分析工具以自动化提取Halstead复杂度、圈复杂度等度量;确保小样本条件下(164例)度量维度的鲁棒性,避免过拟合;以及如何设计策略(如trust参数)平衡生成代码的多样化与正确性,防止模型趋向低复杂度的平庸解。
常用场景
经典使用场景
在代码生成与程序合成领域,评估模型输出质量与代码正确性的研究长期依赖于功能性测试。该数据集以Qwen3-8B作为基座模型,在102个来自HumanEval与MBPP的编程任务上,通过trust策略与温度系数1.25、样本数6的配置生成代码,并将模型输出转化为结构化的度量元数据。每一行记录对应一次执行结果,包含从香农熵、哈尔斯特德复杂度到圈复杂度、可维护性指数等多维指标。研究者可借此深入剖析大型语言模型在代码任务上的行为差异化,特别是探索测试通过率与代码结构特征之间的潜在关联,为模型微调与策略优化提供量化依据。
解决学术问题
该数据集直面代码合成研究中一个关键瓶颈:单纯以通过率衡量模型性能过于粗糙,无法揭示失败根源与代码质量的深层联系。通过同时记录测试通过与否、错误类型、运行时延以及超过十种软件工程度量指标,数据集帮助学者回答诸如“哪些模型参数配置下生成的代码更易出现圈复杂度过高”、“哈尔斯特德难度是否与测试失败率正相关”等精细化问题。此数据为理解大模型在代码生成中的通用性与鲁棒性提供了实证土壤,推动了从“能否通过测试”向“为何未能通过”的研究范式转变。
实际应用
在实际软件工程环境中,团队可利用该数据集训练一个低成本的质量预测器,在代码生成阶段实时估算一段候选代码的测试通过概率及潜在缺陷类型。基于该数据的度量组合,持续集成流水线可以更早地筛选出存在结构塌陷风险的生成代码,减少无效的测试资源消耗。同时,该数据集对多轮修正策略的调优具有直接参考价值——通过比对高低置信度输出在结构指标上的分布差异,研发人员能够设计出更高效的采样与重生成机制,提升最终交付代码的合规性与可维护性。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成与执行的智能化评测,融合了任务标识、执行正确性、测试通过率等执行态指标,并引入Halstead复杂度、圈复杂度、可维护性指数等经典软件工程度量,以及香农熵、预测熵等不确定性指标。这一多维评估体系,为大型语言模型生成代码的可执行性、正确性与代码质量提供了细粒度量化工具。当前,该数据集正被广泛应用于自动编程系统的鲁棒性测试、代码复杂度对模型生成质量的影响分析,以及基于异构度量融合的代码可信评估。其意义在于推动代码智能从单纯的功能正确性验证,迈向涵盖执行可靠性、结构复杂度与信息熵的全面质量度量体系,为下一代代码生成模型的设计与优化奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务