遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run2_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个代码执行和度量样本,每个样本包括任务ID、入口点、是否可执行、是否正确、测试通过/失败数、测试运行时间、错误类型、Halstead代码复杂度指标(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、有效代码行数、注释百分比、词元比、词元字典、香农熵、预测熵、函数定义数等。适用于分析代码质量、复杂度与执行结果的关系。

This dataset contains 164 samples of code execution and metric data. Each sample includes task ID, entry point, executability, correctness, number of tests passed/failed, test run time, error type, Halstead complexity metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, type-token ratio, token dictionary, Shannon entropy, predictive entropy, number of defined functions, etc. It is suitable for analyzing relationships between code quality, complexity, and execution results.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run2_metrics 数据集图片
构建方式
该数据集源自对大型语言模型在代码生成任务上输出质量的系统性评估,具体构建于Qwen3-4B模型在autophagycode_D_he_train数据集上的推理结果之上。数据收集过程中,采用信任策略(trust_1.1_g1)对模型生成的多个候选代码进行筛选与聚合,并通过运行2轮实验以增强结果的稳健性。每条数据记录均包含任务标识、代码入口点、执行状态与正确性标记,以及通过动态执行获得的测试通过/失败数量、运行时耗等关键指标。此外,还整合了静态代码分析特征,涵盖Halstead复杂度、圈复杂度、可维护性指数等十余项软件工程度量指标,并以token字典、信息熵等特征量化代码的词汇多样性与不确定性。最终数据集包含164个训练样本,总大小为251KB,以Parquet格式高效存储。
使用方法
本数据集适用于代码生成模型的评估、调试与性能分析研究。用户可通过HuggingFace Datasets库加载训练分割数据,利用`load_dataset`函数直接读取Parquet文件。在使用时,建议以`is_correct`或`tests_passed`为核心指标评估模型输出的功能正确性,同时结合代码复杂度、可维护性指数等静态特征对生成的代码进行综合质量分析。此外,可利用香农熵与预测熵字段探索模型在不同代码场景下的不确定性模式,而`token_dict`与`halstead_*`系列特征则适合用于训练代码质量预测模型或进行代码风格演化分析。数据集中各字段均为明确的数值或字符串类型,无需额外预处理即可直接集成至机器学习流程中。
背景与挑战
背景概述
在代码智能与软件工程交叉领域,自动化代码生成与质量评估已成为研究热点。该数据集由autophagycode团队基于Qwen3-4B模型在信任策略(strategy_trust)框架下生成,旨在系统评估模型生成代码的可执行性、正确性与软件质量指标。数据创建于模型微调与验证阶段,核心研究问题聚焦于量化大规模语言模型生成代码的软件工程属性,如哈洛德复杂度、圈复杂度、可维护性指数及香农熵等。通过对164个训练样本的精细标注与度量,该数据集为理解模型在代码任务中的行为偏差与能力边界提供了结构化资源,对提升代码生成模型的可信度与实用性具有重要参考价值。
当前挑战
数据集面临的首要挑战在于所解决的领域问题——即如何综合评估代码生成模型的输出质量。传统指标仅关注功能正确性,忽视软件工程特性如可维护性与复杂度,而该数据集通过多维度度量填补了这一空白。构建过程中的挑战包括:确保度量指标(如哈洛德体积与圈复杂度)在有限样本上的统计可靠性;处理token字典与熵值计算中的稀疏性问题;以及协调可执行性标签与运行时错误间的歧义,例如高频出现的predictive_entropy缺失需在采样与标注协议中谨慎设计。这些挑战对数据集的泛化能力与下游应用构成约束。
常用场景
经典使用场景
该数据集汇集了代码生成与执行过程中产生的多维度评估指标,涵盖代码正确性、可执行性、测试通过率及失败数量等核心信息,同时融入Halstead复杂度、圈复杂度、可维护性指数等软件工程度量标准。经典使用场景在于系统性地评估大型语言模型生成代码的质量与可靠性,研究者可借此深入剖析模型在编程任务中的表现,尤其是在理解代码语义、规避语法错误及生成高效可维护代码方面的能力,为提升代码生成模型的实用性与鲁棒性奠定数据基础。
解决学术问题
该数据集有效解决了代码生成领域中对模型输出进行全面量化评估的学术难题。通过整合运行时测试结果与静态代码复杂度指标,它揭示了生成代码在功能正确性与结构质量之间的微妙关联,为探究模型是否真正理解编程逻辑而非简单模式匹配提供了实证依据。其发布推动了从单一正确率评价向多维度质量评估范式的转变,显著影响了后续代码智能研究中评估体系的构建,促使学界更加关注生成代码的可维护性、可读性和计算效率等深层次属性。
实际应用
在自动化软件开发和智能编程助手等实际场景中,该数据集为质量保障环节提供了关键支撑。开发团队可借助其丰富的评估指标,筛选出不仅功能正确且结构优秀的模型生成代码,用于重构建议、单元测试生成和代码审查自动化。尤其在持续集成流程中,数据集定义的指标能够实时监控模型输出质量,辅助决断是否采纳推荐代码,从而降低人工审核成本。产品化编程助手如GitHub Copilot等工具,亦可基于此类数据优化模型排序策略,提升用户采纳率。
数据集最近研究
最新研究方向
在代码生成与自动化编程的前沿探索中,研究者愈发关注大语言模型生成代码的可执行性与正确性评估。该数据集聚焦于Qwen3-4B模型在特定策略(trust_t1.1_g1_run2)下的输出质量,通过多维度的静态与动态指标——包括测试通过率、Halstead复杂度、圈复杂度、维护性指数及香农熵——构建了精细化的代码质量画像。这一方向呼应了当前大模型可靠性与安全性研究的热潮,尤其与AI辅助编程工具在工业级部署中的鲁棒性挑战密切相关。数据集所提供的复杂度量信息,为深入理解模型在不同任务上的行为差异、识别潜在错误模式以及优化提示策略提供了数据支撑,对推动代码智能评估体系的标准化具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务