遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含与代码执行和代码质量评估相关的信息,涉及编程任务的测试结果、错误类型以及代码度量指标(如Halstead复杂度、圈复杂度和可维护性指数)。数据集特征包括任务ID、入口点、可执行性、正确性、通过/失败的测试数量、错误类型,以及多种代码复杂度度量(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、注释比例、词符类型比、香农熵和预测熵等。数据集分为训练分片,包含164个示例,用于分析代码性能和质量。

This dataset contains information related to code execution and code quality assessment, involving test results, error types, and code metrics (such as Halstead complexity, cyclomatic complexity, and maintainability index) for programming tasks. The features include task ID, entry point, executability, correctness, number of tests passed/failed, error type, and various code complexity measures (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, comment percentage, token type ratio, Shannon entropy, and predictive entropy. The dataset is split into a training set with 164 examples, intended for analyzing code performance and quality.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g1_run1_metrics 数据集图片
构建方式
该数据集基于自动驾驶领域中的代码生成任务构建,旨在评估代码执行质量与复杂度。数据集来源于某一策略(trust_t1.1_g1_run1)下由Qwen3-4B模型生成的执行结果,共包含164条训练样本。每条样本记录了任务标识、入口函数、可执行性与正确性标记、测试通过与失败数量、运行时错误类型,以及丰富的代码度量指标,如Halstead复杂度、循环复杂度、可维护性指数、代码行数、注释比例、香农熵等。通过将这些多维度度量与执行结果相关联,数据集构建了一个可用于分析代码生成质量与内在结构关联的基准。
特点
本数据集的核心特色在于将代码执行结果与软件工程度量深度耦合。不仅提供了传统的正确性判断和测试结果统计,还纳入了从词汇、句法到可维护性等多个层次的复杂度量,包括Halstead音量与难度、循环复杂度、可维护性指数、令牌类型比(TTR)、香农熵及预测熵等。这种结构化特征集合使得研究者能够从代码静态属性、语义丰富度与执行动态性三个层面立体审视模型生成代码的鲁棒性与质量,而不仅仅是二元正确性。
使用方法
使用本数据集时,研究者可将代码度量特征作为输入或分析维度,探索生成代码正确性与复杂度指标之间的潜在关联。例如,可利用Halstead度量、循环复杂度等特征构建预测模型,以推断代码是否可执行或测试通过率。同时,数据集支持对错误类型、源代码逻辑行数(SLOC)等多维变量进行统计分析与可视化,适用于代码质量评估、模型生成行为建模及下游任务的性能基准测试。
背景与挑战
背景概述
该数据集由autophagycode团队与相关研究人员共同构建,旨在评估和优化大型语言模型在代码生成任务中的可靠性。数据集的创建基于对Qwen3-4B模型在特定策略(trust_t1.1_g1_run1)下生成的代码进行详尽分析,核心研究问题聚焦于模型生成代码的正确性、复杂度与可维护性。通过对164个样本的多维度度量,如执行正确性、Halstead复杂度、圈复杂度、可维护性指数等,该数据集为理解模型在代码生成过程中的行为模式提供了量化依据,对提升代码生成模型的鲁棒性和实用性具有重要参考价值。
当前挑战
当前数据集面临的主要挑战包括:第一,在代码生成领域,模型往往难以平衡功能正确性与代码风格、效率之间的关系,数据集中样本可能反映出模型在特定任务上的执行正确率不足或测试通过率偏低的问题。第二,构建过程中,由于需要从模型输出中提取并计算多达21种代码度量指标,包括语法分析、复杂度计算和可执行性验证,这一流程对工具链的准确性和自动化程度要求极高,任何环节的误差都会影响数据可靠性。此外,样本数量有限(仅164例),限制了模型泛化能力的深入分析,也增加了统计显著性检验的难度。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与质量分析,是面向编程任务自动化验证的重要资源。它汇集了164个训练样本,每个样本涵盖从代码可执行性、测试通过率到运行时间等多维度指标。经典使用场景在于评估大语言模型在代码补全、函数生成等任务上的表现,尤其是在可信度与策略对齐的语境下,通过halstead复杂度、圈复杂度、可维护性指数等软件工程指标,量化生成代码的结构质量与执行正确性。
解决学术问题
数据集有效回应了学术界关于代码生成模型可信评估的紧迫需求。传统评估往往仅关注通过率,而忽略代码内部复杂度与可维护性。该数据集通过引入halstead度量、香农熵、预测熵等指标,揭示了生成代码的语义多样性、结构冗余度及潜在风险,推动研究者深入探讨模型在‘正确性’之外的‘安全性’与‘鲁棒性’问题,为构建更为严谨的代码质量评估体系奠定了数据基础。
衍生相关工作
该数据集衍生了数项富有启发性的研究工作。一方面,研究者基于其多维度指标开发了融合代码复杂度与执行成功率的联合优化框架,提升了生成代码在真实工程环境中的可用性。另一方面,出现了一批聚焦于预测熵与隐含bug关联性的实证分析,拓展了代码质量预测的理论边界。此外,数据集的结构化特征也为后训练对齐策略提供了量化基准,催生了基于可信度评分的模型选择方法,推动了代码智能领域的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务