遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于编程任务代码质量评估的数据集,包含164个训练样本。每个样本对应一个编程任务,记录了任务ID、入口函数、可执行状态、正确性判断、测试通过与失败数量、测试运行时间、错误类型等基本信息,同时提供了丰富的代码质量度量指标,包括Halstead复杂度(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释比例、词汇丰富度(TTR)、词汇表、香农熵、预测熵(均值和最大值)以及定义函数数量等。数据集适用于代码质量分析、自动化评估、编程任务复杂度研究等领域。

This dataset is designed for code quality assessment of programming tasks, containing 164 training examples. Each example corresponds to a programming task and includes basic information such as task ID, entry point function, executability status, correctness judgment, number of tests passed/failed, test run time, and error type. It also provides comprehensive code quality metrics, including Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, lexical richness (TTR), token dictionary, Shannon entropy, predictive entropy (mean and maximum), and number of defined functions. The dataset is suitable for research in code quality analysis, automated assessment, and programming task complexity studies.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run0_metrics,其构建基于自动化代码生成与评估流程。首先,利用Qwen3-8B大语言模型在信任策略(trust strategy)下,以温度参数t=1.25和生成条数g=6的设置,针对自噬代码(autophagycode)领域中的D_he_train任务生成候选代码片段。随后,通过执行测试用例对生成的代码进行可执行性、正确性及性能度量(如测试通过数、失败数、运行时间)的评估,并记录错误类型。此外,还引入了静态代码分析技术,从代码的词汇复杂度(Halstead度量)、圈复杂度、可维护性指数、代码行数、注释比例等多个维度提取代码质量特征,最终形成包含164个样本的训练集。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,默认配置为‘default’并仅包含训练集(train split)。使用时,每条样本包含task_id、entry_point等标识字段,以及代码执行结果与各项度量指标。适用于监督学习任务,如代码正确性分类(基于is_correct标签)、复杂度预测或可维护性评估。研究者可基于halstead_volume、cyclomatic_complexity等连续特征构建回归模型,或利用TTR、shannon_entropy等文本特征进行聚类分析。此外,token_dict字段存储了代码的词汇分布,可用于词汇级分析或结合大语言模型进行进一步的生成质量研究。
背景与挑战
背景概述
该数据集由Qwen3-8B模型在自我进化策略(strategy_trust)驱动下生成,聚焦于代码执行质量的自动化评估。其核心研究问题在于探索如何通过多维度代码度量指标(如Halstead复杂度、圈复杂度、维护性指数等)构建可信的代码生成基准。该数据集以164条训练样本构成,涵盖了任务标识、执行正确性、测试通过率及词法熵等丰富特征,为代码智能领域提供了细粒度的执行质量分析框架。其影响力体现在对生成代码的可靠性与安全性评估的推动,尤其在高风险计算场景中具有参考价值。
当前挑战
当前面临的核心挑战在于领域问题的复杂性:代码生成不仅需要语法正确性,更需应对逻辑正确性、资源效率及安全漏洞等多维约束,而现有度量指标难以完全捕获执行语义。构建过程中,数据集面临样本量稀少的困境(仅164条),可能限制模型泛化能力的评估;同时,特征维度的高熵值(如token_dict与香农熵)增加了噪声处理的难度,需设计鲁棒的过滤机制以平衡特征多样性与数据质量。此外,测试时间等关键字段的缺失进一步加剧了执行性能标定的不完整性。
常用场景
经典使用场景
在代码智能与软件工程领域,代码生成模型的质量评估始终是研究焦点。该数据集专为评估代码生成模型的正确性和鲁棒性而设计,通过记录每个任务单元的测试通过率、失败情况和执行时间等细粒度指标,可精准衡量模型生成代码的功能正确性。同时,数据集融入了Halstead复杂度、圈复杂度和维护性指数等软件度量学特征,为从代码结构复杂度角度深入剖析模型表现提供了独特视角。这些特征使得数据集成为验证大语言模型代码生成能力、比较不同模型策略优劣的经典基准。
解决学术问题
该数据集有效回应了学术界对代码生成模型评估标准单一化、缺乏多维度的长期困扰。传统评估仅关注代码是否通过测试,而忽略了生成代码的结构质量和理解难度。通过整合功能正确性指标与软件度量学特征,数据集破解了“模型输出代码看似正确实则难以维护”的评估盲区。研究者得以系统性探究模型在应对不同复杂度任务时的鲁棒性边界,揭示代码复杂度与生成错误之间的内在关联,从而推动了对代码生成模型认知能力的深刻理解。
实际应用
该数据集在工业级代码辅助工具的性能调优与安全验证中展现出重要价值。软件工程团队可借助数据集对候选代码生成模型进行深度剖释,筛选出在测试覆盖率与代码可维护性之间取得平衡的优质模型。数据集提供的预测熵和香农熵等特征,有助于预先识别模型在高度不确定或易出错任务上的生成风险,从而降低最终代码产品中的隐蔽缺陷。这一应用显著提升了自动化代码生成在实际开发流程中的可信度与效能。
数据集最近研究
最新研究方向
在软件工程与人工智能交叉的前沿领域,该数据集创新性地聚焦于大型语言模型生成代码的自动化评估与质量分析。通过整合代码可执行性、测试通过率、Halstead复杂度、圈复杂度、可维护性指数及香农熵等多维静动态指标,为代码生成模型的鲁棒性、效率与可维护性提供了量化评价基准。当前热点研究表明,此类数据集可有力支持研究者构建更为可靠的代码智能评估框架,推动从单纯的语法正确性验证转向深层的语义正确性及软件质量度量,对于提升以Qwen3为代表的大语言模型在自动编程场景下的实用性与信任度具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务