遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run1_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含编程任务相关的数据,用于代码分析和评估。数据特征包括任务ID、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间、错误类型,以及软件度量指标如Halstead复杂度、循环复杂度、可维护性指数、代码行数、注释百分比、TTR、香农熵、预测熵等。这些数据可用于机器学习模型训练,以评估代码质量、执行结果或进行编程任务分类。数据集包含164个训练样本,总大小约226KB。

This dataset contains data related to programming tasks for code analysis and evaluation. The data features include task ID, entry point, executability, correctness, number of passed/failed tests, test running time, error type, as well as software metrics such as Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, TTR, Shannon entropy, and predictive entropy. This data can be used for training machine learning models to evaluate code quality, execution results, or perform programming task classification. The dataset contains 164 training samples with a total size of approximately 226 KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run1_metrics,专为评估代码生成模型在复杂任务中的表现而设计。其构建基于Qwen3-4B模型在信任策略(trust strategy)下,以温度参数1.25和8次生成运行(g8)生成的代码样本,随后对每一代码样本进行可执行性、正确性及测试通过率的多维度验证。数据集还系统地提取了代码的静态软件度量指标,包括Halstead复杂度系列、圈复杂度、可维护性指数、代码行数、注释占比、词元多样性(TTR)以及香农熵与预测熵,以量化代码的语义复杂度和信息结构。所有样本均来自训练集,共包含164条记录,涵盖多类任务标识(task_id)与函数入口点(entry_point),为深入剖析模型生成行为的优劣提供了一个结构严谨、特征丰富的评估基准。
特点
本数据集的一大特色在于其融合了执行结果与静态复杂度两类异质信息,实现了对代码质量的综合刻画。在动态层面,每条样本记录了代码是否可执行、测试通过数与失败数、执行时间及错误类型,直观反映了生成代码的功能正确性。在静态层面,数据集囊括了从Halstead词汇量、体积、难度到圈复杂度与可维护性指数等十余项经典软件工程度量,揭示了代码的内在结构复杂性与可读性。特别地,香农熵与平均预测熵的引入,为从信息论角度评估代码生成的确定性提供了新颖视角。此外,数据集还标注了函数定义数量与入口点是否重复等元信息,便于研究者针对性地分析模型在特定任务上的重复生成或覆盖能力。
使用方法
使用此数据集时,研究人员可将其作为代码生成模型的后验评估工具,通过对比各样本的测试通过率与复杂度指标,识别模型在哪些任务上倾向于生成正确但复杂度较高的代码,抑或简练但功能不全的输出。具体而言,可依据error_type字段筛选失败样本进行错误模式归因分析,或利用halstead_difficulty与cyclomatic_complexity等特征,探索正确性与代码复杂度之间的相关性。数据集以HuggingFace标准格式存储,支持通过datasets库直接加载训练分割,便于与现有机器学习评估流水线集成。建议结合原始任务描述与生成环境,对模型参数(如温度、策略)与输出行为之间的潜在关系进行深入挖掘,以指导后续生成策略的优化。
背景与挑战
背景概述
该数据集名为“autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run1_metrics”,由AutophagyCode团队创建,旨在评估大语言模型(如Qwen3-4B)在代码生成任务中的执行正确性与代码质量。数据集构建于2025年,核心研究问题聚焦于如何通过策略性采样(如信任策略、温度参数t1.25、生成轮次g8)提升代码的语义正确性、复杂度指标及可维护性。其影响力体现在为代码智能领域提供了一种细粒度的评估框架,不仅关注功能正确性(如测试通过/失败数),还引入Halstead复杂度、圈复杂度、香农熵等软件工程指标,弥补了传统代码数据集仅依赖表面准确性或单一度量的不足,推动了对生成代码内在结构质量的系统化研究。
当前挑战
该数据集面临的挑战首先是领域问题层面:现有代码生成评测多基于二元正确性判断,忽略了代码在可读性、维护性、执行效率上的差异,数据集需在有限样本(仅164条训练数据)中平衡多维度质量度量(如Halstead工作量、维护性指数)与功能正确性之间的权衡,避免指标间冲突导致的评估失真。在构建过程中,挑战包括:从Qwen3-4B生成涉及复杂策略组合(信任阈值、温度系数、并行生成轮次)的代码样本,需确保异构策略下输出的一致性与代表性;多质量指标(如token分布、预测熵、注释占比)的自动提取与标准化处理易引入噪声,特别是对非语法错误类型(如逻辑错误)的分类依赖手工标注,增加了数据集的可复现性难度。
常用场景
经典使用场景
该数据集专为评估与调试代码生成模型而设计,特别是在数学推理与程序合成交叉领域。它记录了模型生成的代码片段在可执行性、测试通过率及运行时性能等方面的多维度表现。经典使用场景包括:利用Halstead复杂度、圈复杂度、可维护性指数等静态度量指标,结合测试用例执行结果,系统分析代码生成质量;通过香农熵与预测熵等不确定性指标,研究模型在生成代码时的置信度与准确性之间的关联。
衍生相关工作
该数据集衍生出了一系列面向代码生成质量预测与模型校准的经典工作。例如,研究者基于其片段的度量特征训练分类器,实现了对生成代码是否通过测试的早期预警;另有工作利用香农熵与预测熵的组合,提出了新的模型不确定性校准方法,以提升代码生成器在关键任务中的可靠性。这些成果反过来促进了数据集自身的扩展,形成了包含多种基座模型与采样策略的评测体系。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与质量分析,前沿方向涵盖基于可执行性测试(is_executable、is_correct、tests_passed/tests_failed)的语义正确性验证,结合Halstead复杂度、圈复杂度及可维护性指数等代码度量指标进行多维质量剖析。当前热点事件包括大型语言模型在代码合成中的可信度研究,尤其是通过执行后错误类型(error_type)与熵值特征(shannon_entropy, predictive_entropy)量化模型预测的不确定性,从而指导代码生成策略优化。该数据集为构建鲁棒的代码评估基准提供结构化解空间,对提升AI编程工具的实用性与可靠性具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务