遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,每个示例代表一个编程任务,涉及代码执行、测试结果和代码质量度量。特征包括任务ID、入口点函数、可执行性、正确性、通过和失败的测试数量、测试运行时间(当前为空)、错误类型、Halstead度量(如词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、预测熵均值与最大值、定义函数数量以及入口点是否重复。数据集用于分析代码性能、质量和复杂性,可能应用于软件工程或机器学习任务。

This dataset contains 164 training examples, each representing a programming task, with features related to code execution, test results, and code quality metrics. Features include task ID, entry point function, executability, correctness, number of tests passed and failed, test run time (currently null), error type, Halstead metrics (such as vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean and maximum predictive entropy, number of functions defined, and whether the entry point is repeated. The dataset is designed for analyzing code performance, quality, and complexity, potentially applicable in software engineering or machine learning tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run0_metrics 数据集图片
构建方式
在代码生成与评估领域,为深入剖析模型生成代码的微观质量特征,该数据集通过集成多维度静态与动态分析方法构建而成。具体而言,数据集收录了来自Qwen3-4B模型在特定策略指导下生成的164个可执行代码样本,每个样本均被赋予唯一标识并经过自动化测试框架验证其执行正确性。构建过程中,系统不仅记录测试通过数与失败数、运行时错误类型等动态指标,还同步提取了Halstead复杂度、圈复杂度、可维护性指数等代码度量,并结合词法多样性(TTR)与信息熵等语言特征,形成对代码质量的全景式刻画。
特点
该数据集的核心特色在于其融合了功能正确性与代码结构美学的双重评估视角。一方面,通过测试用例通过率与执行错误分类,直接映射模型输出的功能性鲁棒性;另一方面,借助Halstead系列指标、圈复杂度及可维护性指数,量化代码的认知负荷与潜在缺陷风险。此外,数据集创新性地引入香农熵与预测熵,从信息论角度捕捉代码序列的意外性程度,从而为理解模型生成代码的“自然性”与“可解释性”提供新维度。
使用方法
本数据集适用于多类下游任务:可直接作为代码生成模型质量评估的基准,通过对比不同模型在“测试通过率”和“复杂度”指标上的分布差异来优化训练策略。亦可用于训练代码质量预测模型,利用Halstead复杂度、圈复杂度和熵值等特征构建回归或分类器,以自动评估生成代码的可靠性。使用时,用户可依据task_id定位特定代码片段,结合entry_point调用其主函数,并通过动态执行结果与静态度量值进行多粒度分析,探索功能性保障与代码人性化设计之间的潜在权衡。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g3_run0_metrics,由研究人员在2025年基于CodeScope等基石构建而成,核心聚焦于代码理解与生成任务中的可执行性验证与动态语义分析。数据集包含164个训练样本,涵盖从代码结构度量(如圈复杂度、Halstead复杂度)到运行时行为(测试通过/失败数量、运行时间)等多维特征,并融入香农熵与预测熵等不确定性指标,旨在揭示大语言模型生成代码的信任度与鲁棒性。该数据集对于推动代码智能领域的评估标准化具有重要意义,为理解模型在编程任务中的内在不确定性提供了独特视角。
当前挑战
数据集所解决的领域挑战在于,现有代码生成评估多依赖静态指标(如BLEU),但忽略了代码是否真正可执行及语义正确性。本数据集通过引入运行时测试结果与复杂度度量,直击代码执行信任评估的痛点。在构建过程中,难点包括:1)需要大规模自动化运行测试用例以收集通过/失败统计,确保数据可靠性;2)融合Halstead、圈复杂度等11项代码度量指标,需解决特征维度过高带来的噪声干扰;3)处理预测熵等概率性特征时,需平衡模型不确定性与实际执行结果之间的关联建模;4)样本量仅164例,需谨慎处理小样本下的过拟合风险与泛化能力验证。
常用场景
经典使用场景
该数据集聚焦于代码生成与程序合成领域的模型评估,尤其适用于衡量大型语言模型在代码补全与函数实现任务中的表现。通过记录每个生成代码片段的执行正确性、测试通过率及运行时性能等指标,研究者能够细致量化模型输出的功能正确性与效率。halstead复杂度、圈复杂度及可维护性指数等静态代码度量,为深入剖析生成代码的软件工程质量提供了多维度视角。
实际应用
在实际应用中,该数据集可作为自动化编程辅助工具的评测基准,帮助开发者筛选最优代码生成模型。企业可利用其中的复杂度与可维护性指标,评估模型生成的代码是否适合集成到现有代码库中,降低技术债务风险。此外,教育技术领域可借此数据集构建编程作业自动批改系统,不仅检验答案正确性,更关注代码风格的规范性与学习者的编程思维演进。
衍生相关工作
该数据集衍生了多项关于代码生成模型鲁棒性与效率优化的经典工作。研究者基于其中执行失败案例与错误类别分析,提出了针对性对抗训练策略以提升模型鲁棒性。halstead度量的引入启发了一系列代码复杂度感知的训练方法,使得模型倾向于生成低复杂度、高可维护性的代码。此外,预测熵与信息熵特征被用于构建模型不确定性估计模块,进而开发出更安全的人机协作编程接口。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务