遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个示例,用于代码质量评估或软件工程分析,涵盖任务ID、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间、错误类型、Halstead软件度量(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型标记比)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量、入口点重复性等特征。数据集大小为247,143字节,下载大小为110,666字节,仅包含训练分割。

This dataset contains 164 examples for code quality assessment or software engineering analysis, featuring task ID, entry point, executability, correctness, tests passed/failed counts, test run time, error type, Halstead software metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, predictive entropy (mean and max), number of functions defined, and entry point repetition. The dataset size is 247,143 bytes, with a download size of 110,666 bytes, and includes only a train split.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run1_metrics 数据集图片
构建方式
该数据集是针对代码生成任务进行细粒度评估与质量分析的产物,其构建源于对Qwen3-4B模型在特定代码生成策略下的输出结果进行系统性评测。构建过程首先收集模型在多个编程任务上的生成代码,随后通过执行测试用例获取正确性指标,包括测试通过数与失败数、执行时间等信息;同时,利用静态分析工具计算代码的Halstead复杂度、圈复杂度、可维护性指数等软件度量指标,并引入信息论视角的香农熵与预测熵来量化代码的语义不确定性。最终将任务标识、入口函数、正确性与复杂度特征整合为结构化记录,形成包含164条训练样本的精炼评测集。
特点
该数据集最为显著的特征在于其多维度、跨层次的质量刻画能力。它不仅保留了传统的正确性标签与执行结果,还深度融入了从代码结构复杂度到信息熵的丰富度量体系,涵盖词汇量、长度、难度所需脑力时间等Halstead系列指标,以及行数、注释比例、圈复杂度和可维护性指数。尤为独特的是,它采用TTR(类符/形符比)和多种预测性熵值,从语言多样性与模型不确定性角度提供了新颖的分析维度。此外,数据集中包含is_executable与entry_point_repeated等布尔特征,可用于识别代码的可执行性与函数重复情况。
使用方法
该数据集主要面向代码生成模型的评估与分析场景。用户可通过加载train分片获取全部164条样本,利用task_id与entry_point字段定位具体任务,结合is_correct、tests_passed等字段快速判断模型输出正确性。对于深入分析,可借助Halstead复杂度、圈复杂度等特征研究模型在不同代码结构下的表现差异,或使用香农熵、预测熵等特征探索模型输出的不确定性分布。数据集兼容常见的机器学习框架,既可直接用于模型基准测试,也可作为代码质量预测任务的训练数据,或用于构建代码生成模型的行为分析报告。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,依托Qwen3-4B模型在代码生成任务中引入信任策略(trust strategy)进行微调与评估,旨在系统性地探究大语言模型生成代码的可信度与质量。数据集包含164条训练样本,每条样本不仅记录任务标识、入口函数、执行结果等基本信息,还纳入了Halstead复杂度度量、圈复杂度、可维护性指数、Shannon熵以及预测熵等多项软件工程与信息论指标,为量化分析代码的语义正确性、结构复杂度与不确定性提供了多维度数据支撑。这一开创性的工作填补了代码生成领域在细粒度可信评估数据集方面的空白,对大模型代码生成的安全性与可靠性研究具有重要的推动意义。
当前挑战
该数据集所应对的核心领域挑战在于大语言模型生成的代码往往缺乏可解释性与可靠性,难以在实际部署中确保语义正确与安全执行。数据集构建过程中面临多重技术难题:首先,需要从海量无标签代码中精心筛选并标注出能够反映模型生成代码可信度的特征,如执行结果、测试通过率及错误类型;其次,需整合Halstead复杂度、圈复杂度等静态度量与Shannon熵、预测熵等动态信息指标,构建高维特征空间以量化代码质量;最后,数据规模仅164条样本,如何在有限数据下平衡特征多样性、避免过拟合并确保评估的统计显著性,亦是亟待突破的瓶颈。
常用场景
经典使用场景
在代码生成与智能编程系统的研究中,该数据集为评估模型生成代码的功能正确性与质量提供了精细化基准。它记录了大语言模型 Qwen3-4B 在特定策略指示下对编程问题的解答结果,涵盖从基础语法执行到多维软件度量指标。研究者可利用该数据集,针对模型生成代码是否通过测试、执行效率以及代码复杂度等维度进行系统分析。经典使用场景包括:对比不同推理策略对代码正确性的影响,分析代码可维护性与复杂度的平衡关系,以及探索模型在复杂算法任务中的稳定性与鲁棒性。数据集的结构化特征使得它成为代码质量评估与模型能力剖析的重要支撑资源。
衍生相关工作
基于该数据集的结构与评价框架,已衍生出诸多富有启发性的研究方向。研究人员可借鉴其多维度代码度量体系,构建更全面的代码质量预测模型,探索预先评估生成代码质量的方法,从而避免低质量代码进入测试阶段。该数据集的实验设置也催生了针对推理策略的比较研究,例如探索信任衰减策略与代码生成能力之间的非线性关系。此外,部分工作将模型预测熵与代码复杂度指标结合,开发用于检测模型幻觉与生成不稳定性的信号机制。这些衍生工作不仅拓展了代码度量理论的应用边界,也为构建更可靠、更可解释的代码生成智能体奠定了方法论基础。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可信任度量衡体系构建,整合了Halstead复杂度、圈复杂度、可维护性指数及香农熵等软件工程经典指标,以及预测熵与测试通过率等多维评价维度。近期前沿研究正将此类细粒度代码质量数据集用于训练代码智能体的自我纠错与策略优化机制,特别是在部署大语言模型进行代码生成时,该数据集提供的结构化反馈信号(如错误类型分布、测试运行耗时等)可有效支撑模型的可信度校准与鲁棒性提升。随着AI生成代码在工业界的广泛应用,该数据集所承载的从语义正确性到代码健壮性的全链路评估范式,正成为连接大模型生成能力与软件开发可审计性的关键桥梁,对推动负责任的AI代码合成具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务