遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g8_run0_metrics

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和评估的数据集,包含多个特征字段,如任务ID、入口点函数、代码可执行性、正确性、测试通过和失败数量、错误类型,以及一系列代码复杂度度量指标(包括Halstead词汇量、长度、体积、难度、努力度和时间,圈复杂度,可维护性指数,代码行数,注释百分比等)。此外,还包含词汇多样性、熵值和预测熵等统计信息。数据集适用于机器学习模型训练、代码质量评估或软件工程研究,支持对代码片段进行多维度分析和分类任务。

This dataset is designed for code analysis and evaluation, featuring multiple attributes such as task ID, entry point function, code executability, correctness, number of tests passed and failed, error types, and a range of code complexity metrics (including Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index, lines of code, comment percentage, etc.). It also includes statistical measures like token type ratio, Shannon entropy, and predictive entropy. The dataset is suitable for machine learning model training, code quality assessment, or software engineering research, enabling multi-dimensional analysis and classification of code snippets.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g8_run0_metrics 数据集图片
构建方式
该数据集源自代码生成模型的自动化评估流程,以Qwen3-8B模型为生成引擎,在温度参数0.75与分组数8的采样策略下,对代码任务进行信任度导向的筛选与记录。构建过程中,每个生成样本均经过可执行性判定与测试用例驱动验证,同步提取Halstead度量、圈复杂度、可维护性指数等静态代码特征,以及 token 分布熵和预测熵等模型内在信号。最终形成的164条训练样本,完整保留了任务标识、执行结果与多维量化指标,为代码质量与模型行为分析提供了细粒度数据基础。
特点
数据集以代码生成评估为核心,兼具静态软件度量与动态执行反馈的双重视角。每条记录不仅涵盖任务标识、入口点、可执行性与正确性等基础标签,还系统集成了Halstead系列指标、圈复杂度、可维护性指数、代码行与注释比例等结构特征。同时,词型–形符比、香农熵、平均与最大预测熵等文本与模型不确定性指标进一步丰富了样本的语义与认知维度。测试通过数与失败数、错误类型等字段则直接反映生成代码的功能表现,使数据集在代码质量评估、模型不确定性建模及错误分析等场景中具有多维参考价值。
使用方法
该数据集以HuggingFace Datasets格式发布,用户可通过标准加载接口直接读取训练集,并依据任务标识与入口点字段进行样本定位与分组。实际使用中,研究者可结合is_executable与is_correct字段筛选有效样本,利用tests_passed与tests_failed评估功能正确性,并通过Halstead度量、圈复杂度、可维护性指数等指标开展代码质量建模。token_dict、shannon_entropy及预测熵字段适用于分析模型生成过程中的不确定性分布,而error_type与entry_point_repeated则可用于错误模式归纳与重复生成检测。整体数据可直接用于监督学习、统计分析或基准评测流程。
背景与挑战
背景概述
近年来,大语言模型在代码生成任务中展现出显著潜力,但对其生成代码的质量评估与执行行为分析仍缺乏系统化的度量基准。该数据集由Qwen3-8B模型在策略信任机制下以温度0.75、8次采样运行生成,聚焦于代码可执行性、正确性及多维度软件度量。其核心研究问题在于揭示大模型生成代码的静态属性与动态执行结果之间的内在关联,并探索预测熵、Halstead度量等指标对代码质量的表征能力。该数据集为代码生成评估、模型行为分析及自动化软件工程研究提供了细粒度实证基础,对推动可信代码生成具有参考价值。
当前挑战
该数据集所面向的领域问题在于代码生成质量的自动化评估与错误归因,需同时处理可执行性判定、测试通过率统计及多维度软件度量的语义对齐。构建过程中的挑战尤为复杂:需从模型多次采样输出中稳定提取有效代码,准确解析测试执行结果并分类错误类型,同时计算Halstead复杂度、循环复杂度、可维护性指数及信息熵等异质指标。此外,token字典与预测熵等字段涉及模型内部状态,其提取与对齐要求精确的工程实现,而测试运行时间的缺失进一步增加了时序分析的难度。
常用场景
经典使用场景
在代码生成与程序合成研究领域,该数据集面向基于大语言模型的代码生成质量评估任务,囊括了任务标识、入口点、可执行性、测试通过与否、错误类型及多项代码度量指标,为系统性地刻画模型生成代码的功能正确性与结构特性提供了细粒度记录。其在经典使用场景中充当模型输出评测的基准载体,研究者可依托测试通过与失败计数、Halstead度量族及圈复杂度等维度,对生成代码进行多维交叉分析。
衍生相关工作
围绕该数据集所记录的度量与预测熵信号,后续研究可衍生出代码生成不确定性估计、错误类型自动分类、基于熵的解码策略优化以及代码质量与模型置信度联合建模等方向。相关经典工作多聚焦于以测试通过率为核心的pass@k评估体系,并逐步扩展至融合静态分析、信息论与预测熵的综合评价框架,为代码大模型的可靠性研究提供了可复用的数据基础与方法借鉴。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,针对大语言模型输出代码的质量评估与可执行性分析已成为前沿热点。该数据集聚焦于Qwen3-8B模型在策略信任机制下的代码生成结果,系统性地整合了Halstead度量、圈复杂度、可维护性指数、代码行数以及基于token分布的预测熵等多元指标,为刻画生成代码的结构属性与语义不确定性提供了细粒度视角。当前研究正逐步从单一正确性判定转向涵盖可执行性、测试通过率、错误类型及信息论度量的多维评估框架,该数据集恰好回应了这一趋势,其关联的代码信任策略与熵值分析有助于揭示模型生成行为的内在规律。此类工作对提升自动化编程系统的可靠性、推动可解释性代码生成研究具有显著的参考价值,并为后续构建更鲁棒的代码评估基准奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务