遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务的执行结果(如可执行性、正确性、通过/失败测试数)以及多种代码复杂度指标(包括Halstead复杂度、循环复杂度、可维护性指数、代码行数、注释比例、信息熵等),用于分析代码质量和正确性。

This dataset contains code task execution results (e.g., executability, correctness, number of tests passed/failed) and various code complexity metrics (including Halstead complexity, cyclomatic complexity, maintainability index, lines of code, comment percentage, entropy, etc.) for analyzing code quality and correctness.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run1_metrics 数据集图片
构建方式
该数据集基于'autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run1_metrics'命名,源自对Qwen3-4B模型在特定策略(trust策略,温度参数t1.1,生成轮数g4)下运行结果的评估与记录。数据集以任务ID(task_id)和函数入口点(entry_point)为索引,通过自动化测试框架判定代码的可执行性(is_executable)与正确性(is_correct),并统计测试通过数(tests_passed)与失败数(tests_failed),辅以运行时间(test_run_time_ms)与错误类型(error_type)的标注。此外,还系统性地计算了代码的Halstead复杂度指标(包括词汇量、长度、体积、难度、工作量与时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc与sloc)、注释比例(comment_percentage)以及文本冗余度(TTR)与信息熵(shannon_entropy)等多元特征,为代码质量评估提供了全面量化视角。
特点
本数据集最显著的特点在于其多维度的代码度量体系:不仅涵盖传统测试执行结果(如通过率与错误类型),更深度融合了软件工程领域的经典复杂度指标(Halstead与McCabe度量)与现代信息论特征(熵值与预测熵),从而实现对代码生成质量的精细化刻画。数据共包含164个训练样本,每个样本均携带25个结构化特征字段,其中包含丰富的浮点型与整型数值特征,适合进行统计分析与机器学习建模。值得注意的是,数据集还保留了原始代码的token字典(token_dict)与函数定义数量(n_func_defined)等信息,为后续的语义与结构分析提供了可能。整体上,该数据集以高维度、小规模、多粒度信息融合为特色,适用于探究代码生成模型的行为模式与输出质量。
使用方法
使用者可通过HuggingFace Datasets库加载该数据集,默认配置下仅有训练集(train)分割,共164条记录。加载后可直接访问各特征字段,例如利用'is_correct'与'tests_passed'对模型输出进行正确性分析,或借助'cyclomatic_complexity'与'halstead_volume'等指标开展代码复杂度研究。由于数据以Parquet格式存储(路径为'data/train-*'),支持高效读取与过滤操作。建议使用pandas或datasets库进行数据转换,再进一步应用于回归预测、分类任务或可视化分析中。同时,数据集可与原始代码生成任务关联,用于验证不同策略参数对代码质量的影响,为Prompt工程与生成策略优化提供实证基础。
背景与挑战
背景概述
该数据集由研究团队基于Qwen3-4B模型与trust策略生成,旨在评估代码生成模型在自动化编程任务中的表现。数据集包含164个训练样本,涵盖了任务标识符、代码可执行性、正确性、测试通过失败统计、代码复杂度指标(如圈复杂度、Halstead度量)以及信息熵等多元特征。其创建根植于代码智能领域对细粒度生成质量评估的迫切需求,通过引入代码结构度量与预测熵指标,为理解大语言模型在编程任务中的行为提供了新的分析维度。该数据集的发布推动了代码生成模型评估从简单的正确性判断向功能、复杂度与可维护性综合评估的转变。
当前挑战
该数据集所面对的领域挑战在于,现有代码生成评估指标往往仅关注功能正确性,而忽视了代码质量、复杂度与可解释性等关键维度。构建过程中的挑战则包括:如何系统性地收集具备多元标注的代码样本,如何准确计算代码复杂度与熵值等高级特征,以及如何确保测试用例的充分性与执行环境的稳定性。此外,由于样本量较小(仅164条),模型评估的统计显著性与泛化能力面临着严峻考验,需要谨慎设计实验以避免过拟合与偏差。
常用场景
经典使用场景
在大型语言模型(Large Language Model, LLM)的代码生成与评估研究中,该数据集扮演着核心基准的角色。它聚焦于代码生成的正确性与可执行性,通过记录每个代码片段的任务标识、入口函数、测试通过数、执行错误类型等关键指标,为评估模型在自动编程任务中的表现提供了精细化的度量工具。研究者常借助该数据集衡量模型所生成代码的功能正确性、鲁棒性以及执行效率,从而系统性地剖析模型在复杂编程逻辑推理中的能力边界。
解决学术问题
该数据集着力解决了代码生成领域长期存在的一个学术难题:如何超越简单的语法层面匹配,实现对生成代码的语义正确性与执行效能的综合定量评估。传统方法往往依赖人工检测或仅关注代码结构相似性,难以客观反映模型产出的实际可用性。通过引入Halstead复杂度、圈复杂度、可维护性指数以及香农熵等软件工程与信息论指标,该数据为计算程序的质量与可理解性提供了多维度的量化方案,推动了从“代码是否看起来对”到“代码是否真正能运行且易于维护”的学术范式转变。
衍生相关工作
该数据集的出现催生了一系列关于代码质量与生成系统可信度衡量的衍生工作。研究界借助其丰富的度量维度,开发出了更精准的代码错误预测模型与自动调试框架,旨在及时发现并修正模型输出中的逻辑缺陷。此外,基于数据集中的复杂度与熵值分析,衍生出针对不同编程语言和任务类型的鲁棒性增强策略,以及面向可解释性代码生成的新评估范式,这些工作共同推动着AI辅助编程系统向更安全、更高效的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务