遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和评估的数据集,包含164个训练样本,每个样本具有多个特征字段,如任务ID(task_id)、入口点(entry_point)、是否可执行(is_executable)、是否正确(is_correct)、测试通过数(tests_passed)、测试失败数(tests_failed)、测试运行时间(test_run_time_ms)、错误类型(error_type)、Halstead复杂度指标(如词汇量、长度、体积、难度、努力程度、时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc、sloc)、注释百分比(comment_percentage)、类型标记比(TTR)、令牌字典(token_dict)、香农熵(shannon_entropy)、平均预测熵(mean_predictive_entropy)、最大预测熵(max_predictive_entropy)、定义函数数(n_func_defined)和入口点重复性(entry_point_repeated)。这些特征用于评估代码质量、测试执行结果和软件工程度量,适用于代码测试、质量保证和研究目的。

This dataset is designed for code analysis and evaluation, consisting of 164 training examples. Each example includes multiple features such as task_id, entry_point, is_executable, is_correct, tests_passed, tests_failed, test_run_time_ms, error_type, Halstead complexity metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic_complexity, maintainability_index, lines of code (loc, sloc), comment_percentage, type-token ratio (TTR), token_dict, shannon_entropy, mean_predictive_entropy, max_predictive_entropy, number of functions defined (n_func_defined), and entry_point_repeated. These features are used to assess code quality, test execution outcomes, and software engineering metrics, making it suitable for code testing, quality assurance, and research purposes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run2_metrics 数据集图片
构建方式
该数据集基于代码生成与执行评估框架构建,旨在对Qwen3-8B模型在特定策略(strategy_trust)下生成的代码质量进行系统性度量。数据集采用自动化流程,首先由模型针对给定编程任务生成代码,随后在受控环境中执行并记录测试结果。构建过程通过提取任务标识符(task_id)、入口函数(entry_point)等元信息,并结合执行状态(如是否可执行、测试通过/失败数量、运行耗时等)来标注每条样本。此外,还计算了代码的多种复杂度与质量指标,包括Halstead度量、圈复杂度、可维护性指数以及代码行数等,从而形成多维度的结构化评价数据。整个数据集仅包含训练集(train)划分,共164条样本,尺寸约为238KB。
使用方法
该数据集适用于多种代码生成模型的评估与对比研究。用户可直接加载HuggingFace数据集,通过JSON格式的train-*文件获取164条结构化样本。每条样本包含任务ID、执行正确性标志及多项代码度量值,便于进行多维度分析。研究人员可利用该数据集分析模型生成代码的测试通过率与代码复杂度之间的关系,或探究预测性熵与代码可维护性之间的关联。此外,数据集也可用于训练代码质量预测模型或作为代码修复任务的基线。使用时注意字段类型差异,部分数值字段(如test_run_time_ms)可能为空值,需根据具体分析需求做适当预处理。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run2_metrics,由相关研究团队基于Qwen3-8B模型在代码生成任务上构建,创建时间可追溯至近期大语言模型与代码智能的交叉研究热潮。核心研究问题聚焦于评估和量化语言模型生成代码的可执行性、正确性及内在质量,通过引入Halstead复杂度、圈复杂度、维护性指数等软件工程度量指标,深入探讨模型输出代码的可靠性。该数据集以164个训练样本的规模,为代码生成领域的可信度评估提供了微观视角,有助于推动大模型在自动化编程场景中的鲁棒性研究。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题:代码生成模型生成的代码常存在可执行性低下、逻辑错误频发以及测试通过率不稳定等难题,亟需通过多维度的度量体系(如测试通过/失败数、运行时间、熵值等)进行精准表征。构建过程中遇到的挑战尤为突出,包括如何从有限样本(164条)中提取具有统计意义的代码质量特征,如何确保Halstead体积、环复杂度等传统软件度量指标在短代码片段上的适用性,以及如何处理稀疏的失败类型和缺失的运行时间数据,这些因素共同增加了数据集构建与分析的复杂性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型在算法任务上的行为度量与质量评估,经典使用场景包括对模型生成的代码片段进行多维度的静态分析。研究者常利用其丰富的软件度量指标,如圈复杂度、Halstead难度与维护指数,来系统性地评估代码的可读性、可维护性以及结构复杂度。同时,通过记录测试通过率、运行时间及错误类型,该数据集为衡量生成代码的功能正确性与执行效率提供了可靠的基准。这一设计使得它成为探究生成代码质量与模型特性之间关联的理想资源。
解决学术问题
该数据集有效解决了代码生成领域中模型输出质量难以量化与比较的学术难题。通过整合复杂度度量与执行结果,它支持研究者深入分析不同生成策略(如温度调节、采样方法)对代码功能正确性及结构质量的影响。此外,它促进了关于生成代码的泛化能力、鲁棒性以及是否倾向于重复解决相同任务的实证研究。该数据集的提出,为建立更加科学、全面的代码生成评估体系奠定了重要基础,推动了代码智能领域方法论的发展。
实际应用
在实际应用中,该数据集可用于自动化代码审查系统的开发与优化。通过训练分类器识别具有低可维护性或高错误风险的生成代码片段,能够辅助开发者在集成前进行质量筛选。同时,它能够支持代码生成服务的性能监控工具,通过持续跟踪如命中率、执行效率等指标,动态调整生成策略。在教育场景下,它还可助力于编程辅导系统,根据生成代码的复杂度与正确性,向学习者提供更具针对性的反馈与纠错建议。
数据集最近研究
最新研究方向
当前,在代码生成与自动编程领域,研究人员正致力于构建细粒度的代码质量评估体系,以突破传统仅依赖功能正确性判定的局限。autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g4_run2_metrics数据集正是这一前沿方向的典型代表,它深度融合了Halstead复杂度、圈复杂度、可维护性指数、香农熵等二十余项软件工程指标,以及预测性熵值等大模型可信度度量,为量化分析生成代码的认知复杂度与结构优雅性提供了稀缺的标注资源。该数据集的出现,呼应了近期业界对AI生成代码安全性与可维护性的热点关切,尤其是在自动驾驶、金融交易等高风险场景中,仅通过测试用例的代码往往隐藏着难以察觉的逻辑脆弱性。通过对164个精心构造的训练样本进行多维度剖析,研究者得以探索模型在复杂约束下的决策边界,推动代码智能从“能运行”向“可信赖”的关键跨越。这一资源不仅为构建鲁棒的代码质量预测器奠定了基石,更为理解大模型在编程任务中的内在不确定性开辟了新的实验窗口。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务