遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务相关的执行和测试数据,用于分析和评估代码质量。特征包括任务标识、入口点、可执行状态、正确性、通过和失败的测试数量、测试运行时间、错误类型,以及Halstead度量(如词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型标记比)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量、入口点重复性等。数据集适用于代码复杂度分析、可维护性评估、自动化测试和机器学习模型训练。

This dataset contains execution and testing data related to code tasks, designed for analyzing and evaluating code quality. Features include task ID, entry point, executable status, correctness, number of tests passed and failed, test run time, error type, as well as Halstead metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, predictive entropy (mean and maximum), number of functions defined, and entry point repetition. The dataset is suitable for code complexity analysis, maintainability assessment, automated testing, and machine learning model training.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run0_metrics 数据集图片
构建方式
该数据集基于AutophagyCode-D-Held-Out数据集构建,聚焦于代码补全任务的执行结果评估。原始数据通过Qwen3-4B模型在特定策略(trust)下生成,并经由严格的自动化测试框架进行验证。构建过程中,每条样本均被赋予唯一的task_id,并记录其对应函数入口点(entry_point)。通过编译与运行测试,数据集保留了is_executable、is_correct、tests_passed、tests_failed等执行状态指标,同时剔除错误类型(error_type)标注为异常的样本,最终形成包含164条训练样本的精细化评估集合。
使用方法
数据集以HuggingFace Datasets标准格式存储,内含单一训练集(train split),共164条样本,总大小约217KB。用户可通过datasets.load_dataset()函数直接加载,并利用features字段中定义的string、bool、int64及float64类型字段进行后续分析。推荐用于评估代码生成模型的正确性与效率,或作为代码复杂度建模、可维护性预测等任务的基准数据。数据集占用空间较小,可便捷集成至Python数据处理管道中,配合pandas或numpy等工具进行特征工程与模型训练。
背景与挑战
背景概述
在代码生成与自动化程序修复领域,随着大语言模型(LLM)的迅猛发展,如何系统评估生成代码的可执行性、正确性及内在质量已成为关键议题。该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g10_run0_metrics,由相关研究团队创建,旨在针对Qwen3-4B模型生成代码的细粒度性能与质量进行多维剖析。核心研究问题聚焦于衡量模型在特定策略(如信任阈值t1.25与生成数量g10)下的代码可靠性,通过记录测试通过/失败数量、执行时间、错误类型以及Halstead复杂性、圈复杂度、维护性指数等软件工程指标,为代码生成模型的鲁棒性评估提供结构化依据。该数据集的推出为探索LLM在代码任务中的局限性以及优化生成策略奠定了重要基础,对代码智能领域的可复现研究具有推动意义。
当前挑战
该数据集所解决的核心挑战在于,现有代码生成评测多关注单一通过率,缺乏对代码执行生态的全景刻画,尤其难以揭示生成代码在软件工程层面的可维护性与认知复杂度。具体挑战包括:1) 构建过程中,需从模型原始生成结果中提取大量动态执行信息如运行时间、错误类型及静态复杂度度量,这要求高效且稳健的自动化评测管线;2) 数据量仅含164个训练样本,样本稀疏性可能导致统计偏差,影响泛化性结论的可靠性;3) 领域问题方面,如何平衡代码通过率与代码质量(如圈复杂度、注释比例等)之间的关系,是评估生成策略时待解决的核心矛盾,当前数据集体系为此类权衡分析提供了第一手资料。
常用场景
经典使用场景
该数据集专为代码生成模型的性能评估与行为分析而设计,核心使用场景聚焦于大语言模型在算法编程任务中的可信度与鲁棒性检验。通过汇集164个多类型编程问题及其对应的模型生成代码,数据集提供了执行正确性、测试通过率、运行耗时等关键指标,为衡量模型输出质量提供了多维度的量化标尺。研究者可基于此数据集系统性地剖析模型在代码生成过程中的成功模式与失败诱因,从而推断其内在的推理能力与知识边界。
解决学术问题
该数据集有效回应了当前大语言模型研究中关于生成代码可信度评估的迫切需求。传统方法往往仅关注代码的语法正确性,而忽视了模型输出背后的不确定性。通过引入预测熵、代码复杂度、可维护性指数等精细化的软件度量指标,该数据集使研究者能够深入探究模型在何时、因何产生不可靠输出,进而揭示模型在复杂逻辑推理、边界条件处理及算法选择上的潜在缺陷。这为构建更加稳健、透明的代码生成模型奠定了数据基础。
实际应用
在实际应用层面,该数据集可被直接用于自动化编程辅助系统的质量监控与迭代优化。例如,软件工程团队可利用其评估指标,筛选出模型回答中最为可靠、易于维护的代码片段,并将其融入持续集成流程。此外,数据集中关于错误类型的标注和测试失败率的统计,能够帮助开发者在部署代码生成模型前,精准识别其在特定领域(如算法竞赛题、业务逻辑实现)中的弱点,从而有针对性地调整模型参数或进行微调,显著提升实际开发效率。
数据集最近研究
最新研究方向
在自动编码与代码智能领域,该数据集聚焦于代码生成模型的可信度评估与输出质量剖析,融合了Halstead复杂度、圈复杂度、可维护性指数等软件度量指标与香农熵、预测熵等不确定性量化手段。结合大语言模型在代码生成中的广泛应用,该数据集为探究模型输出在语法正确性、逻辑完备性之外的深层结构合理性与认知不确定性提供了关键基准,尤其契合当前对AI生成代码可靠性与可维护性的热点关注,对推动可信代码生成与智能编程助手的评估体系完善具有前瞻性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务