遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码分析相关数据,用于评估编程任务或代码执行性能。数据集特征包括任务ID、入口点、可执行性、正确性、测试通过与失败数量、测试运行时间、错误类型、Halstead复杂度指标(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR、令牌字典、香农熵、预测熵(均值与最大值)、定义函数数量以及入口点重复标志。数据集划分为训练集,包含164个示例,总大小约227KB,下载大小约97KB。

This dataset contains code analysis-related data for evaluating programming tasks or code execution performance. Features include task ID, entry point, executability, correctness, number of tests passed and failed, test run time, error type, Halstead complexity metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR, token dictionary, Shannon entropy, predictive entropy (mean and maximum), number of functions defined, and entry point repetition flag. The dataset is split into a training set with 164 examples, total size approximately 227KB, and download size approximately 97KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run0_metrics,源自对代码生成模型Qwen3-4B在特定策略(trust策略,温度参数1.25,生成7个候选)下输出的自动化评估与度量。数据集构建通过运行生成的代码片段,记录其可执行性、测试通过率、运行时间及错误类型等执行指标,同时整合Halstead复杂度、圈复杂度、可维护性指数等静态代码度量,并纳入香农熵、平均预测熵等基于token的统计特征,形成对代码质量与模型行为的复合刻画。
使用方法
数据集以HuggingFace格式存储,包含一个名为train的分片,默认配置下数据文件位于data/train-*路径下。用户可通过HuggingFace Datasets库加载并解析,利用task_id和entry_point字段进行任务标识,结合is_correct等布尔字段筛选正确或错误生成样例。各数值型指标(如halstead_volume、cyclomatic_complexity、shannon_entropy)可直接用于回归或分类建模,而token_dict字段需额外解析以提取细粒度词频信息,适用于代码质量预测或模型行为分析等研究场景。
背景与挑战
背景概述
近年来,随着大规模语言模型在自动代码生成领域的迅猛发展,如何系统评估与提升生成代码的可靠性与可执行性已成为关键研究课题。autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run0_metrics数据集由相关研究团队于近期构建,旨在深入分析Qwen3-4B模型在特定策略下生成的代码质量。该数据集以164个训练样本为基础,详细记录了每个代码任务的执行状态、测试通过率、运行时错误类型以及多种软件复杂度指标(如圈复杂度、Halstead复杂度、维护性指数等)。其核心研究问题聚焦于理解代码生成模型的输出特性与代码可执行性之间的关联,为后续代码生成模型的优化与可信评估提供了系统化的度量基准,对推动自动编程与软件工程交叉领域的研究具有显著的启发性价值。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,自动代码生成领域长期受困于生成的代码无法通过单元测试或存在隐蔽逻辑错误的问题,当前数据集通过丰富元特征(如测试通过/失败计数、执行时间、熵度量等)为评估代码功能正确性提供了多维度视角,但如何从高维稀疏特征中有效建模代码正确性概率、区分不同错误类型背后的语义原因,仍构成核心挑战。其次,在数据集构建过程中,由于样本量仅164条,且涵盖了来自Qwen3-4B模型单一策略下的输出,数据规模与策略多样性均有限,这可能导致泛化性不足;同时,特征中如token_dict(分词字典)、mean_predictive_entropy等序列级特征的提取依赖模型内部状态,易受解码参数波动影响,增加了度量一致性与噪声控制的难度。
常用场景
经典使用场景
在代码生成与程序合成研究领域,该数据集为评估大型语言模型生成的代码质量提供了多维度的量化指标,涵盖执行正确性、测试通过率、运行时性能以及代码复杂度(如圈复杂度、Halstead度量)等核心维度。研究者常以此为基础,探究模型在生成可执行代码时的可靠性,并对比不同提示策略对代码功能完备性的影响。
解决学术问题
该数据集有效解决了代码生成领域长期缺乏细粒度质量评估基准的问题。通过整合编译执行结果与软件工程度量指标,支持分析模型输出代码的可用性、维护性及熵值特性,推动了从单一正确性判定向多维度质量评估的范式转变。其意义在于为可解释代码生成、错误类型诊断及生成代码的自动化验证提供了标准化数据支撑。
实际应用
在实际落地场景中,该数据集可用于构建智能编程助手的性能监控系统,通过追踪代码测试通过率、运行耗时与复杂度变化,辅助开发者筛选更高效的代码生成策略。此外,基于该数据集训练的异常预测模型能够识别模型输出中的潜在错误模式,从而在持续集成管道中实现代码质量的自动化预警与回归测试。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型输出质量的细粒度评估,融合了代码静态复杂度指标(如Halstead复杂度、圈复杂度、可维护性指数)与动态执行正确性(通过率、执行时间),并创新性地引入预测熵与香农熵来衡量模型输出的不确定性。当前前沿研究方向正从单一任务正确性走向多维度可信度评估,该数据集通过量化代码结构性、可维护性及预测置信度,为构建鲁棒且可解释的代码生成系统提供关键基准,尤其在大型语言模型(如Qwen3-4B)生成代码的可靠性验证中具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务