遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g9_run1_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 230676 num_examples: 164 download_size: 100254 dataset_size: 230676 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset contains 164 programming task samples for evaluating code quality and complexity. Each sample includes basic attributes such as task ID, entry point, executability, correctness, number of tests passed/failed, error type, as well as code metrics like Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), Shannon entropy, predictive entropy (mean and maximum), number of defined functions, and entry point repetition. The dataset is suitable for code analysis, machine learning model training, or software engineering research, aiming to assess code readability, maintainability, and execution performance through quantitative metrics.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g9_run1_metrics 数据集图片
构建方式
在代码生成与程序理解研究中,对模型输出进行细粒度质量评估依赖于对代码执行结果与静态属性的系统刻画。该数据集以Qwen3-8B模型在信任策略下生成的代码样本为对象,通过自动化执行与度量流程完成构建。每条样本记录任务标识与入口点,标记代码是否可执行以及是否正确,并统计通过和失败的测试数量;在静态分析层面,提取Halstead词汇量、长度、体积、难度、工作量与时间等指标,同时计算圈复杂度、可维护性指数、代码行数、注释比例、类型-标记比、香农熵以及预测熵的均值与最大值等特征。最终以train划分组织为164条样本,形成可用于代码质量与模型行为分析的标准化数据集合。
特点
该数据集的特点体现在多维度的代码质量描述体系上。其字段设计兼顾执行层面与结构层面,既包含可执行性、正确性与测试通过情况等运行时信号,也涵盖Halstead度量、圈复杂度、可维护性指数与注释比例等经典软件工程指标。同时,数据集引入信息论视角的香农熵与预测熵特征,并记录入口点重复情况与函数定义数量,从而能够刻画代码的复杂度、可维护性、词汇多样性以及模型生成的不确定性。任务标识与入口点字段为跨样本对比和复现实验提供索引,使数据集适用于模型评估、错误类型归因及代码质量预测等研究场景。
使用方法
使用该数据集时,研究者可通过HuggingFace datasets库加载train划分,直接访问任务标识、入口点、执行正确性与测试统计等字段,并利用Halstead度量、圈复杂度、可维护性指数、代码行数、注释比例、TTR、香农熵及预测熵等特征开展分析。数据可用于训练或评估代码质量分类模型,也可用于比较不同策略下模型生成代码的复杂度与正确性差异。在具体流程中,可将is_correct与error_type作为监督标签,将静态与信息论指标作为输入特征,进行相关性分析、错误预测或可维护性建模;同时可结合task_id与entry_point进行分组统计与重复性检验。
背景与挑战
背景概述
近年来,代码生成模型的评估日益依赖于细粒度、多维度的量化指标。该数据集由匿名研究团队于2024年构建,旨在通过Qwen3-8B模型在策略信任温度0.75、组规模9、首轮运行条件下,系统记录代码生成任务的可执行性、正确性及多项软件度量。其核心研究问题在于揭示大语言模型在代码生成过程中的质量特征与失败模式,为模型鲁棒性分析提供基准。数据集涵盖164个训练样本,每个样本包含任务标识、执行状态、测试通过数、Halstead度量、圈复杂度、可维护性指数等二十余维特征,并引入预测熵与Shannon熵以刻画模型不确定性。该数据集为代码智能领域的可解释性评估与模型选择提供了结构化基础,对自动化编程教育及软件工程研究具有参考价值。
当前挑战
该数据集所应对的领域问题在于代码生成模型输出的多维度质量评估与错误归因。具体挑战体现于三方面:其一,代码正确性判定需兼顾可执行性与单元测试通过情况,而测试用例覆盖不足或环境差异易导致误判;其二,Halstead度量、圈复杂度等静态指标对生成代码的适用性尚存争议,部分指标在短片段代码中稳定性欠佳;其三,预测熵特征依赖模型内部状态,跨模型迁移时其解释力可能衰减。构建过程中,研究人员需平衡特征完备性与存储开销,确保164个样本的标注一致性,并处理空值运行时间与错误类型分类的模糊边界。此外,策略信任温度与组规模等超参数的选择对指标分布的影响尚未充分消融,可能限制数据集的普适性。
常用场景
经典使用场景
在代码生成与程序合成研究领域,该数据集主要被用于评估大语言模型在代码生成任务中的表现。其经典使用场景是对模型生成的代码进行多维度的质量度量与正确性验证,通过tests_passed、tests_failed、is_correct等字段反映生成代码的功能正确性,并借助halstead复杂度指标、圈复杂度、可维护性指数等软件工程度量手段,对代码的结构质量与可读性进行量化分析。研究者通常将其作为基准评测集合,系统考察模型在不同编程任务上的综合生成能力。
衍生相关工作
围绕该数据集所构建的评测框架,衍生出一系列聚焦代码质量度量的研究工作。部分研究据此探讨了生成代码复杂度与模型规模之间的关联规律,另有工作将信息熵指标引入代码生成评估以衡量模型输出的不确定性。这些衍生的经典工作共同丰富了代码生成评测的方法论体系,为后续构建更全面的代码质量评估基准奠定了基础。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,针对大语言模型输出代码的可执行性与正确性评估正从单一通过率指标向多维度静态与动态特征融合的方向演进。该数据集依托Qwen3-8B模型在信任策略下的生成轨迹,系统采集了Halstead度量、圈复杂度、可维护性指数、代码行数、注释比例、词汇多样性、香农熵及预测熵等二十余项代码质量与不确定性指标,为探究模型内在置信度与代码结构属性之间的映射关系提供了细粒度实证基础。当前前沿研究聚焦于利用此类多维指标构建代码错误预测模型与生成质量归因框架,进而揭示模型推理过程中的不确定性传播机制,对提升自动化编程系统的可靠性与可解释性具有关键支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务