遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g7_run1_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 234294 num_examples: 164 download_size: 101855 dataset_size: 234294 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset contains data related to programming tasks, with each entry having a unique task ID (task_id) and an entry point (entry_point), and records whether the code is executable (is_executable) and correct (is_correct). It provides test result metrics, including the number of tests passed and failed (tests_passed, tests_failed), as well as code quality measures such as Halstead complexity metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (loc, sloc), comment percentage, lexical diversity (TTR), entropy values (shannon_entropy, mean_predictive_entropy, max_predictive_entropy), and the number of function definitions (n_func_defined). The data also includes error type (error_type) and entry point repetition information (entry_point_repeated). The dataset is split into a training set (train) with 164 examples, a total size of approximately 234KB, and a download size of approximately 102KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g7_run1_metrics 数据集图片
构建方式
该数据集立足于代码生成模型评估的研究脉络,通过对待评估模型所生成的代码进行系统性执行与静态分析而构建。具体而言,数据集围绕autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g7_run1这一特定实验配置,收集模型在代码生成任务中的输出样本,对每个样本执行单元测试以判定其可执行性与正确性,并统计通过和失败的测试用例数量。与此同时,借助静态代码分析工具提取Halstead度量、圈复杂度、可维护性指数、代码行数、注释比例等程序结构指标,并计算文本层面的TTR与Shannon熵。通过将执行结果与多维度代码特征相关联,形成一套结构化的评估数据,用以刻画模型生成代码的质量与复杂度分布。
使用方法
使用者可通过HuggingFace datasets库直接加载该数据集,其中训练集包含164个样本,数据文件位于data/train-*路径下。加载后,可依据task_id与entry_point字段对代码生成结果进行分组或定位,利用is_executable与is_correct筛选有效且正确的样本,并借助tests_passed、tests_failed与error_type分析失败模式。静态度量字段如halstead_volume、cyclomatic_complexity、maintainability_index、loc、sloc与comment_percentage可用于研究代码复杂度与可维护性同正确性之间的关联。文本熵指标如shannon_entropy、mean_predictive_entropy与max_predictive_entropy则适合分析模型输出的不确定性与代码质量的关系。该数据集适用于代码生成模型评估、程序理解及软件质量分析等研究场景。
背景与挑战
背景概述
近年来,随着大语言模型在代码生成领域的广泛应用,评估其生成代码的质量与正确性成为软件工程与人工智能交叉研究的关键议题。该数据集由相关研究团队构建,旨在通过多维度指标(如Halstead度量、圈复杂度、可维护性指数等)系统化评估模型生成代码的静态特征与动态执行表现,并引入信息论指标(如香农熵、预测熵)以刻画生成过程中的不确定性。其核心研究问题在于揭示代码生成模型输出质量与代码复杂度、可读性及模型置信度之间的内在关联,为自动化代码评估与模型优化提供量化依据,对推动可信代码生成技术发展具有参考价值。
当前挑战
该数据集所应对的领域问题在于代码生成质量评估长期依赖单一正确性指标,缺乏对代码结构、可维护性及模型不确定性的综合刻画,难以全面反映生成代码的工程可用性。构建过程中,需协调静态代码度量与动态测试执行的异构数据,确保指标计算的一致性;同时,预测熵等指标受模型解码策略影响显著,如何在不同生成配置下保持评估的鲁棒性与可比性构成显著挑战。此外,数据集规模有限,样本覆盖的编程任务类型与复杂度分布尚不均衡,可能制约其泛化评估能力。
常用场景
经典使用场景
在代码生成与程序合成的研究领域中,该数据集通过整合执行正确性、测试通过率、Halstead复杂度、圈复杂度、可维护性指数以及基于信息论的熵度量等多维度指标,为评估大语言模型生成的代码提供了细粒度量化基准。其经典使用场景在于系统性地诊断模型输出代码的功能正确性与结构质量,尤其适用于面向执行结果的代码生成策略对比和错误模式分析。
解决学术问题
该数据集有效回应了代码生成研究中长期存在的评估单一化问题,即仅依赖功能正确性而忽视代码可维护性、复杂性及信息熵等深层属性。通过提供涵盖执行反馈与静态度量的复合标注,它支撑了对模型生成代码质量的多元回归分析与错误归因研究,推动了从二元正确性判定向多维度质量评估的范式转变,为构建更鲁棒的代码智能系统奠定了数据基础。
实际应用
在软件工程自动化与智能编程助手研发实践中,该数据集可用于训练和验证代码质量预测模型、构建缺陷检测与修复推荐系统,以及优化基于执行反馈的代码生成策略。其度量指标可直接服务于持续集成环节中的代码审查辅助,帮助开发者识别高复杂度、低可维护性的生成代码片段,从而提升软件交付的整体可靠性与可维护性。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型生成代码的质量评估与自省能力研究,通过整合Halstead度量、圈复杂度、可维护性指数及代码熵等多元软件工程指标,构建了细粒度的执行正确性与代码质量关联分析框架。近期研究依托此类数据探索模型在代码生成任务中的不确定性校准与信任策略优化,尤其关注预测熵与测试通过率之间的映射关系,以揭示模型置信度与代码可靠性的内在联系。该方向与当前AI代码生成的可解释性、自我修复及人机协作编程等热点议题紧密关联,为构建更鲁棒的代码智能系统提供了实证基础,对提升自动化编程的工业部署安全性具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务