遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g8_run1_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 231210 num_examples: 164 download_size: 101124 dataset_size: 231210 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset contains 164 training samples for programming task evaluation, with features including task ID, entry point, executability, correctness, number of tests passed/failed, error type, code complexity metrics (e.g., Halstead measures, cyclomatic complexity, maintainability index), lines of code, comment percentage, lexical diversity (TTR), entropy values, and number of function definitions, aimed at analyzing code quality and performance.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g8_run1_metrics 数据集图片
构建方式
该数据集源于对代码生成模型Qwen3-8B在编程任务上的系统评测,采用温度系数0.75与8轮采样策略,针对HuggingFace mercury代码基准生成执行轨迹。构建过程涵盖任务执行、正确性判定与多维度静态分析,逐条记录测试通过数、失败数、运行时间及错误类型,并计算Halstead度量、圈复杂度、可维护性指数等代码指标。通过词频逆文档频率与信息熵方法量化代码文本的词汇丰富度与预测熵,最终形成164条训练样本的结构化评测数据,为代码生成质量分析提供细粒度基础。
使用方法
使用该数据集时,可通过HuggingFace datasets库加载,指定默认配置并获取训练分割。研究者可基于task_id与entry_point定位具体编程任务,利用is_executable与is_correct筛选有效样本,结合error_type进行错误归因。通过tests_passed与tests_failed评估测试通过率,借助halstead系列、cyclomatic_complexity与maintainability_index量化代码结构质量。利用shannon_entropy与predictive_entropy分析模型生成不确定性,token_dict支持词汇级统计。数据集适用于代码生成模型性能评估、错误模式挖掘及复杂度与正确性相关性分析,为模型优化与基准比较提供数据支撑。
背景与挑战
背景概述
在代码生成与程序合成研究领域,评估模型输出质量需超越表层正确性,深入剖析代码结构与统计特性。该数据集由匿名研究团队于2024年构建,基于Qwen3-8B模型在信任策略下采样生成,涵盖164个训练样本,整合执行结果与Halstead度量、圈复杂度、可维护性指数等软件工程指标,并纳入基于token分布的香农熵与预测熵。其核心研究问题在于通过多维度量刻画模型生成代码的可靠性与复杂性,为代码评估提供细粒度基准,对自动化编程及模型可信度研究具有潜在影响力。
当前挑战
该数据集所应对的领域问题在于代码生成评估常局限于单元测试通过率,难以揭示代码内部质量与模型不确定性。其构建面临多重挑战:需在异构执行环境中确保测试结果与度量计算的稳定性;平衡Halstead、圈复杂度等静态指标与预测熵等动态指标的语义一致性;处理执行超时、运行时错误等异常情况;以及从有限样本中提取可泛化的质量信号。这些挑战共同指向对模型生成代码进行可解释、多维度评估的迫切需求。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集聚焦于评估大语言模型生成可执行代码的正确性与质量。其经典使用场景在于对模型输出进行多维度细粒度剖析,涵盖执行正确率、测试通过与否、错误类型分布,以及Halstead度量、圈复杂度、可维护性指数等静态软件度量指标,同时引入预测熵与Shannon熵以刻画生成不确定性,从而系统性地衡量代码生成模型在功能正确性与代码质量双重视角下的表现。
解决学术问题
该数据集直面代码生成评估中长期存在的单一准确率指标局限,解决了如何量化模型生成代码的可执行性、功能性正确与代码内在质量之间关联的学术问题。通过融合执行反馈、错误分类与多维软件度量,它为研究者提供了诊断模型失败模式、分析生成不确定性与代码复杂度关系的实证基础,推动了从二元通过率向多维度评估范式的转变,对代码智能领域的评测方法论具有重要意义。
实际应用
在实际软件开发场景中,该数据集可用于自动化代码审查与质量监控系统的构建,辅助识别模型生成代码中的潜在缺陷与可维护性风险。其提供的错误类型与测试执行统计可支撑持续集成流程中的智能回归分析,而熵与复杂度指标则有助于筛选高置信度生成结果,降低人工复核成本,为AI辅助编程工具的安全部署与质量保障提供数据驱动的决策依据。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,针对大语言模型输出代码的质量评估正从单一正确性判别转向多维度可维护性与复杂度联合分析。该数据集聚焦于Qwen3-8B模型在autophagycode策略下生成的代码样本,融合了Halstead度量、圈复杂度、可维护性指数、代码行数、注释比例、词汇丰富度及香农熵等静态特征,同时纳入预测熵指标以刻画模型不确定性。当前前沿研究致力于挖掘模型困惑度与代码缺陷之间的深层关联,探索熵引导的代码筛选与修复机制,从而提升生成代码的鲁棒性与可维护性。该工作为可信代码生成、自动化测试及模型自我纠错提供了细粒度实证基础,对推动AI辅助软件工程的可靠落地具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务