遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g6_run1_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 232551 num_examples: 164 download_size: 101136 dataset_size: 232551 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset contains detailed information about code tasks, including task ID, entry point, executability, correctness, number of tests passed/failed, test run time, error type, various software complexity metrics (e.g., Halstead metrics, cyclomatic complexity, maintainability index), lines of code, comment percentage, entropy, etc. It has 164 training samples and is primarily used for code analysis and testing-related tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g6_run1_metrics 数据集图片
构建方式
面向代码生成质量评估的精细化需求,该数据集以自动化代码评测框架为基础,系统采集模型生成代码在单元测试中的执行表现。每条样本记录任务标识、入口函数、可执行性、正确性、测试通过数与失败数等执行层指标,并同步提取代码静态特征,包括Halstead词汇量、程序长度、体积、难度、工作量与时间估计,以及圈复杂度、可维护性指数、代码行数、注释比例等度量。此外,通过分词统计与信息熵计算,纳入类型-标记比、词频字典、香农熵及预测熵等语言模型信号,形成多维度、细粒度的代码质量画像。
使用方法
使用时可借助HuggingFace datasets库直接加载默认配置,按train划分获取数据。研究者可依据is_executable、is_correct、tests_passed、tests_failed及error_type等字段评估生成代码的功能表现,利用Halstead度量、圈复杂度、可维护性指数、代码行数与注释比例分析代码结构与可读性,并结合TTR、token_dict、shannon_entropy及预测熵等指标探究模型生成不确定性与质量之间的关联。该数据集适用于代码生成模型评测、错误归因分析及代码质量预测等任务,也可作为训练辅助信号用于构建质量感知的代码生成系统。
背景与挑战
背景概述
在代码生成与软件工程智能化浪潮的推动下,针对大语言模型代码能力的评估需求日益迫切。该数据集由autophagycode团队构建,以Qwen3-8B模型为生成引擎,采用trust策略在温度0.75下采样六次,记录了164个编程任务的执行结果与多维代码度量,涵盖正确性、可执行性、测试通过率及Halstead、圈复杂度等指标。其核心研究问题在于细粒度量化模型生成代码的质量与模型置信度之间的关联,为代码评估提供了兼具执行反馈与静态分析的双重视角,对推动可信代码生成研究具有基础性意义。
当前挑战
该数据集所面对的领域问题在于如何超越单一通过率的粗粒度评价,精准刻画代码生成模型在真实编程任务中的能力边界与不确定性。构建过程中的挑战同样显著:生成样本需确保执行环境安全隔离,避免恶意代码干扰;测试用例的完备性与代表性难以兼顾,可能遗漏边界情形;模型预测熵等不确定性度量需与代码结构特征有效对齐,而不同编程语言、任务难度的分布偏差亦增加了标注与统计的复杂性。此外,样本规模有限,对模型泛化能力的推断存在局限性。
常用场景
经典使用场景
在程序合成与自动化代码生成的研究中,该数据集为评估大语言模型生成代码的功能正确性与代码质量提供了标准化测试基准。其经典使用场景聚焦于面向代码生成任务的细粒度评估,通过执行测试用例(tests_passed与tests_failed)判断生成代码是否通过单元测试,同时借助Halstead度量、圈复杂度、可维护性指数等静态指标刻画代码的结构特征。研究者常以此数据集衡量模型在真实编程任务上的表现,并分析生成代码的正确性、可读性与复杂度之间的权衡关系。
解决学术问题
该数据集着力解决代码生成模型评估中功能正确性与代码质量割裂的学术难题。传统评估多依赖匹配度或单一通过率,难以全面反映生成代码的工程可用性。通过整合执行结果与多维静态代码度量,该数据集为探究生成代码的缺陷模式、错误类型分布及复杂度对可维护性的影响提供了实证基础,推动了代码生成评估从单一正确性向综合质量评价的范式转变,对软件工程与人工智能交叉研究具有方法论意义。
实际应用
在实际软件开发场景中,该数据集可用于持续集成环境下的自动化代码审查与质量监控。开发团队可借助其度量体系识别生成代码中的高复杂度模块、低可维护性片段以及潜在错误类型,从而优化代码重构策略。同时,该数据集支持对代码生成工具进行基准测试,辅助企业选择适合自身技术栈的模型方案,并为代码补全、缺陷检测等工具的迭代提供量化依据。
数据集最近研究
最新研究方向
在代码生成与程序合成领域,基于大语言模型的自动化编程正以前所未有的速度重塑软件开发范式,而对该过程进行细粒度量化评估已成为当前学术与工业界共同瞩目的前沿议题。该数据集以Qwen3-8B模型为基底,采用信任策略与温度采样生成代码,并系统性地采集了可执行性、测试通过率、错误类型、Halstead复杂度、环路复杂度、可维护性指数、注释比例、词汇丰富度及预测熵等多维度指标,为模型输出质量与代码内在属性的关联分析提供了实证基础。其与当前模型可靠性评估、可解释性研究及代码质量自动度量等热点紧密相连,推动着从单纯功能正确性向综合工程属性评价的范式迁移,对构建可信、可维护的AI生成代码生态具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务