遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 241235 num_examples: 164 download_size: 97631 dataset_size: 241235 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run0_metrics 数据集图片
构建方式
该数据集源自对代码生成模型输出结果的系统性评估与度量过程,以Qwen3-8B模型在特定策略配置下的代码生成为基础,通过对每个生成任务的执行结果进行多维度量化分析而构建。每一条数据记录对应一个编程任务,记录了任务标识符、函数入口点、代码的可执行性以及正确性等基础评判信息。在自动执行与测试环节,数据集进一步引入通过和失败的测试用例数量、执行耗时以及错误类型等运行时指标,从而实现对生成代码功能可靠性的精确刻画。此外,数据集融合了代码度量与软件复杂性分析技术,对Halstead复杂度系列指标(包括词汇量、长度、容量、难度、工作量及时间)、圈复杂度、可维护性指数、代码行数、有效代码行数及注释率等结构性特征进行量化计算,为代码质量的全方位评估提供了坚实的数据支撑。
特点
本数据集的一个突出特点在于其融合了功能验证与代码质量度量的双重维度。在功能性方面,通过执行测试并记录测试通过数、失败数及错误类型,提供了生成代码是否正确运行的直接证据。在代码质量方面,纳入了涵盖Halstead复杂度、圈复杂度、可维护性指数等经典软件工程度量指标,同时引入了香农熵、平均预测熵和最大预测熵等信息论特征,从代码的复杂性与可理解性视角进行量化分析。此外,数据集包含词牌比、词汇字典等语言特征,以及是否重复定义入口函数等结构约束信息,使得该数据集不仅可用于评估模型输出的正确性,还可用于研究生成代码的多样性、可复用性和维护成本,具有显著的科研与工程应用价值。
使用方法
该数据集主要面向代码生成模型的评估与优化研究,用户可将其作为基准数据集,用于分析模型在不同任务上的生成质量分布。具体使用时,可通过加载HuggingFace Datasets库读取train分片中的数据,利用`task_id`和`entry_point`定位具体任务,结合`is_correct`和`tests_passed`等字段快速筛选出正确或失败的代码输出。进一步地,研究者可基于Halstead复杂度、圈复杂度等特征字段,对模型生成的代码进行横向比较与回归分析,探究生成策略与代码质量之间的关联。此外,香农熵和预测熵等特征可用于检测模型在生成过程中的不确定性水平,辅助进行鲁棒性或过拟合现象的评估。由于数据规模适中,适合在小规模实验或快速原型验证场景中使用。
背景与挑战
背景概述
该数据集由autophagycode团队于近期创建,基于Qwen3-8B模型在mercury策略下生成,旨在评估代码生成模型在信任与安全维度上的表现。核心研究问题聚焦于代码可执行性、正确性及软件质量度量(如圈复杂度、维护性指数)对模型输出可靠性的影响。通过记录测试通过率、错误类型及Halstead复杂度等特征,该数据集为深入理解大语言模型在代码生成中的行为提供了结构化视角。尽管规模有限(164条训练样本),但其精细的代码质量标注体系为后续研究奠定了方法论基础,尤其在可信AI与代码评估交叉领域具有启发性价值。
当前挑战
该数据集面临的首要挑战是代码生成模型的领域问题:如何在大规模、低资源条件下确保生成代码的语义正确性与鲁棒性,避免因逻辑缺陷或安全漏洞引发系统风险。构建过程中,数据标注的精确性成为瓶颈,包括任务入口点(entry_point)的重复检测、错误类型(error_type)的细粒度分类,以及可执行性(is_executable)与测试通过率的平衡。此外,代码复杂度指标(如Halstead难度、香农熵)的自动化计算需兼顾计算效率与度量一致性,而样本量稀少(仅164例)进一步限制了统计分析的普适性,易引入过拟合偏差,需依赖外部验证集强化结论可靠性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与行为分析,其核心用途在于量化模型在编程任务中生成的代码片段质量。通过记录任务标识、入口函数、可执行性、正确性、测试通过数量、运行时错误类型等关键指标,研究者能够系统性地比较不同模型(如Qwen3-8B)在特定策略(如trust策略)下的表现。数据集中详尽的静态代码度量特征,包括Halstead复杂度(词汇量、长度、体积、难度、工作量)、圈复杂度、可维护性指数、代码行数、注释比例等,为深入剖析生成代码的结构复杂性与可维护性提供了多维度的量化依据。同时,香农熵与预测熵等指标揭示了代码的多样性及模型的不确定性,从而支持对生成代码的鲁棒性与探索性的全面评估。
解决学术问题
该数据集有效地解决了学术界在代码生成领域面临的两大挑战:一是缺乏细粒度、多维度量化指标来评估生成代码的质量与属性;二是难以系统性地追踪模型在不同策略和超参数设置下的行为变化。通过提供从功能性(正确率、测试通过数)到结构性(圈复杂度、Halstead指标)再到不确定性(各类熵值)的完整指标体系,研究者得以超越传统仅依赖功能测试的评估模式,首次实现了对代码可维护性、可读性及潜在风险的综合度量。这一数据集为理解生成式AI模型在编程任务中的内在偏差与鲁棒性提供了实证基础,显著推动了代码智能领域中关于模型行为可解释性与生成质量评估标准的研究进程。
衍生相关工作
基于该数据集丰富的代码度量信息,一系列衍生研究工作得以开展。在静态分析领域,研究者可依据Halstead长度与圈复杂度,构建代码复杂度预测模型,以自动预估大型代码库中的潜在缺陷区域。在模型优化方面,可结合香农熵与预测熵,设计自适应采样策略,在推理过程中动态平衡生成代码的探索性与确定性,进而提升模型输出质量。此外,维护性指数与注释比例等特征常用于训练代码可读性评估器,为自动生成更符合人类编程规范的高质量代码提供反馈机制。这些衍生工作共同构建了一个从代码生成到评估、优化再到规范化的完整研究闭环,持续推动着代码智能领域的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务