遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 238834 num_examples: 164 download_size: 100469 dataset_size: 238834 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g6_run2_metrics 数据集图片
构建方式
该数据集基于代码生成与评测任务构建,选取Qwen3-8B模型在特定策略(trust_t1.25_g6)下的生成结果作为原始数据。通过对每个代码样本执行单元测试,记录其执行状态、测试通过数与失败数等运行时指标,并辅以Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比等静态度量特征。同时,计算词频比率(TTR)、香农熵及预测熵等语言模型相关的信息论指标,形成对生成代码质量与复杂度的多维度刻画。最终整合成包含164条训练样本的结构化数据集。
特点
数据集涵盖代码执行结果与多种复杂度度量指标,兼具动态验证与静态分析的双重特性。其特色在于融合了Halstead系列度量(词汇量、长度、体积、难度、工作量与时间)、圈复杂度、可维护性指数等传统软件工程指标,以及香农熵、预测熵等反映生成代码不确定性的信息论特征。此外,还包含词语级Token字典、函数定义数量等细粒度属性,便于从不同层次剖析模型生成代码的行为模式与质量特征。
使用方法
该数据集适用于代码生成模型的评估与调试,特别是针对模型策略差异的对比分析。用户可基于测试通过数、错误类型等字段筛选成功或失败的样本,再结合复杂度与熵值指标探索生成质量与代码结构之间的关系。数据集以标准的HuggingFace格式存储,支持通过`load_dataset`函数一键加载,并可按任务ID、执行状态等条件进行分组统计与可视化分析。
背景与挑战
背景概述
该数据集由基于Qwen3-8B模型的代码生成实验衍生而来,聚焦于代码质量与可执行性的多维评估。研究团队通过策略性提示(trust策略)生成代码,并系统性地收集了Halstead复杂度、圈复杂度、可维护性指数、熵值等二十余项代码度量指标。数据集创建于2025年,旨在探究大语言模型生成代码的结构特征与功能性正确性之间的深层关联,为代码智能领域提供细粒度的分析基准。其影响力体现在将代码度量分析从传统的正确性验证拓展至可维护性、冗余度与信息熵等软件工程核心维度,为自动化代码评审与模型优化开辟了新的量化路径。
当前挑战
当前数据集面临的核心挑战集中于两个层面:其一,所解决的领域问题在于大模型生成代码的“黑箱”评估困境——传统正确性指标(如测试通过率)无法揭示代码的内在质量缺陷,如冗余令牌、低可维护性及高认知负荷。该数据集通过度量指标的多维映射,试图弥合功能性验证与结构化质量之间的鸿沟,但如何将这些复合指标有效整合为单一质量评分仍待探索。其二,构建过程中受限于样本规模(仅164条训练数据),部分极端代码结构可能被忽略,同时度量指标的自动采集依赖于执行环境的稳定性,如时间测量缺失值(test_run_time_ms为空)暴露了动态分析中的环境依赖性瓶颈,对数据集的可复现性构成了潜在挑战。
常用场景
经典使用场景
该数据集聚焦于大语言模型在代码生成任务中的行为度量与质量评估,其经典使用场景在于为研究者提供一份细粒度的代码执行结果与代码复杂度指标。通过记录任务标识、执行正确性、测试通过率、运行时间及错误类型等关键信息,结合Halstead复杂度、圈复杂度、可维护性指数等软件工程指标,研究者能够精准剖析模型生成的代码在功能正确性与内在结构质量之间的关联。这一数据集尤其适合用于探究不同策略参数(如温度系数、生成轮次)对代码生成质量的影响,为优化大语言模型的推理策略提供了实证基础。
解决学术问题
该数据集有效回应了学术领域中关于大语言模型生成代码的可信度与可解释性的核心问题。传统上,代码生成研究的评估多依赖于自动化测试通过率,而忽略了代码的内在质量与潜在缺陷。通过整合代码执行测试结果与多维软件度量指标,该数据集使得研究者能够从功能正确性、代码可维护性和计算复杂性等多个维度综合评估模型输出,从而回答诸如“模型在何种条件下更易生成高复杂度代码”或“错误类型与代码语义复杂度是否存在关联”等深层学术问题。这在推动代码生成模型向更可靠、更可解释方向发展方面具有重要意义。
衍生相关工作
围绕该数据集可衍生出一系列具有深度的经典研究工作。例如,可基于其包含的代码复杂度指标与执行正确性数据,构建代码质量预测模型,探究代码复杂度与功能正确性之间的非线性关系。同时,结合熵值计算与预测性指标,研究者能够开发出量化模型不确定性的方法,进而设计自适应的代码生成策略,在推理过程中动态平衡探索与利用。此外,数据集提供的细粒度错误类型信息,为构建分类模型以诊断代码生成失败的根本原因(如语法错误、逻辑错误等)奠定了数据基础,推动了大语言模型在代码领域从“生成正确”向“生成优秀”的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务