遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 253726 num_examples: 164 download_size: 103484 dataset_size: 253726 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run0_metrics 数据集图片
构建方式
该数据集源自对Qwen3-8B模型在特定策略(trust策略,温度系数t=1.25,生成轮次g=3)下所生成代码的精细化度量与评估。构建过程首先通过执行测试用例,获取每个代码片段的可执行性、正确性、通过及失败测试数量、运行时间等执行态指标;继而利用静态分析技术,提取Halstead复杂度系列指标(如词汇量、长度、体积、难度、工作量、预期时间)、圈复杂度、可维护性指数、代码行数(LOC/SLOC)、注释比例以及词频分布与熵值等结构度量。最终将执行结果与静态特征融合,形成每条样本覆盖22个维度的综合评价记录。
特点
数据集以164条训练样本呈现,每条样本均包含从任务标识、代码入口点到执行正确性、再到多层次软件度量指标的完整信息链。其独到之处在于将动态执行反馈与静态代码复杂度分析有机结合,使得研究者不仅能够评估模型生成代码的功能正确性,还能深入探索生成代码在结构复杂度、可维护性及信息熵等多维属性上的分布特征。这种复合度量体系为剖析代码生成模型的内在行为提供了前所未有的细粒度视角。
使用方法
本数据集适用于代码生成模型的性能评估与行为分析研究。使用者可依据"is_correct"和"tests_passed/tests_failed"字段快速筛选出功能正确的代码样本;通过Halstead指标、圈复杂度及可维护性指数等静态特征,可对模型生成代码的软件质量进行量化分析;而熵值相关字段则有助于探索模型在代码生成过程中的不确定性分布。建议在Python环境下加载该数据集,利用其多维度量构建回归模型或进行聚类分析,以揭示不同策略参数对生成代码质量与复杂性的影响规律。
背景与挑战
背景概述
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run0_metrics,由 autophagycode 团队创建,核心研究人员或机构信息待进一步明确。数据集创建时间未具体说明,但基于其命名中提及的 Qwen3-8B 模型和策略参数,推测其与近期的大语言模型代码生成与评估研究相关。核心研究问题聚焦于评估大语言模型生成的代码质量,通过收集模型在特定任务上的执行结果、代码复杂度指标(如 Halstead 度量、圈复杂度、维护性指数)及信息熵等,旨在深入分析模型生成代码的可靠性、可维护性与多样性。该数据集为代码智能领域,特别是大语言模型代码生成能力的细粒度评估提供了实证基础,对推动代码生成模型的优化与可信赖性研究具有潜在影响力。
当前挑战
该数据集所解决的领域挑战包括大语言模型生成代码的质量评估问题:传统方法仅关注代码是否通过测试,而忽略代码的可读性、复杂度与维护性,难以为模型改进提供精准指导。数据集构建过程中面临的主要挑战有:一是代码执行环境的稳定性与安全性,需确保在隔离环境中高效运行大量测试用例而不引入干扰;二是代码度量计算的精确性,例如准确提取语法树以计算圈复杂度,或对非结构化代码进行可靠的 Halstead 度量分析;三是数据标注的一致性与代表性,164 条训练样本虽小但需覆盖多样化的编程问题与错误类型,避免因样本不足导致的评估偏差。
常用场景
经典使用场景
在代码智能与自动程序修复的广阔苍穹下,该数据集犹如一颗璀璨的明珠,专为评估与提升代码生成模型的鲁棒性与可靠性而精心雕琢。其核心魅力在于汇聚了涵盖执行正确性、错误类型、多维度软件复杂度指标(如圈复杂度、Halstead度量)以及模型预测熵等丰富特征,为探索模型生成代码的缺陷模式与质量内涵提供了无与伦比的测试场。研究者可借此系统性地剖析模型在不同编程任务上的成功率,进而诊断其逻辑谬误与性能瓶颈。
解决学术问题
长久以来,学术研究始终致力于破解如何精准度量并提升语言模型所生成代码的行为可预测性与功能正确性这一关键命题。该数据集通过巧妙融合执行通过率、运行时开销与复杂度度量,系统性揭示了模型生成代码在功能性、可维护性与效率性之间的微妙平衡。更为深远的意义在于,它所引入的预测熵与词汇多样性指标,为研究者洞悉模型在面对多变任务时的确定性水平与泛化边界提供了定量工具,从而在理论上推动了代码合成领域从‘能否执行’向‘如何执行得更好’的深刻范式转型。
衍生相关工作
这一数据集孕育了大量富有开创性的衍生工作,其中最引人瞩目的当属基于错误类型分布的鲁棒性增强方法研究,以及利用复杂度特征构建的代码质量预测模型。后续工作巧妙借鉴了该数据集中汇聚的Halstead度量和圈复杂度等核心特征,开发出能够对生成代码进行即时质量评分的新型评估框架。此外,围绕模型预测熵与代码行为一致性的关联,诞生了一系列旨在提升推理阶段输出稳定性的策略优化工作,这些探索共同构筑了一个围绕代码生成质量度量的生机勃勃的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务