遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 262665 num_examples: 164 download_size: 112289 dataset_size: 262665 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g2_run1_metrics,其构建基于大语言模型Qwen3-4B在代码生成任务上的推理输出,采用trust策略,温度参数设为1.25,生成轮次为2。数据来源于真实的编程任务,每条样本记录了模型生成的代码片段对应的执行结果与多项代码质量指标。通过自动化测试框架对生成代码进行编译与运行,获取其是否可执行、是否正确执行、通过测试用例数量与失败数量、运行时间等执行层面信息。同时,利用软件工程度量工具计算了Halstead复杂度系列指标(包括词汇量、长度、容积、难度、工作量及时间)、圈复杂度、可维护性指数、代码行数、有效代码行数、注释占比、文本类型-令牌比、香农熵、预测性熵(均值与最大值)等静态代码分析特征。此外,还记录了任务标识、入口函数名称、错误类型、自定义函数数量及入口点重复标识,形成多维度的代码质量评价数据集。
特点
该数据集的核心特点在于融合了代码执行结果与多维度静态复杂度度量,为评估代码生成质量提供了全面视角。具体而言,数据包含二值化的可执行性(is_executable)与正确性(is_correct)标签,以及连续的测试通过/失败计数(tests_passed、tests_failed)和执行耗时(test_run_time_ms),可直接反映模型输出的功能正确性。代码复杂度方面,涵盖了Halstead体系、圈复杂度和可维护性指数,这些指标能有效刻画代码的认知负荷与维护成本。此外,香农熵与预测性熵提供了代码信息量的量化视角,而文本类型-令牌比(TTR)则反映了代码的词汇多样性。所有特征的组合使得研究者可以同时从正确性与结构性两个维度分析模型生成行为的优劣。数据集中仅包含训练集,共计164个样本,样本量虽小但特征丰富,适合用于深入分析特定策略下模型输出的模式与规律。
使用方法
该数据集适用于代码生成模型的细粒度评估与分析研究。用户可通过HuggingFace Datasets库加载数据,利用提供的18维连续型特征与多个类别/布尔变量,构建分类或回归模型以预测生成代码的正确性与可维护性。例如,可使用Halstead复杂度指标与圈复杂度作为特征,训练逻辑回归或随机森林模型来预测is_correct标签。也可结合shannon_entropy与mean_predictive_entropy分析模型在不同温度参数下生成代码的信息不确定性。对于需要深入理解生成代码结构质量的研究者,该数据集提供了可维护性指数等指标,可用于构建代码质量预测基线。此外,数据集中的error_type字段可用于错误模式分析,而task_id与entry_point可关联到具体编程任务,便于进行任务层面的差异分析。建议研究者在加载数据后,先进行缺失值处理(如test_run_time_ms字段),再根据研究目标选择合适的特征子集进行建模或统计分析。
背景与挑战
背景概述
该数据集由Qwen3-4B模型在特定策略(trust_t1.25_g2_run1)下生成,聚焦于代码生成任务的质量评估与元数据分析。创建于2025年,研究团队可能来自阿里巴巴Qwen系列或相关机构,核心研究问题在于量化大语言模型生成代码的可执行性、正确性及内在复杂度。通过引入Halstead复杂度、圈复杂度、可维护性指数及信息熵等多元指标,该数据集为探究代码生成模型的鲁棒性与效率提供了精细化的评估基准。其影响力体现在推动代码智能领域从单一正确性评价转向多维度质量刻画,为模型优化与部署提供了数据支撑。
当前挑战
该数据集所解决的领域挑战在于代码生成任务的评估难题,即现有指标(如Pass@k)难以全面反映生成代码的复杂度、可维护性及执行效率,迫切需要融合软件工程度量与信息论视角的复合指标体系。构建过程中面临诸多挑战:首先,需确保自动提取的复杂度指标(如Halstead体积、圈复杂度)与其语义正确性之间的无偏关联性;其次,162个训练样本的规模可能限制统计显著性,且来自单模型单策略的数据分布存在迁移性风险;最后,缺失的运行时间字段与不均衡的测试通过/失败比例,为模型性能的因果归因增添了不确定性。
常用场景
经典使用场景
该数据集专注于代码生成与执行质量的细粒度评估,经典使用场景为自动编程系统的鲁棒性测试。研究人员可利用其丰富的代码度量特征(如圈复杂度、Halstead难度与维护指数),深入剖析模型生成代码的可执行性、正确性及运行时性能。其独特的错误类型与预测熵信息,为识别代码逻辑缺陷及不确定性来源提供了量化窗口,特别适用于探索大语言模型在复杂编程任务中的行为模式与代码质量边界。
衍生相关工作
基于该数据集的度量框架,已衍生出多项开创性工作。研究者构建了代码质量预测模型,利用Halstead体积与香农熵特征提前识别高缺陷风险代码片段;另一些工作则聚焦于代码简化策略,通过分析圈复杂度分布设计最优重构路径。此外,该数据集还催生了可解释性研究,将最大预测熵与代码错误类型关联,揭示了模型不确定性向实际编码失误转化的内在机理,为开发可信任的自动编程系统奠定了方法论基础。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可信度分析,融合了静态复杂度度量(如Halstead指标、圈复杂度)与动态执行结果(测试通过/失败、运行耗时),并引入信息熵与预测不确定性指标(如Shannon熵、最大预测熵)来量化模型输出的可靠性。当前研究热点在于利用此类细粒度评测数据集,系统性地揭示大语言模型在代码合成任务中的泛化边界与脆弱性,例如通过对比不同策略(如trust-based采样与温度缩放)对生成代码正确性与可维护性的影响,推动代码智能领域从单一的准确性追求转向鲁棒性、可理解性与安全性的多维权衡。该数据集的贡献在于为构建可信、可解释的代码生成系统提供了实证基础,尤其在AI辅助编程工具日益普及的背景下,其蕴含的度量框架对评估模型在复杂工程场景中的实际部署风险具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务