遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 231951 num_examples: 164 download_size: 98010 dataset_size: 231951 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g5_run1_metrics 数据集图片
构建方式
该数据集构建于代码生成模型评估的复杂场景之下,融合了编程竞赛级问题(如HumanEval)的基准测试与自动化测试框架。具体而言,数据集基于`autophagycode_D_he_train-mercury_Qwen3-8B`策略和`trust`配置,采用温度系数1.25与生成次数5的采样方案,对Qwen3-8B模型生成的解进行系统性度量。每条记录对应一个独立的代码任务,经由执行测试用例获得正确性标签及执行时间,并进一步通过静态分析提取软件工程领域的二十余项复杂特征。
特点
数据集最突出的特色在于其多维度的代码质量评估体系。它不仅记录了基础的`is_correct`正确性标志与`tests_passed`、`tests_failed`数值,还纳入了Halstead复杂度系列指标(词汇量、长度、体积、难度、耗时)、圈复杂度与可维护性指数等经典软件度量。此外,创新性地引入了香农熵、平均预测熵和最大预测熵等来自信息论与概率建模的指标,结合词元字典与文本重复率,为深入理解代码的结构化特征与模型生成行为提供了前所未有的数据支撑。
使用方法
本数据集特别适用于训练代码质量预测模型、分析大语言模型在代码生成任务上的行为偏差,或作为代码可维护性与复杂度研究的基准资源。用户可通过HuggingFace的`datasets`库加载`train`分割数据,利用`task_id`与`entry_point`字段关联具体编程问题,并基于各项数值特征执行统计分析或监督学习任务。建议使用前检查`is_executable`字段过滤无效样例,并注意`test_run_time_ms`字段可能存在的空值。
背景与挑战
背景概述
该数据集由研究团队基于Qwen3-8B模型对代码生成任务进行策略性评估而构建,聚焦于大语言模型在自动编程领域的可信度与代码质量分析。其核心研究问题在于,如何通过多维度的代码度量指标(如Halstead复杂度、圈复杂度、可维护性指数等)量化模型生成代码的可靠性、效率与可维护性。该工作为代码智能领域提供了细粒度的评估基准,有助于推动大模型在代码生成任务中的稳健性研究,尤其对自动化软件工程与智能编程助手的可信度评估具有重要参考价值。
当前挑战
数据集所解决的领域问题在于,当前大语言模型生成的代码虽具表面正确性,但普遍缺乏对代码底层结构复杂性与维护性等隐性质量的考量,需建立超越简单功能测试的综合评估体系。构建过程中面临的关键挑战包括:如何设计覆盖语法、语义、复杂度及熵等多元维度的度量指标体系,并确保各指标在小型代码片段上的计算准确性与鲁棒性;同时,在有限样本量(164条训练数据)下,需精细化平衡测试用例覆盖率与执行效率,以避免过拟合特定模型行为。
常用场景
经典使用场景
在代码智能与软件工程研究的交汇处,该数据集聚焦于代码执行结果与多维静态度量指标的联合分析,成为评估大语言模型代码生成质量的基准资源。其经典使用场景在于对模型生成的代码进行多维度诊断:通过记录代码是否可执行、是否通过测试、运行耗时等执行态信息,结合圈复杂度、Halstead难度与维护性指数等静态复杂度指标,构建起代码功能正确性与代码质量的立体评估框架。研究者可据此深入剖析大型语言模型在编程任务中的输出特征,为模型微调与推理策略优化提供数据支撑。
实际应用
在自动化软件开发的产业浪潮中,该数据集直接服务于代码审核助手与智能编程教官的落地。工程团队可基于其中代码执行明细与复杂度数据,训练模型自动识别不可执行或高维护风险的代码片段,并将其嵌入持续集成管线以实时拦截低质提交。教育领域可将其转化为编程作业自动评分系统的校准基准,通过测试通过率与复杂度的二元过滤机制,既判定功能正确性又衡量代码质量。这类应用显著降低了人工回归测试与代码评审的成本,加速了AI辅助编程工具从实验室走向生产环境的进程。
衍生相关工作
依托该数据集衍生的经典工作主要沿着两个方向延伸:其一为代码复杂度与模型行为因果分析,研究者借由Halstead时间与圈复杂度等特征,建立可解释性框架以揭示注意力机制与代码结构复杂度的映射关系,诞生了诸如‘LLM代码复杂度压力测试集’等评测工具;其二为执行态错误预测模型,利用错误类型与熵值序列训练轻量级分类器,实现在编译运行前预判代码正确性。这些衍生成果反向促进了原始数据集的迭代,推动形成‘度量-诊断-微调’的闭环优化范式,提升了代码生成模型的可靠性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务