遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 244337 num_examples: 164 download_size: 104623 dataset_size: 244337 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g7_run0_metrics 数据集图片
构建方式
该数据集基于Qwen3-4B模型在可信策略(trust strategy)下的推理输出构建,通过预先定义的编程任务(task_id)和入口函数(entry_point)驱动模型生成代码。随后对生成的代码执行自动化测试,记录其是否正确执行(is_executable)、测试通过数(tests_passed)和失败数(tests_failed)以及运行时耗(test_run_time_ms)。此外,数据集的构建还融入了代码质量分析,利用Halstead复杂度指标(包括词汇量、长度、体积、难度、工作量及时间)和McCabe圈复杂度(cyclomatic_complexity)等静态度量,量化代码的结构特征。同时纳入香农熵(shannon_entropy)与预测熵(mean_predictive_entropy、max_predictive_entropy)从信息论视角刻画代码的随机性。所有特征均按样本逐一存储,最终形成包含164条训练样本的紧凑型数据集。
特点
该数据集以多维度代码质量评估为核心特色,不仅涵盖基础的执行正确性和测试覆盖情况,还融合了软件工程领域经典的复杂度度量体系。Halstead系列指标从操作符与操作数的统计分布出发,揭示代码的认知负荷与编写效率;圈复杂度与可维护性指数(maintainability_index)则从控制流结构角度反映代码的测试难度与维护成本。此外,代码行数(loc、sloc)与注释百分比(comment_percentage)提供了代码规模与文档化程度的直观参考。信息熵指标的引入尤为独特,使得数据集中每段代码的随机性与不确定性得以量化,为分析模型生成行为与代码模式提供了新的视角。数据集通过错误类型(error_type)字段清晰标注了代码失败的类别,便于针对性研究。
使用方法
该数据集适用于训练与评估代码生成模型的多个下游任务。用户可直接加载包含164条训练样本的默认配置(default),利用task_id与entry_point字段作为输入提示,驱动模型进行代码补全或生成。模型输出可依据is_correct、tests_passed等标签进行二分类或回归任务的监督学习,也可借助Halstead、圈复杂度等特征进行代码质量预测。在评估阶段,可结合shannon_entropy与TTR(指对数比)等指标分析生成代码的多样性。数据集的代码复杂度与熵特征同样适用于无监督学习中的代码聚类与异常检测。由于提供了token_dict字段,研究者还可以深入进行代码的词法分析或序列建模实验。数据集以Parquet格式存储,可通过HuggingFace Datasets库的load_dataset接口便捷读取。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,旨在评估代码生成模型在复杂编程任务中的表现与鲁棒性。数据集以Qwen3-4B模型为基础,采用信任策略(trust strategy)生成代码,并通过对164个训练样本的精细化度量,捕捉代码的可执行性、正确性、测试通过率及多种软件工程指标(如Halstead复杂度、圈复杂度、可维护性指数等)。数据集核心研究问题聚焦于如何量化模型生成代码的质量与可靠性,为代码智能领域提供了多维度评估基准。其影响力体现在推动代码生成模型从单一正确性评估向全面质量度量演进,为后续模型优化与安全性研究奠定数据基础。
当前挑战
代码生成领域面临的核心挑战在于模型输出不仅需语法正确,更需具备逻辑完备性与实际可执行性。该数据集通过测试通过率与执行时间等指标,直接暴露了模型在复杂逻辑、边界条件处理及异常规避方面的不足。构建过程中,挑战包括:1) 设计合理的任务集以覆盖主流编程场景,避免过度拟合特定模式;2) 统一度量标准以平衡Halstead复杂度与可维护性等异构指标;3) 确保测试用例的完备性与无偏性,减少因测试覆盖不足导致的评估失真。这些挑战共同制约着代码生成模型从实验室走向工业级应用的进程。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的执行结果评估与质量分析,专为研究代码生成模型的正确性、鲁棒性及可执行性而设计。其核心特征涵盖任务标识、入口函数、可执行性标志、测试通过率与失败数,以及丰富的软件度量指标,如哈斯特德复杂度、圈复杂度、可维护性指数和香农熵等。研究者可借此深入剖析模型生成代码的结构复杂度与执行性能,从而在代码生成领域建立起更为严谨的量化评估范式。
衍生相关工作
鉴于该数据集实为一次实验的运行结果,它并不直接衍生成熟的经典工作。不过,类似的评估范式在代码生成领域十分常见,例如HumanEval和MBPP等基准数据集催生了大量关于代码正确性、测试通过率与代码复杂度联合分析的研究。若将此类度量结果系统化收集并公开,可能衍生出代码生成模型的可信度评估基准或复杂度感知的模型性能排行榜。当前该数据集更适合作为某个完整实验框架中的中间产物,而非独立引用的基准。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成与自动修复领域的前沿探索,通过记录模型输出在功能性验证、软件复杂度指标(如Halstead度量、圈复杂度)及可维护性指数等多维度的表现,为评估与优化基于大语言模型的代码合成系统提供了精细化的实证基础。在当前大模型驱动的智能编程工具快速迭代的热潮中,该数据集所包含的测试通过率、错误类型分类以及信息熵等特征,使得研究者能够深入剖析模型在复杂任务中的可靠性与泛化边界。其意义不仅在于推动代码自动生成技术向更高准确度和鲁棒性演进,也为构建可信赖的AI辅助开发环境奠定了重要的数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务