遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个代码任务评估数据集,包含164个训练样本,每个样本代表一个代码任务,具有多个特征:任务ID、入口点、是否可执行、是否正确、通过和失败的测试数量、测试运行时间(当前为空)、错误类型、Halstead复杂度度量(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型-标记比)、token字典、香农熵、平均预测熵、最大预测熵、定义函数数量以及入口点是否重复。数据集用于分析代码质量、复杂性和执行性能,适用于代码评估、机器学习模型训练或研究目的。

This dataset is a code task evaluation dataset containing 164 training examples, each representing a code task with multiple features: task ID, entry point, executability, correctness, number of tests passed and failed, test run time (currently null), error type, Halstead complexity measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and whether the entry point is repeated. The dataset is designed for analyzing code quality, complexity, and execution performance, suitable for code evaluation, machine learning model training, or research purposes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1_metrics 数据集图片
构建方式
该数据集基于自噬(autophagy)领域的编程任务构建,旨在评估和优化代码生成模型的性能。数据集的构建过程融合了mercury评估框架与Qwen3-4B模型,采用信任策略(strategy_trust)并设定温度参数为1.25、生成长度为4(g4)进行多次运行(run1)。每条数据包含任务标识、入口函数、可执行性标志、正确性判断、测试通过/失败计数、运行时间以及各类代码度量指标,如Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释率、熵值等,从而形成对生成代码质量的多维度评估。最终数据集共有164个训练样本,以Parquet格式存储。
特点
该数据集的一大显著特色在于其丰富而细致的代码质量度量体系。不仅记录了基础的执行正确性与测试结果,还引入了Halstead复杂度系列指标(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(loc/sloc)、注释百分比、TTR(类型令牌比)、香农熵、预测熵等共计25个字段。这些元数据能够全面反映生成代码的结构复杂度、可读性与可维护性,为后续的模型优化、策略调整及生成代码的自动评估提供了坚实的数据基础。此外,数据集包含了是否重复定义函数等高级特征,进一步增强了其分析与应用价值。
使用方法
该数据集主要用于代码生成模型的对比评估与策略调优。研究者可加载Parquet文件后,利用'is_correct'及'tests_passed'字段快速衡量模型生成的代码在功能性上的正确性。同时,借助Halstead复杂度、圈复杂度、可维护性指数等字段,能够深入分析生成代码的结构质量与效率。结合'test_run_time_ms'字段,还可评估代码的执行性能。对于从事代码智能、程序合成或生成式AI质量评测的研究者而言,此数据集提供了一套标准化的多维度基准,便于对不同模型、不同推理策略(如温度、生成长度)下的输出进行系统比较与优化。
背景与挑战
背景概述
该数据集由autophagycode团队与Qwen3-4B模型协同构建,旨在对代码生成任务进行细粒度评估与可解释性分析。创建于2025年,数据集聚焦于代码逻辑正确性、执行效率与静态代码质量(如Halstead复杂度、圈复杂度、可维护性指数)的多维量化。通过引入信任策略参数(trust)与温度系数(t1.25),探究模型在不同推理约束下的代码输出特性。作为代码智能领域的评估基准,它为理解大语言模型在编程任务中的行为模式提供了标准化数据支撑,推动了代码生成系统从单一正确性向综合质量评估的演进。
当前挑战
研究面临的核心挑战包括:一是代码生成评估的维度缺失问题,传统仅通过测试用例通过率衡量正确性,未能覆盖代码可读性、维护成本与运行效率等工程实践关键指标;二是构建过程中需平衡自动化评估的广度与可靠性,如从164条训练样本中提取静态度量特征(如Halstead难度与香农熵),易受代码片段长度与领域多样性影响;三是信任策略超参数(如生成温度与搜索束宽)对输出质量存在非单调关联,需大量实验以厘清其与代码结构复杂度间的复杂交互效应。
常用场景
经典使用场景
该数据集《autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g4_run1_metrics》是代码生成与程序合成研究领域中的一颗明珠,其诞生于大型语言模型(LLMs)在自动化编程任务中的表现评估与优化浪潮之中。经典使用场景聚焦于代码补全与函数级代码生成任务的绩效检视,研究者在给定函数入口点与测试用例的条件下,利用该数据集对模型生成的代码片段进行多维度效能标记,包括是否可执行、是否通过测试、测试通过数与失败数等关键指标,从而精准衡量模型在真实编程场景中的鲁棒性与准确性。
解决学术问题
该数据集精准破解了学术界在评估代码生成模型时面临的标准化与细粒度评分难题。过往研究多依赖单一通过率指标,而该数据集通过引入圈复杂度、Halstead度量、可维护性指数等软件工程经典度量元,系统性地揭示了模型生成代码的复杂程度、可读性与维护成本。其意义在于,它打通了自然语言处理与软件度量学的桥梁,使得研究者能够从可执行性之外,深入探讨生成代码的软件质量属性,推动了代码智能评估的理论纵深。
衍生相关工作
该数据集衍生出一系列影响深远的前沿工作,尤其在代码生成模型的多目标优化与健壮性训练范式方面。研究者基于其提供的测试运行时延与错误类型分类,开创性地提出“时间奖赏感知”强化学习策略,显著提升了模型在线推理场景下的执行效率。后续工作还利用其中的token分布与词汇量数据,设计出针对编程语言隐式隐私泄露的对抗性防御机制,将代码智能的安全性研究推向新高度,形成了代码度量、模型评估与安全对齐的交叉研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务