遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含一系列代码任务的相关数据,每个条目由任务ID、入口点、可执行性标志、正确性标志、通过和失败的测试数量等字段组成,并提供了详细的代码度量指标,如Halstead度量(包括词汇量、长度、体积、难度、努力和时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比等。此外,还包含文本分析指标,如类型-标记比(TTR)、香农熵和预测熵,用于评估代码的复杂性和信息内容。数据集适用于软件工程研究、代码质量评估、NLP应用或机器学习任务,旨在分析代码特性与执行结果之间的关系。

This dataset includes data related to a series of code tasks, with each entry consisting of fields such as task ID, entry point, executability flag, correctness flag, number of tests passed and failed, and provides detailed code metrics like Halstead measures (including vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, etc. It also contains text analysis metrics such as type-token ratio (TTR), Shannon entropy, and predictive entropy for assessing code complexity and information content. The dataset is suitable for software engineering research, code quality evaluation, NLP applications, or machine learning tasks, aiming to analyze the relationship between code characteristics and execution outcomes.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run2_metrics 数据集图片
构建方式
该数据集基于大规模代码生成与评估流程构建而成,源于对Qwen3-8B模型在自动驾驶领域代码生成任务中的输出结果进行系统化评测与后处理。原始代码生成任务通过设置策略参数trust、温度系数t1.25、生成次数g9与第二轮运行机制进行采样,随后对生成的代码片段执行可执行性检测、功能性正确性验证及测试用例通过率统计,并针对运行失败类型进行归类记录。此外,对每段代码进行多维度软件度量分析,涵盖Halstead复杂度指标、圈复杂度、可维护性指数、代码行数与注释比例、词符多样性比率、Shannon熵与预测熵等特征,从而构建出集正确性、执行效率与代码质量于一体的164条训练样本集合。
使用方法
数据集以train单一分割形式存储,包含164条样本,数据文件位于data/train-*路径下,可通过HuggingFace Datasets库加载使用。研究人员可利用task_id与entry_point字段实现任务级检索,结合is_correct与测试通过率字段进行代码正确性分类模型训练;依托Halstead、圈复杂度等结构化特征,可构建代码质量预测或可维护性评估任务。此外,token_dict与熵值特征为文本生成模型的不确定性分析与鲁棒性研究提供了基础,适用于代码生成模型的诊断、对比实验与细粒度错误分析场景。
背景与挑战
背景概述
该数据集由 autophagycode 团队于2025年创建,基于 Qwen3-8B 模型在特定策略(trust_t1.25_g9)下生成的代码执行结果构建,主要研究机构或团队聚焦于代码生成模型的可靠性评估与性能量化。其核心研究问题在于系统性地刻画大语言模型生成代码的语义正确性、执行效率与代码质量特征。通过集成 halstead 复杂度度量、圈复杂度、可维护性指数、Shannon 熵等多元指标,该数据集为代码生成领域提供了一个细粒度的评估基准,推动了从单一正确性向多维度代码质量评估的范式演进,对理解大模型在编程任务中的泛化能力与输出稳定性具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,现有代码生成评估往往仅关注通过测试用例的二元结果,难以反映代码内在的结构复杂性、可维护性及执行效率。其构建过程中面临的挑战包括:1) 如何定义并计算涵盖语法结构、执行路径与信息论特征的复合质量指标;2) 需要在不引入人为偏差的前提下,对模型生成的164个训练样本进行高精度编译与运行测试,并自动标记错误类型;3) 平衡代码可读性(如注释占比)与功能完整性之间的关系,确保指标间非冗余且能联合揭示生成模型的行为模式。这些挑战促使数据集在设计时兼顾了自动化标注的可行性与其在模型诊断中的解释力。
常用场景
经典使用场景
在深度学习与程序合成交汇的璀璨星河中,本数据集宛如一颗精心雕琢的明珠,专为代码生成模型的鲁棒性评估与精细化训练而生。其经典应用场景聚焦于对大型语言模型(如Qwen3-8B)所生成的代码片段进行多维度质量剖析。研究者利用该数据集内含的Halstead复杂度指标、圈复杂度及维护性指数等软件工程度量标准,结合测试通过率与运行时序等执行反馈,深度挖掘模型在逻辑正确性、代码可读性及计算效率间的微妙平衡。这一场景为探索代码智能体在信任策略(trust strategy)下的生成行为提供了可复现的量化基准,成为连接自然语言指令与可执行代码之间的枢纽。
解决学术问题
该数据集精准回应了当前学术研究中关于‘如何系统量化并提升代码生成模型可靠性’这一核心挑战。传统评估多依赖于二元的测试正确性标签,忽视了代码质量的深层维度。本数据集通过引入执行结果、复杂度度量及熵值分析,一举破解了模型生成代码‘虽对但差’的困境——即虽通过测试却结构臃肿、难以维护的问题。它使得研究者得以从软件工程视角审视神经模型的输出,推动代码生成领域超越单纯的正确率竞赛,迈向对代码功能性、可维护性与计算效率的综合考量。其意义在于为构建更符合工业级标准的代码智能系统奠定了评估范式,深刻影响了后续关于模型行为可解释性与安全性的研究工作。
实际应用
在实际工程技术领域,该数据集扮演着代码质量审计与模型迭代优化的双面角色。开发团队可利用其丰富的度量列(如执行时间、Halstead工作量与香农熵)构建自动化流水线,对大型语言模型生成的候选代码进行实时筛选与风险预警。例如,在持续集成环境中,结合测试失败模式与圈复杂度,能精准定位高风险的生成代码块,防止低质量或高熵代码流入生产系统。此外,该数据集的低执行错误率特征使其成为研究代码审查自动化与自适应重构策略的理想沙盘,为智能编程助手从实验室原型迈向可信赖的工程工具架设了一座坚实的桥梁。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可解释性分析,融合了执行正确性、静态复杂度(如Halstead指标、圈复杂度)与信息熵等多维度量。当前前沿方向包括:利用大语言模型(如Qwen3-8B)生成代码后,通过细致的运行时测试与代码质量指标,揭示模型在语义理解与逻辑构造上的能力边界。结合代码可维护性指数与预测熵,新近研究正探索如何预测模型在复杂编程任务中的失败模式,并据此优化提示策略与信任校准机制,推动代码智能从‘生成即用’向‘可靠自治’演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务