遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码评估或编程任务分析的数据集,包含164个示例,每个示例具有多个特征,如任务ID、入口点、可执行性、正确性、测试通过和失败次数、错误类型,以及代码复杂度度量(如Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数),代码统计信息(如代码行数、有效代码行数、注释比例),语言特征(如TTR、香农熵、预测熵),以及函数定义数量等。数据集仅提供训练集分割,用于分析和评估代码质量或任务执行情况。

This dataset is designed for code evaluation or programming task analysis, comprising 164 examples. Each example includes multiple features such as task ID, entry point, executability, correctness, number of tests passed and failed, error type, and code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index). It also contains code statistics (e.g., lines of code, source lines of code, comment percentage), linguistic features (e.g., TTR, Shannon entropy, predictive entropy), and the number of defined functions. The dataset only provides a training split and is intended for analyzing and assessing code quality or task performance.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run2_metrics 数据集图片
构建方式
该数据集是为评估代码生成模型在特定策略下生成代码质量而构建的。其构建基于Qwen3-4B模型,在'm_strategy_trust'策略下,设置温度系数为1.25、生成次数为6、运行批次为2,对原始任务进行代码生成。随后,对生成的代码执行单元测试,记录其可执行性、正确性、通过与失败的测试用例数量以及运行耗时。同时,从静态分析角度,提取了包括Halstead复杂度指标、圈复杂度、可维护性指数、代码行数、注释比例、词元比率、香农熵以及预测性熵等多种软件度量元,并记录了错误类型。最终形成一个包含代码质量多维度量化信息的训练集,共计164个样本。
使用方法
该数据集的使用方法较为直接。用户可通过HuggingFace的datasets库加载数据,指定配置名称为'default',即可获取训练集。加载后,数据以DataFrame形式呈现,包含如task_id、代码度量指标、执行结果等多列。研究人员可利用这些特征进行模型生成代码质量的统计分析、构建预测代码正确性或复杂度的模型,或对比不同生成策略的效果。数据集大小为231709字节,包含164个样本,适合用于小规模实验验证与特征探索。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g6_run2_metrics,由AutophagyCode团队基于大语言模型Qwen3-4B生成,旨在评估和解析代码生成的可靠性与质量。数据集创建于大语言模型快速发展的背景下,聚焦于代码合成任务的评测,涵盖了从基础可执行性测试到复杂软件复杂度指标的多维度分析。其核心研究问题在于如何量化模型生成代码的鲁棒性与功能性,通过引入Halstead复杂度、圈复杂度、维护性指数等传统软件工程度量,结合香农熵与预测熵等不确定性指标,构建了一套系统的代码质量评估框架。该数据集对代码生成领域的影响力体现在:为研究者提供了从功能正确性到代码可维护性的全面评测基准,推动了生成代码在工业级应用中的可信性研究。
当前挑战
该数据集面临的挑战首先来自领域问题层面:大语言模型生成的代码往往存在逻辑错误、语法缺失或安全隐患,单纯依赖功能测试难以全面捕捉代码的潜在缺陷,需要融合软件复杂度与不确定性指标构建多维度评估体系。此外,构建过程中面临的核心挑战包括:数据生成的覆盖性不足,仅包含164个训练样本,难以代表真实世界多样化的编程场景;质量标注的可靠性问题,自动化指标如Halstead时间与圈复杂度的计算可能因代码片段短小而失准;以及跨模型泛化能力受限,当前数据集仅针对Qwen3-4B单一模型,无法直接适用于其他架构或更大规模模型的比较分析。
常用场景
经典使用场景
该数据集聚焦于代码生成模型的评估与优化,经典使用场景涵盖代码正确性验证、代码复杂度分析以及模型行为信任度考察。通过记录任务标识、代码入口点、可执行性、测试通过率等关键指标,研究人员能够系统性地衡量模型生成代码的功能正确性与鲁棒性。同时,Halstead复杂度、圈复杂度、可维护性指数等软件工程成熟度指标,为深入剖析生成代码的内在质量提供了量化依据。此外,预测熵与香农熵等不确定性度量,为探索模型在代码生成任务中的置信度校准与安全对齐策略开辟了新颖视角。
解决学术问题
该数据集着力突破代码生成领域中两大核心学术挑战:其一是生成代码的功能可靠性与形式正确性难以协同度量的问题,通过集成测试通过率与多种复杂度指标,为构建多维度质量评价体系提供了坚实的数据基础;其二则是模型输出可信度与安全对齐评估的缺失,借助预测熵与分布熵等不确定性指标,该数据集为研究模型在何种条件下倾向于产生不可靠代码、以及如何通过信任策略进行干预,提供了宝贵的实证素材。这些能力有力推动了代码智能领域评价范式从单一正确率向综合性、安全性、可解释性方向的演进。
实际应用
在工业级代码辅助工具的研发与迭代中,该数据集可服务于自动化代码审查系统,帮助识别由模型生成的潜藏缺陷或高复杂度代码片段,从而降低人工审查成本。同时,它可嵌入持续集成流水线,作为模型迭代发布前的质量门禁,依据测试通过率与运行时间快速甄别性能衰退。此外,数据集中的熵值特征可用于构建模型行为监控面板,实时预警生成结果的不确定性激增,尤其适用于对安全性与合规性要求严苛的金融、医疗等领域的代码自动生成场景。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的输出质量与结构复杂性评估,融合了代码可执行性、测试通过率、Halstead复杂度、圈复杂度及香农熵等多维度的软件度量指标。在当前大语言模型驱动的代码生成热潮中,研究者正转向系统性地衡量生成代码的功能正确性与可维护性,而非仅关注语法相似性。该数据集通过164个训练样本,提供了从底层语义复杂性到高层预测熵的精细剖析,为探索模型生成代码的可靠性边界、评估不同采样策略(如trust策略)的影响,以及构建更鲁棒的代码智能评估基准提供了关键实证基础,呼应了AI辅助软件工程中代码质量量化这一前沿命题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务