遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g10_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和评估的数据集,包含164个训练示例,每个示例具有多个特征,如任务ID、入口点、可执行性、正确性、测试通过和失败次数、测试运行时间(当前为空)、错误类型,以及一系列代码复杂度度量(如Halstead词汇量、长度、体积、难度、努力程度、时间,圈复杂度,可维护性指数),代码统计信息(如代码行数、源代码行数、注释百分比),文本特征(如类型标记比、香农熵、平均预测熵、最大预测熵),函数定义数量,以及入口点是否重复。数据集旨在支持代码质量、可维护性和性能的研究。

This dataset is designed for code analysis and evaluation, containing 164 training examples. Each example includes multiple features such as task ID, entry point, executability, correctness, number of tests passed and failed, test run time (currently null), error type, and a series of code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, time, cyclomatic complexity, maintainability index), code statistics (e.g., lines of code, source lines of code, comment percentage), text features (e.g., type-token ratio, Shannon entropy, mean predictive entropy, max predictive entropy), number of functions defined, and whether the entry point is repeated. The dataset aims to support research on code quality, maintainability, and performance.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g10_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g10_run1_metrics,源自对代码生成模型输出质量的系统化评估过程。构建时,基于特定策略(trust策略)从Qwen3-4B模型生成的代码样本中筛选并标注指标。每个样本包含唯一的任务标识符(task_id)和入口函数(entry_point),并通过执行测试判断代码的正确性与可执行性,记录通过与失败的测试数量及运行时间。同时,从代码静态属性层面提取了Halstead复杂度系列指标(如词汇量、长度、体积、难度、耗时)、圈复杂度、可维护性指数、代码行数、注释比例、词元类型-令牌比(TTR)及香农熵等,形成多维度的代码质量表征。
特点
本数据集的核心特点在于其融合了执行态与静态分析的双重视角。在动态层面,通过is_correct和is_executable字段直接反映代码功能正确性,并细粒度记录测试用例通过数量与错误类型;在静态层面,引入Halstead系列指标、圈复杂度和可维护性指数等传统软件工程度量,结合香农熵与预测熵等信息论指标,全面刻画代码的结构复杂性和可读性。此外,数据集还包含词元字典(token_dict)及入口函数重复性检测,为研究代码生成模型的错误模式与代码质量分布提供了丰富的结构化特征。
使用方法
使用时,可直接加载该数据集的train分割,包含164个样本,适用于代码生成模型的评估与归因分析。研究者可利用task_id和entry_point进行任务级联检索,通过is_correct和tests_passed字段筛选正确或错误样本,并借助Halstead复杂度与圈复杂度等指标探究生成代码的复杂度与可维护性之间的关系。对于模型优化,可基于error_type和词元特征分析常见错误类型,或利用熵值指标调试模型不确定性。数据集以HuggingFace Datasets格式存储,支持通过load_dataset函数按默认配置快速调用,方便集成进现有的机器学习流水线。
背景与挑战
背景概述
该数据集由 autophagycode 研究团队创建,旨在评估和提升大语言模型(LLM)在代码生成任务中的表现,特别是通过引入信任策略(trust strategy)与温度参数调控(t1.1)来探索模型输出的质量与可靠性。核心研究问题聚焦于如何量化模型生成代码的正确性、执行效率与可维护性,从而推动人工智能在自动化编程领域的发展。数据集构建于 Qwen3-4B 基础模型之上,融合了 Halstead 复杂度、圈复杂度、可维护性指数等软件工程指标,为代码质量评估提供了多维度视角。作为领域内少有的结合信任机制与代码度量的公开资源,该数据集对研究 LLM 生成代码的鲁棒性与实用性具有重要参考价值,有望促进更安全、更高效的智能编码系统的开发。
当前挑战
数据集所解决的领域挑战在于:LLM 生成的代码虽能通过基础编译,却往往在逻辑完整性、执行效率与长期可维护性上表现欠佳,传统评估指标难以捕捉此类细微缺陷。借助 164 条训练样本中的多维度度量(如 Shannon 熵、预测熵、符号表周转率等),研究者得以深入分析模型生成代码的复杂性与不确定性。构建过程中面临的挑战包括:确保测试覆盖率的均衡性以避免性能偏差,处理不同编程范式下的代码特征对齐问题,以及平衡信任策略对模型输出多样性带来的影响。此外,热力熵与复杂度指标间的关联建模,亦对数据集的设计科学性提出了严苛要求。
常用场景
经典使用场景
该数据集聚焦于代码生成与软件工程领域的模型评估与优化,经典使用场景在于衡量大语言模型在自动代码修复与编程任务中的可信度与可靠性。通过引入执行通过率、测试失败类型、运行时性能等细粒度指标,研究者得以深入剖析模型生成代码的功能正确性与健壮性。同时,Halstead复杂度、圈复杂度、可维护性指数等软件度量指标,为解析生成代码的结构质量提供了量化依据。这一多维评估范式使该数据集成为对比不同模型策略(如思考链、信任校准)在代码生成任务上表现的标准测试床。
实际应用
在实际应用中,该数据集可作为持续集成与自动化代码审查系统的参考基准,帮助开发团队筛选出更稳定、低风险的模型生成代码。数据集中包含的测试执行耗时、错误类型分类及重复入口点检测等信息,可直接用于构建实时代码质量监控流水线。此外,对于金融、医疗等对程序可靠性要求严苛的领域,该数据集提供的可维护性指数与预测熵值,能够辅助工程师在采纳AI生成代码前进行风险评估与成本估算,从而降低生产环境中的潜在故障率。
衍生相关工作
围绕此数据集,衍生出一系列基于代码度量的模型校准与增强工作。例如,研究者利用Halstead难度与圈复杂度构建了代码结构的自适应提示策略,引导大语言模型生成更简洁、低耦合的函数实现。另有工作以Shannon熵和预测熵为输入,训练轻量级分类器来预测模型输出是否正确,实现了无需执行的代码正确性预判。这些衍生研究不仅提升了模型在未见编程题目上的泛化能力,也为构建可解释、可审计的AI编程助手提供了方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务