遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run1_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析和评估的数据集,包含164个训练示例。数据集的特征包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、通过和失败的测试数量(tests_passed、tests_failed)、测试运行时间(test_run_time_ms)、错误类型(error_type)、Halstead软件度量(如词汇量、长度、体积、难度、努力和时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数统计(loc、sloc)、注释百分比(comment_percentage)、类型-标记比(TTR)、标记字典(token_dict)、香农熵(shannon_entropy)、平均和最大预测熵(mean_predictive_entropy、max_predictive_entropy)、定义函数数量(n_func_defined)以及入口点重复性(entry_point_repeated)。这些特征表明数据集可能用于评估代码质量、执行测试、分析代码复杂度和可维护性,适用于机器学习和自然语言处理任务中的代码相关研究。

This dataset is designed for code analysis and evaluation, containing 164 training examples. The features include task ID (task_id), entry point (entry_point), executability (is_executable), correctness (is_correct), number of tests passed and failed (tests_passed, tests_failed), test run time (test_run_time_ms), error type (error_type), Halstead software metrics (such as vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity (cyclomatic_complexity), maintainability index (maintainability_index), code line statistics (loc, sloc), comment percentage (comment_percentage), type-token ratio (TTR), token dictionary (token_dict), Shannon entropy (shannon_entropy), mean and maximum predictive entropy (mean_predictive_entropy, max_predictive_entropy), number of functions defined (n_func_defined), and entry point repetition (entry_point_repeated). These features suggest that the dataset can be used to assess code quality, execute tests, analyze code complexity and maintainability, and is suitable for code-related research in machine learning and natural language processing tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g8_run1_metrics 数据集图片
构建方式
该数据集由自噬代码(autophagycode)团队构建,旨在评估代码生成模型在可信策略下的输出质量。其构建过程基于Qwen3-8B模型,采用信任系数为1.25、组采样数为8的特定配置进行代码生成,并对生成的代码进行多维度指标计算。数据集包含164条训练样本,每条样本均记录任务标识、入口函数名、编译执行状态、测试通过失败计数、运行时间等基础信息,同时融入Halstead复杂度系列的词汇量、长度、体积、难度、工作量与时间度量,辅以圈复杂度、可维护性指数、代码行数、注释率、词元比率、香农熵及预测熵等深度特征,全方位刻画生成代码的结构与质量属性。
使用方法
该数据集适用于监督学习任务,特别是代码生成质量评估模型的训练与验证。使用者可加载训练集并提取特征列(如Halstead指标、复杂度度量、熵值等)作为输入,以执行正确性或测试通过率等为标签,构建回归或分类模型。也可将代码文本与这些结构化特征结合,用于多模态代码质量预测。数据集的JSON结构便于通过Python的HuggingFace Datasets库直接加载,各特征均为数值或布尔类型,适合与深度学习框架无缝对接。建议在应用时对数值特征进行标准化预处理,并关注样本不平衡等潜在问题。
背景与挑战
背景概述
该数据集由从事自动代码生成与量化评估的研究团队构建,聚焦于大语言模型在代码生成任务中的代码质量与执行可靠性。数据集创建于2025年,核心研究问题在于如何多维量化评估模型生成代码的可执行性、复杂性、可维护性及信息熵特征,从而为模型优化提供细粒度反馈。其影响力体现在为代码智能领域提供了超越传统通过率的评估体系,融合了Halstead复杂度、圈复杂度、香农熵等度量指标,推动了代码生成评测从单一正确性向综合软件工程度量标准的演进。
当前挑战
数据集面临的挑战包括:一是领域问题层面,现有代码生成评测多关注执行通过率,难以捕捉代码的内在质量差异,而该数据集需通过多维软件度量指标建立更科学的评估框架;二是构建过程中,需要确保每个样本的测试结果与代码度量数据准确关联,同时处理部分样本因环境依赖或执行超时导致的非确定性错误,并有效整合异构的复杂度指标以形成统一的评估范式。
常用场景
经典使用场景
在代码生成与自动化测试领域,该数据集为评估大语言模型生成的代码质量提供了系统性基准。其核心使用场景在于对模型输出的代码进行多维度的自动化度量,包括功能正确性(通过测试通过率与失败数衡量)、代码复杂度(如圈复杂度、Halstead复杂度)、可维护性(维护性指数)以及代码熵(香农熵与预测熵)。这些指标共同构建了一个从语法正确性到语义合理性的综合评价框架,使得研究者能够精准定位模型在代码生成中的薄弱环节。
解决学术问题
该数据集解决了代码生成领域长期存在的评估碎片化问题——传统方法仅关注功能性测试通过率,而忽视了代码的内在质量属性。通过整合Halstead复杂度、圈复杂度和维护性指数等软件工程经典指标,研究者得以系统性地探究大语言模型在生成可读性强、结构简洁的代码方面的能力边界。这对于理解模型是否真正掌握了编程范式,而非机械地记忆代码模式具有重要理论意义,推动了代码智能评估从单一功能正确性向多维质量度量的范式转变。
实际应用
在实际应用中,该数据集可作为自动化代码审查系统的质量判别依据。开发者可借助其丰富的指标集,将模型生成的代码按复杂度与可维护性进行分级排序,优先推荐低熵、低复杂度的优质代码片段。同时,这些度量数据能够为持续集成流水线提供量化反馈,当新生成的代码导致可维护性指数骤降时自动触发预警,从而保障软件项目的长期质量。企业级代码辅助工具亦可基于此数据集训练质量预测模型,实现代码生成的即时质量诊断。
数据集最近研究
最新研究方向
该数据集聚焦于代码智能生成与执行验证的前沿交叉领域,通过整合Halstead复杂度、圈复杂度、维护性指数等软件度量指标与代码执行正确性、测试通过率等运行时表现,为评估大型语言模型(如Qwen3-8B)生成的代码质量提供了多维量化基准。当前研究热点在于利用此类多模态特征揭示模型在复杂编程任务中的局限性,结合对抗性指令测试与熵值分析,推动代码生成系统从表面语义匹配向逻辑严谨性与可维护性并重的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务