遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g10_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于代码任务执行与度量的结构化信息,主要用于分析和评估代码质量与复杂性。数据集的字段(features)包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、测试通过/失败数量(tests_passed/tests_failed)、错误类型(error_type),以及多种代码度量指标,如Halstead复杂度(包括词汇量、长度、体积、难度、努力程度和时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc和sloc)、注释比例(comment_percentage)、类型-标记比(TTR)、标记字典(token_dict)、香农熵(shannon_entropy)、预测熵(mean_predictive_entropy和max_predictive_entropy)、定义函数数量(n_func_defined)和入口点重复性(entry_point_repeated)。数据集仅包含一个训练集(train),共有164个样本,总大小约为232KB,适用于代码分析、机器学习模型训练或软件工程研究等任务。

This dataset contains structured information on code task execution and metrics, primarily for analyzing and evaluating code quality and complexity. The datasets features include task ID (task_id), entry point (entry_point), executability (is_executable), correctness (is_correct), number of tests passed/failed (tests_passed/tests_failed), error type (error_type), and various code metrics such as Halstead complexity (including vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity (cyclomatic_complexity), maintainability index (maintainability_index), lines of code (loc and sloc), comment percentage (comment_percentage), type-token ratio (TTR), token dictionary (token_dict), Shannon entropy (shannon_entropy), predictive entropy (mean_predictive_entropy and max_predictive_entropy), number of functions defined (n_func_defined), and entry point repetition (entry_point_repeated). The dataset includes only a training set (train) with 164 examples and a total size of approximately 232KB, suitable for tasks like code analysis, machine learning model training, or software engineering research.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g10_run0_metrics 数据集图片
构建方式
该数据集构建于对代码生成模型输出的系统性评估之上,旨在量化生成代码的质量与可执行性。数据源于针对特定编程任务(task_id)的模型推理结果,每条记录包含入口函数(entry_point)、可执行性标志(is_executable)与正确性判断(is_correct)。通过对测试用例的通过数(tests_passed)与失败数(tests_failed)进行统计,结合执行时间(test_run_time_ms)与错误类型(error_type)的标注,构建了多维度的执行结果层。在此基础上,进一步引入了Halstead复杂度系列指标(如词汇量、长度、体积、难度、工作量及时间)、圈复杂度(cyclomatic_complexity)、可维护性指数(maintainability_index)、代码行数(loc)与有效代码行数(sloc)等静态分析特征。数据集还包含注释百分比(comment_percentage)、词符比(TTR)、香农熵(shannon_entropy)与预测熵(mean_predictive_entropy, max_predictive_entropy),以及函数定义数量(n_func_defined)与入口点重复性(entry_point_repeated)等结构性标识,形成了从执行到静态的多层次评判体系。
使用方法
该数据集以HuggingFace标准格式存储,默认配置名为“default”,数据文件位于train目录下,可通过datasets库的一键加载接口进行读取。用户仅需调用load_dataset函数指定数据集路径与配置名,即可获得包含全部特征的训练分片(train split)。数据中的特征类型涵盖字符串(string)、布尔型(bool)、整型(int64)与浮点型(float64),便于直接用于机器学习模型的输入或统计分析。推荐使用者将task_id与entry_point作为任务标识,利用is_correct、tests_passed等字段构建分类或回归标签,以Halstead系列指标、圈复杂度等作为特征向量,训练代码质量预测模型。亦可结合shannon_entropy及各项熵值,对生成代码的多样性进行排序或聚类分析。对于需要细粒度可执行性评估的场合,error_type与is_executable字段提供了直接的筛选依据。
背景与挑战
背景概述
该数据集由 autophagycode 研究团队构建,核心基于 Qwen3-4B 模型在代码生成任务中的行为分析,聚焦于多策略信任度评估(strategy_trust)场景。数据集创建于前沿的大语言模型代码生成能力研究浪潮中,旨在通过细粒度指标量化生成代码的质量与可靠性。其核心研究问题在于如何系统评测模型在编程问题上的执行正确性、代码复杂度及熵值特征,从而为模型安全性与可信度提供实证基础。该数据集记录了 164 条训练样本,涵盖执行状态、Halstead 复杂度、圈复杂度、维护性指数及预测熵等多维特征,对代码生成评估领域具有方法论参考价值。
当前挑战
当前面临的核心挑战包括:首先,领域问题方面,代码生成任务中模型常产生语法正确但逻辑错误的“幻觉”代码,传统通过率指标难以捕捉此类语义缺陷,亟需结合熵值与复杂度特征进行深层诊断。其次,构建过程中,数据集规模仅 164 例,样本稀疏性限制了统计显著性与泛化能力,且手动标注执行正确性及错误类型需大量人工校验,易引入标注偏差。此外,多模型策略对比下的特征对齐与消融实验设计缺乏标准化流程,增加了模型行为归因的复杂性。
常用场景
经典使用场景
该数据集聚焦于代码生成模型在可执行性、正确性与代码质量方面的细粒度评估,经典使用场景在于评测大语言模型(如Qwen3-4B)在自动编程任务中的综合表现。通过记录每个生成代码片段的测试通过数、失败数、运行时间及错误类型,研究者能够精确衡量模型生成代码的功能正确性与执行效率。同时,数据集涵盖了Halstead复杂度、圈复杂度、可维护性指数、代码行数及注释比例等软件工程指标,为从代码可读性、复杂度与维护性角度评估模型输出提供了量化基础。
解决学术问题
该数据集有效解决了当前代码生成研究中评估维度单一、偏重功能正确性而忽略代码质量的问题。传统评测多依赖pass@k指标,难以反映代码的鲁棒性、可维护性与运行效率。该数据集引入了Halstead度量、圈复杂度与香农熵等软件质量指标,使得研究者能够系统性分析模型生成代码的结构复杂度、信息量与可维护性。数据集还通过计算预测熵与最大预测熵,探索模型在代码生成中的不确定性,为理解模型在编程任务中的行为机理提供了新的视角。
实际应用
在实际应用中,该数据集可用于自动化编程助手(如GitHub Copilot)的性能评估与迭代优化。开发者可通过对比不同模型在测试通过率、代码复杂度与可维护性上的差异,选择最适合特定项目规范与编码风格的代码生成方案。数据集还支持对错误类型进行归类(如语法错误、逻辑错误、运行时异常),帮助研发团队定位模型在特定编程场景下的薄弱环节,从而有针对性地优化模型。此外,企业可将该数据集嵌入持续集成流程中,对代码生成工具进行常态化质量监控。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成与执行质量的自动化评估,通过融合Halstead复杂度、圈复杂度、可维护性指数及香农熵等多维软件度量指标,结合测试通过率与运行时异常类型,构建了代码可信度与鲁棒性的精细化评价体系。这一研究方向与当前大语言模型在代码生成领域的可信性挑战紧密呼应——随着Qwen3-4B等模型在编程任务中的广泛应用,如何量化生成代码的语义正确性、执行可靠性及维护成本已成为关键瓶颈。数据集通过引入预测熵值与测试结果粒度,探索了模型生成代码与人类编写规范之间的鸿沟,为可信代码生成、自动化故障诊断及智能编程助手的可靠性升级提供了基准支撑,在开源社区与工业级代码质量管控中具有显著的前沿实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务