遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g7_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个样本,每个样本包含代码任务ID、入口点、是否可执行、是否正确、测试通过/失败数量、测试运行时间、错误类型,以及多种代码度量指标,包括Halstead复杂度(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、源代码行数、注释百分比、词型-词例比(TTR)、词例字典、香农熵、平均预测熵、最大预测熵、定义函数数量、入口点是否重复。这些数据可用于分析代码执行结果与代码质量之间的关系。

This dataset contains 164 samples, each including task ID, entry point, whether the code is executable, whether it is correct, number of tests passed/failed, test run time, error type, and various code metrics: Halstead measures (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and whether the entry point is repeated. These data are useful for analyzing the relationship between code execution outcomes and code quality.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g7_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g7_run0_metrics,源自代码生成与自动化评测领域,旨在系统评估大语言模型在编程任务中的表现。构建方式上,数据集以HuggingFace格式存储,包含164条训练样本,每条样本以task_id和entry_point唯一标识一个编程问题。数据集的独特之处在于不仅记录模型生成代码的可执行性(is_executable)与正确性(is_correct),还细致统计了通过和失败的测试用例数量(tests_passed、tests_failed)及运行耗时,从而构建多维度评测指标。此外,数据集中融入了Halstead复杂度指标(如词汇量、长度、难度、工作量等)、圈复杂度、可维护性指数以及代码行数等静态代码度量特征,形成对生成代码质量的全方位量化剖析。
特点
此数据集的核心特点在于其兼具功能验证与代码质量分析的双重维度。与传统仅关注通过率的评测数据集不同,它不仅通过tests_passed和tests_failed提供明确的正确性标签,还引入error_type字段以区分不同失败类型,便于深入诊断模型错误模式。更为突出的是,数据集纳入了从代码文本中提取的丰富复杂度指标,如Halstead系列度量、圈复杂度和香农熵,以及基于模型预测的熵值(mean_predictive_entropy、max_predictive_entropy),使得研究者能够关联代码的统计特性与模型输出行为。这种复合结构使得数据集不仅可用于评估模型生成代码的功能正确性,还能支持对代码质量、可维护性和模型不确定性的探索性分析,从而为代码生成模型的细粒度改进提供数据支撑。
使用方法
该数据集可直接用于代码生成模型的评测与诊断任务。使用者可通过task_id和entry_point定位具体编程问题,利用is_correct和tests_passed等字段快速评估模型在该问题上的表现。若需深入分析,可借助error_type字段分类失败原因,并利用Halstead复杂度、圈复杂度等特征分析生成代码的内在质量。数据集以HuggingFace标准格式组织,支持通过datasets库轻松加载:只需指定数据集名称并调用load_dataset函数,即可获取包含全部特征的训练集DataFrame。此外,研究者可将数据加载后按is_correct分组,对比正确与错误代码在各类复杂度指标上的分布差异,进而发现模型失效的模式与规律,为优化策略提供实证依据。
背景与挑战
背景概述
该数据集由基于Qwen3-8B模型,采用特定信任策略(trust_t1.25_g7_run0)对编程任务进行推理生成,是代码智能与程序分析交叉领域的一项探索性成果。其创建时间可追溯至大语言模型在代码生成与评估中的广泛应用时期,研究焦点在于通过多维软件度量指标(如Halstead复杂度、圈复杂度、可维护性指数等)量化模型生成代码的质量与可靠性。数据集涵盖了从词法多样性到执行正确性的丰富特征,为深入理解模型输出代码的结构化属性提供了基准,对评估和改进代码生成模型的鲁棒性具有潜在影响力。
当前挑战
数据集面临的主要挑战包括:1) 领域问题层面,代码生成任务不仅要求语法正确,更需逻辑无误与高可维护性,当前度量体系难以完全反映代码的语义保真度,尤其在复杂业务逻辑或边界条件下;2) 构建过程中,仅含164条训练样本,统计效力有限,可能引入采样偏差,同时特征如token_dict和熵值的高维稀疏性对分析算法的可扩展性构成考验。此外,依赖单一模型与策略的生成结果缺乏跨模型泛化验证,限制了结论的普适性。
常用场景
经典使用场景
在代码生成与自动编程领域,该数据集扮演着评估与提升大语言模型代码生成质量的关键角色。其设计精髓在于深度融合了多种代码质量度量指标,如圈复杂度、Halstead复杂度、可维护性指数以及预测熵值等,从而为判断模型生成本地代码的准确性、可执行性和复杂度提供多维度的量化视图。研究者常借助此数据集,针对性地对比不同策略(如信任策略与温度采样)下模型输出代码的结构合理性,进而优化模型在函数级代码补全与生成任务中的表现。
衍生相关工作
基于该数据集衍生了多项聚焦于代码质量预测与模型校准的经典工作。例如,研究者通过分析其记录的预测熵与测试通过率之间的关联,提出了针对不确定性的代码生成置信度模型,用以动态调整模型采样的温度参数。另一方向的工作则利用其丰富的Halstead与圈复杂度特征,构建了可迁移的代码可维护性评估器,使得不同规模的编程模型能自适应地调整输出策略,以减少高复杂度代码的错误概率。这些工作共同催生了面向鲁棒性的代码智能基准研究分支。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在可执行性、正确性与代码复杂度指标上的深度评估,是当前大语言模型(LLM)代码生成能力验证的前沿课题。随着Qwen3-8B等模型在编程任务上的广泛应用,研究重心从单纯的通过率转向代码的软件工程质量,包括圈复杂度、Halstead复杂度及维护性指数等静态度量。该数据集通过多维度指标(如香农熵、预测熵、测试通过率与错误类型)刻画模型输出代码的内部结构与行为一致性,为揭示LLM生成代码的鲁棒性、可理解性与潜在缺陷提供了量化工具。其影响力在于推动代码智能评估从“功能正确”向“软件质量”跨越,与当下可信AI与安全编码的热点议题紧密相连。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务