遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run1_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个包含代码任务相关信息的集合,主要用于分析软件质量、测试性能和代码复杂度。数据集包含164个训练示例,每个示例具有多个特征,如任务ID、入口点、是否可执行、是否正确、测试通过和失败数量、测试运行时间(当前为空)、错误类型。此外,还包括Halstead软件度量指标(如词汇量、长度、体积、难度、努力、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型-令牌比率)、令牌字典、香农熵、平均和最大预测熵、定义函数数量以及入口点是否重复。这些特征有助于评估代码的可读性、维护性和测试效果,适用于软件工程、机器学习和代码分析研究。

This dataset is a collection of information related to code tasks, primarily used for analyzing software quality, testing performance, and code complexity. It contains 164 training examples, each with multiple features such as task ID, entry point, executability, correctness, number of tests passed and failed, test run time (currently null), and error type. Additionally, it includes Halstead software metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, mean and max predictive entropy, number of functions defined, and whether the entry point is repeated. These features are useful for evaluating code readability, maintainability, and testing effectiveness, making the dataset suitable for research in software engineering, machine learning, and code analysis.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run1_metrics,是面向代码生成与执行评估领域构建的精细化评测数据集。数据集的构建基于Qwen3-4B模型在特定推理策略(strategy_trust)与参数配置(温度t=1.25,生成代数g=9)下产生的代码样本,经过严格的自动执行验证流程,记录每个样本是否可执行、正确性、通过与失败的测试用例数量,以及执行耗时等关键指标。同时,集成Halstead复杂度度量、圈复杂度、可维护性指数、代码行数、词元比(TTR)、香农熵等静态代码分析特征,形成了对生成代码质量与复杂性的多维刻画。最终汇集164条训练样本,以结构化表格形式存储,便于开展代码质量评估与模型性能分析。
使用方法
使用该数据集时,可直接通过HuggingFace的datasets库加载,指定配置名为‘default’并引用存储于‘data/train-*’路径下的训练数据文件。加载后,用户可获得一个包含25个字段的表格,每个字段对应代码样本的标识、执行结果或静态分析指标。适用于两类主要任务:一是基于正确性与执行时间等标签进行模型输出质量的监督学习评估;二是利用Halstead复杂度、圈复杂度与熵值等连续特征,探索生成代码的复杂度分布与模型行为之间的关联。研究人员可根据实际需求筛选特定字段,结合task_id与entry_point进行样本溯源,或借助token_dict字段深入分析代码的语法结构特征。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g9_run1_metrics,由研究团队在自动化代码生成与评估领域构建,旨在系统性地度量大语言模型(如Qwen3-4B)在编程任务上的行为与输出质量。数据集创建于近期,聚焦于代码执行正确性、软件复杂度指标(如Halstead复杂度、圈复杂度、可维护性指数)以及信息论特征(如香农熵、预测熵),为理解模型生成代码的可靠性、可维护性与内在不确定性提供了多维度的量化分析框架。该数据集对评估和改进代码生成模型的可信性具有重要研究价值,尤其在高风险应用中,模型输出需具备可解释性与鲁棒性。
当前挑战
当前面临的核心挑战包括:1)领域问题层面,代码生成模型普遍存在输出不可靠、缺乏可解释性的难题,该数据集通过引入执行正确性、复杂度与熵值等指标,致力于量化这些缺陷,但如何综合多维度特征以预测模型在未见任务上的表现仍是开放问题;2)构建过程中,数据样本有限(仅164条),且特征维度高(如token_dict等非结构化信息),导致统计分析与泛化能力受限;同时,特征间存在的多重共线性(如Halstead各指标间高度相关)以及部分特征缺失(如test_run_time_ms为null)增加了构建稳定评估模型的复杂性。
常用场景
经典使用场景
在代码生成与程序合成领域,该数据集为评估大语言模型在代码补全与错误修复任务上的表现提供了规范化基准。它通过记录每段生成代码的语法复杂度(如圈复杂度、Halstead度量)、执行正确性(如测试通过/失败数量)以及运行时性能指标,使得研究者能够从多个维度量化模型输出的质量。经典用法是将该数据集中的任务作为验证集,对比不同模型架构(如Qwen3-4B与同类规模模型)在Python函数级代码生成上的差异,特别关注模型在遵循特定策略(如trust策略)时的代码可信度与健壮性。
解决学术问题
该数据集的核心贡献在于系统地刻画了代码生成中鲁棒性与可维护性之间的张力,解决了长期困扰学术界的“生成代码功能正确但结构脆弱”的评估盲区。通过引入Shannon熵、预测熵及重复函数检测等静态与动态指标,它揭示了模型生成代码的多样性、可读性及潜在漏洞倾向,为理解大模型在编程任务上的泛化边界提供了数据支撑。这一数据集推动了从单纯追求测试通过率向综合考量代码质量(如Halstead时间、可维护性指数)的评估范式转变,显著影响了后续关于代码生成可解释性与安全性的研究。
实际应用
在实际工程中,该数据集可内嵌至持续集成流水线,用于自动化筛选大语言模型生成的代码片段。其包含的执行时间与测试覆盖率指标能帮助企业快速识别低效或错误倾向的代码块,并定位复杂度异常高的函数(如圈复杂度>15)。此外,该数据集提供的token级熵值与冗余定义统计,可辅助开发者在代码审查环节标记出质量存疑的生成结果,从而在DevOps流程中实现AI生成代码的质量门控,降低人工审计成本。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的性能评估与鲁棒性分析,融合了Halstead复杂度、圈复杂度、维持性指数等软件工程指标与基于香农熵的预测不确定性度量,旨在从可执行性、正确性及代码质量多维度解析大语言模型(如Qwen3-4B)在程序合成任务中的表现。当前前沿方向包括利用该数据集探索代码中的‘捷径学习’现象——即模型依赖表面特征而非真正理解逻辑——通过平均预测熵与最大预测熵的差值识别脆弱样本,并结合测试通过率与错误类型分布,构建模型可信度评估框架。此工作与近期大模型代码生成安全性热点紧密相关,为揭示模型在复杂编程题中的泛化边界与退化模式提供了实证基础,对推动可信代码智能系统的落地具有方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务