遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练示例,总大小为234931字节,下载大小为102215字节。数据集的特征涵盖了任务标识、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间(当前为null值)、错误类型、多种代码复杂度度量(如Halstead度量、圈复杂度、可维护性指数)、代码行数(包括总行数和源代码行数)、注释百分比、TTR(类型标记比率)、令牌字典、香农熵、预测熵(均值和最大值)、定义函数数量以及入口点重复性等字段。这些特征主要用于代码分析和评估任务,可能涉及代码质量、执行结果或机器学习模型预测。

This dataset comprises 164 training instances, with a total size of 234,931 bytes and a download size of 102,215 bytes. The features of this dataset encompass fields including task identifier, entry point, executability, correctness, number of passed/failed tests, test runtime (currently null), error type, various code complexity metrics (e.g., Halstead metrics, cyclomatic complexity, maintainability index), lines of code (including total lines and source code lines), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, predictive entropy (mean and maximum values), number of defined functions, and entry point repetition. These features are predominantly utilized for code analysis and evaluation tasks, which may involve code quality, execution results, or machine learning model prediction.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run0_metrics 数据集图片
构建方式
该数据集源自对编程代码生成的深度评估,基于Qwen3-4B模型在特定策略下的生成结果进行构建。数据集中包含164个训练样本,每个样本对应一个独立的代码任务,通过执行测试用例获取代码的正确性、执行耗时及错误类型。除了基础的执行结果外,数据集还纳入了对代码复杂度的详细量化指标,如Halstead复杂度、圈复杂度与维护指数,以及代码熵值与词频统计等特征,从而形成一套多维度、可追溯的代码质量评估体系。
特点
本数据集的核心特色在于其全面而精细的代码质量刻画能力。它不仅记录了代码是否通过测试(is_correct)及通过比例(tests_passed),还集成了软件工程领域成熟的复杂度度量(如Halstead体积、难度、工作量)和香农熵、预测熵等信息论特征,为分析代码的结构性优劣提供了量化依据。此外,数据集中包含词元字典与词汇丰富度(TTR)等文本统计特征,使得研究人员能够从执行结果、逻辑复杂度与语言多样性三个层次深入剖析代码生成模型的表现。
使用方法
该数据集适用于监督学习与代码生成模型评估任务。使用者可直接按默认配置加载训练集,利用is_correct或tests_passed等标签训练分类模型以预测代码正确性,也可将复杂度特征作为输入,构建回归模型探究代码质量与可维护性的关联。数据集以标准HuggingFace格式组织,支持通过datasets库进行便捷加载与特征筛选,便于研究人员快速开展对比实验或进行代码质量的统计学分析。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g9_run0_metrics,由autophagycode团队于近期构建,旨在评估代码生成模型在特定策略下的执行性能与代码质量。其核心研究问题聚焦于如何通过信任策略(trust strategy)引导Qwen3-4B模型生成更加可靠、可执行且复杂度适中的代码片段。数据集包含164条训练样本,涵盖任务ID、入口点、可执行性、测试通过率、Halstead复杂度、圈复杂度、维护指数等30余项细粒度指标,为代码智能领域提供了多维度的质量评估基准。该数据集的创建对于推动代码生成模型从单纯关注语法正确性向综合考量可维护性、执行效率与语义鲁棒性转变具有重要意义,尤其是在自动化编程与智能软件开发工具的研究中具有潜在应用价值。
当前挑战
该数据集面临的挑战主要体现在三个方面。首先,在领域问题层面,当前代码生成模型普遍面临生成代码可执行性低、逻辑错误隐蔽以及测试覆盖不充分等难题,数据集通过引入is_executable、tests_passed等字段实现了对执行正确性的量化评估,但如何设计更全面的测试用例以覆盖边界条件与异常路径仍是关键挑战。其次,在构建过程中,数据收集依赖特定模型(Qwen3-4B)与策略(trust strategy)的耦合,导致样本分布可能存在偏好偏差,例如部分代码片段的复杂度指标(如Halstead体积、圈复杂度)分布不均,影响泛化能力。此外,数据集的规模仅为164条样本,面对多样化的编程任务和长尾错误模式,统计显著性与代表性存在不足,可能限制其在复杂真实场景下的应用效果。
常用场景
经典使用场景
该数据集聚焦于代码生成任务的自动化评估与指标分析,是衡量和优化大语言模型代码生成能力的重要基准。经典使用场景涵盖单元测试通过率、代码复杂度与可维护性等多维度评价体系,研究者借助该数据集可系统分析模型生成代码的功能正确性与软件质量属性,从而推动代码生成领域的定量比较与标准化评估范式发展。
实际应用
在实际应用中,该数据集可用于代码审查系统的性能校准、自动编程辅助工具的生成结果筛选,以及开发者编程效率的追踪分析。通过量化模型生成代码的执行正确性与结构优雅性,支持技术团队在持续集成流水线中嵌入自动化质量门禁,降低人工审查成本并加速软件交付周期。
衍生相关工作
基于该数据集衍生的相关工作包括代码复杂度与可执行正确性的关联建模、基于软件指标反馈的代码生成策略优化,以及多任务学习框架下的代码质量预测。这些研究进一步探索了代码度量指标对模型训练与推理的指导作用,促进了代码生成领域从单一正确性评估向软件工程全面质量保障的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务