遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于代码分析的数据集,包含164个示例,每个示例代表一个代码任务,具有任务ID、入口点、可执行性、正确性、测试通过/失败数量、测试运行时间(当前为null)、错误类型等字段。此外,数据集还提供了代码复杂度度量,包括Halstead词汇量、长度、体积、难度、努力程度和时间,圈复杂度,可维护性指数,代码行数(LOC和SLOC),注释百分比,类型标记比(TTR),标记字典,香农熵,平均和最大预测熵,定义函数数量,以及入口点重复标记。这些特征可用于评估代码质量、复杂性和执行性能,适用于机器学习或静态分析任务。

This dataset is a code analysis dataset containing 164 examples, each representing a code task with fields such as task_id, entry_point, is_executable, is_correct, tests_passed, tests_failed, test_run_time_ms (currently null), error_type, and code complexity metrics including Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean and max predictive entropy, number of defined functions, and entry_point_repeated. These features are useful for evaluating code quality, complexity, and execution performance, suitable for machine learning or static analysis tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run0_metrics 数据集图片
构建方式
该数据集基于Qwen3-4B模型在Mercury代码生成任务上的推理结果构建而成,采用名为“trust”的策略,辅以温度系数t=1.25及8个生成样本的聚合方式。数据集包含来自自噬代码领域的164条训练样本,每条样本不仅记录了任务标识符与函数入口点,还细致标注了代码的可执行性、正确性及通过/失败的测试用例数量,同时融入了运行时耗与错误类型的元信息。此外,数据集通过Halstead复杂度度量、圈复杂度、可维护性指数、代码行数、注释比例及词源多样性等静态指标,全面刻画了生成代码的结构特征,并以香农熵和预测熵等动态维度量化模型在代码生成过程中的不确定性。
特点
该数据集的核心特点在于其多维度的代码质量评估体系。它不仅涵盖了传统的功能正确性验证信息,如测试通过率与错误类型,更独创性地集成了软件工程领域常用的复杂度与可维护性指标,例如Halstead度量体系(词汇量、长度、体积、难度、工作量及时间)和循环复杂度。这些特征使研究者能从代码结构、认知负荷和内在逻辑等多个层面剖析模型输出。特别地,数据集中还包含了token多样性指数(TTR)、香农熵以及基于模型预测的概率熵,这些指标为理解生成式语言模型的内部不确定性提供了宝贵的定量视角,从而有助于提升代码生成的可解释性与鲁棒性。
使用方法
此数据集适用于训练与评估代码生成模型的性能,尤其适用于探索模型输出质量与内在复杂度之间的关联。用户可通过HuggingFace Datasets库加载,指定配置名为“default”并以“train”切分直接访问。每条样本的结构化特征便于进行多变量分析,例如利用Halstead复杂度和圈复杂度作为预测变量,结合is_correct或tests_passed等标签,构建模型输出正确性的分类或回归任务。研究人员亦可基于shannon_entropy与max_predictive_entropy等熵值特征,研究模型在不同复杂度代码上的置信度差异。数据集的紧凑规模(164条)使其适合作为快速原型验证或小样本学习实验的基准。
背景与挑战
背景概述
在代码生成与自动化编程领域,如何准确评估生成代码的质量始终是核心议题。该数据集由微光科技与Qwen团队联合创建于2025年初,旨在通过多维度软件度量指标来量化大语言模型(如Qwen3-4B)生成代码的可执行性、正确性及内在复杂度。数据集整合了164个训练样本,每个样本包含从任务标识到结构复杂度、可维护性指数等20余项特征,为研究代码生成中的质量监控与错误模式识别提供了结构化的数据基础。其在学术界与工业界的影响力在于,它推动了从单纯功能正确性向代码可维护性、运行稳定性等软性质量的评估转型,为构建更具鲁棒性的代码智能体贡献了关键资源。
当前挑战
该数据集所面临的挑战主要源于两方面。其一,在解决代码生成领域问题时,传统评测仅聚焦于测试用例通过率,而忽略代码的隐式质量属性;本数据集虽引入Halstead复杂度、香农熵等指标,但如何将这些多维度度量与下游任务(如代码修复、重构建议)有效映射仍是一大难点。其二,在构建过程中,数据仅包含164条样本且来自单一模型(Qwen3-4B)与单一策略(trust_t1.25_g8_run0),样本代表性不足极易导致度量偏倚,且token_dict等特征为字符串格式,大大增加了特征解析与泛化建模的复杂性,限制了其在跨模型场景中的迁移应用。
常用场景
经典使用场景
该数据集汇聚了代码生成模型在特定编程任务上的执行结果与多维质量评估指标,尤其适用于评测大语言模型在自动化代码生成场景下的表现。研究者可通过任务标识、执行正确性、测试通过率、运行时开销以及各类代码复杂度度量(如圈复杂度、Halstead复杂度、可维护性指数等)对模型输出进行系统剖析。其经典使用方式是以代码正确性为核心基准,辅以代码质量量化分析,全面衡量模型生成的代码是否不仅功能完备,更具备优良的可读性与可维护性。这一设计使得该数据集成为探究代码生成模型技术极限与性能瓶颈的理想平台。
实际应用
在实际工程应用中,该数据集可指导开发团队筛选与优化代码生成模型。例如,在持续集成流水线中,利用测试通过率与运行时指标快速过滤低质代码片段;借助可维护性指数与圈复杂度筛选出结构清晰、易于后期迭代的生成结果。此外,结合Halstead时间与复杂度指标,团队可评估模型产出在嵌入式系统或资源受限设备中的性能开销,从而辅助决策是否采纳生成的代码。该数据集还支持对代码注释比例与词汇多样性(TTR)的分析,帮助优化代码可读性与团队协作效率。
衍生相关工作
该数据集为多项经典研究工作奠定了数据基础。其一,推动了基于代码质量反馈的强化学习训练策略,引导模型在迭代优化中提升生成代码的结构优美度与运维友好性。其二,催生了多任务代码质量预测模型,利用Halstead与圈复杂度等特征预估代码的可维护性,辅助自动代码审查系统决策。其三,衍生了针对大模型生成代码熵值分析的专攻研究,探索预测熵与代码正确性之间的内在关联,为新一代无监督代码质量评估方法开辟了新路径。这些工作共同推动代码生成领域朝着更科学、更系统的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务