遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务执行结果及其代码质量度量指标,包括任务ID、入口点、是否可执行、是否正确、测试通过/失败数量、测试运行时间、错误类型、Halstead复杂度(词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数、有效代码行数、注释百分比、词元类型-词元比(TTR)、词元字典、香农熵、预测熵以及函数定义数量等特征。数据主要用于分析代码正确性、复杂度与可维护性。

This dataset contains code task execution results and code quality metrics, including task ID, entry point, is executable, is correct, tests passed/failed, test run time, error type, Halstead metrics (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code, source lines of code, comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, predictive entropy, and number of functions defined. The data is primarily used for analyzing code correctness, complexity, and maintainability.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run0_metrics 数据集图片
构建方式
该数据集源于代码生成模型在编程任务上的评估与优化实践,基于Qwen3-4B模型在Mercury基准上的推理输出构建而成。数据集通过自动化执行测试用例,获取代码在编译与运行阶段的执行结果,收录了任务标识、入口函数、可执行性、正确性、通过及失败的测试数量等关键指标。同时,集成Halstead复杂度、圈复杂度、可维护性指数、代码行数、注释占比、词元多样性比率及信息熵等软件度量指标,从而形成一套多维度、结构化的代码质量与执行性能评估体系。数据共计164条训练样本,涵盖字符串、布尔、整数及浮点数等多种数据类型,以Parquet格式存储,便于高效加载与处理。
使用方法
本数据集适用于代码生成模型的性能评估与质量分析任务。开发者可直接通过Hugging Face Datasets库加载,使用默认配置读取训练分割数据。数据集中的布尔与数值型字段可支持直观的二分类与回归建模,例如通过'is_correct'字段评判代码正确性,或结合圈复杂度与Halstead指标探究模型生成代码复杂性的分布特征。对于需要深入理解代码生成行为的研究场景,可借助词元字典与信息熵字段进行语义层面的探索分析。建议用户结合自身评估目标,选择相应的字段组合进行统计建模或可视化呈现。
背景与挑战
背景概述
该数据集由autophagycode团队构建,依托Qwen3-4B模型在策略信任(strategy_trust)场景下生成,旨在评估代码生成任务的执行正确性、测试通过率及代码质量。数据集创建时间未明确标注,但反映了当前大语言模型在代码生成领域的前沿探索。核心研究问题聚焦于如何量化模型生成代码的可执行性与健壮性,通过引入Halstead复杂度、圈复杂度、维护指数等软件度量指标,以及香农熵、预测熵等不确定性指标,为多维度评估代码可信度提供基准。该数据集的影响力在于推动代码智能领域从单纯的功能正确性评估向代码质量、可维护性与安全性的综合考量演进,为自动化代码审查与模型改进提供了量化依据。
当前挑战
该数据集所解决的领域挑战在于,现有代码生成评估多依赖测试用例通过率,忽视代码内部结构质量与执行风险。数据集中包含的164个训练样本规模有限,但覆盖了代码行数、注释率、复杂度、词法多样性及不确定性共26项指标,构建过程中的挑战包括:如何统一不同编程语言的度量标准,如何平衡可执行性测试与纯静态分析的权重,以及如何从模型预测层提取可靠的不确定性特征(如平均预测熵)来反映生成代码的置信度。此外,部分字段如token_dict需序列化存储,增加了数据解析与复用的复杂度;空值字段(如test_run_time_ms)的缺失也需在建模时审慎处理。
常用场景
经典使用场景
在代码生成与自动修复的研究领域,autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g2_run0_metrics数据集为评估模型生成代码的质量提供了精细化的度量标准。该数据集不仅记录了任务标识符、入口函数等基础信息,还涵盖了代码的可执行性、正确性、测试通过率、运行时性能以及丰富的代码复杂度指标,如圈复杂度、Halstead复杂度、可维护性指数等。这些多维度的度量数据使得研究者能够从功能正确性与内在质量两个层面深入剖析代码生成模型的表现,成为代码智能领域中评估与优化模型不可或缺的基准资源。
解决学术问题
该数据集致力于解决代码生成领域长期面临的质量评估碎片化与主观性问题。传统的评估往往仅关注代码是否通过测试,忽略了代码的可读性、可维护性与计算效率等深层次属性。通过引入Halstead复杂度、圈复杂度、香农熵等量化指标,数据集为学术界提供了一个系统化、标准化的评估框架,使得不同模型生成的代码可以在统一维度上进行公平比较。这不仅促进了代码生成模型从追求功能正确向兼顾高质量代码的艺术转变,也推动了对代码内在结构复杂性与可理解性的理论探索,为构建更鲁棒、更高效的代码合成系统奠定了重要基础。
实际应用
在实际应用中,该数据集可深度服务于企业级的代码审查与自动化编程工具。基于数据集中记录的代码度量信息,开发团队能够快速识别自动生成代码中的潜在风险区域,例如高圈复杂度或低可维护性指数的代码片段,从而优先进行人工复核或重构。此外,该数据集还可用于训练代码质量预测模型,帮助集成开发环境实时向开发者提供代码改进建议,或辅助持续集成管道自动判定生成代码是否达到部署标准。这些应用场景显著提升了软件开发的效率与代码的长期可维护性,缩短了从代码生成到上线的迭代周期。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的多维度评估与可解释性分析,融合了执行正确性、代码复杂度(如圈复杂度、Halstead度量)及信息论指标(如香农熵、预测熵),反映了当前代码智能领域从单一正确性向代码质量、可维护性与认知负荷综合评估的演进趋势。结合大型语言模型在自动化编程中的热点应用,该数据集为探究模型生成代码的鲁棒性、效率及人类理解一致性提供了量化基准,对推动安全可靠代码合成与智能编程助手的发展具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务