遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run0_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码任务的相关数据,每个示例具有任务ID、入口点、可执行性、正确性标记、测试通过/失败数量、代码复杂度度量(如Halstead指标、圈复杂度、可维护性指数)、代码行数、注释百分比、词汇多样性、熵值等特征。数据集仅包含训练分割,共164个示例,用于代码质量评估或程序分析任务。

This dataset contains relevant data for code tasks, where each example has characteristics including Task ID, entry point, executability, correctness label, number of passed/failed tests, code complexity metrics (e.g., Halstead metrics, cyclomatic complexity, maintainability index), lines of code (LOC), comment percentage, lexical diversity, entropy value and other features. The dataset only includes the training split, with a total of 164 examples, and is intended for code quality assessment or program analysis tasks.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g9_run0_metrics 数据集图片
构建方式
该数据集旨在评估大语言模型在代码生成任务上的表现,构建方式融合了多维度的自动化测试与静态代码分析。基于给定编程问题的求解方案,系统通过单元测试执行获取可执行性、正确性以及通过/失败用例数量等关键指标;同时,利用Halstead复杂度、圈复杂度、可维护性指数等十余项软件度量指标对代码结构进行量化剖析。此外,引入信息论特征如香农熵与预测熵,以揭示模型输出代码的语义多样性。最终将task_id、entry_point等元信息与上述测试、度量结果整合,形成一份封闭且结构化的评测集合。
使用方法
使用时,研究者可直接加载train分片中的数据。对于每个样本,可通过is_correct与tests_passed字段快速评估代码功能性,结合halstead_volume与cyclomatic_complexity等字段分析复杂度对性能的影响。shannon_entropy与mean_predictive_entropy可用于探究模型生成代码的重复性与模型置信度之间的关联。若有需要,token_dict字段允许展开为原始token序列,用于与代码补全或生成模型的行为进行细粒度对比。数据集默认以Argilla格式存储,兼容常见机器学习框架,便于与现有评测流水线集成。
背景与挑战
背景概述
该数据集由autophagycode团队构建,基于Qwen3-8B模型在mercury基准上的代码生成结果,聚焦于自动化代码评估与质量分析这一前沿领域。数据集创建于2025年,旨在系统性地评估大语言模型在编程任务中的表现,特别是通过执行测试、静态代码度量(如Halstead复杂度、圈复杂度)和预测性不确定性指标(如香农熵)来度量代码的正确性与可维护性。其核心研究问题在于如何从多维度客观衡量模型生成代码的可靠性,为改进代码生成模型提供数据支撑。该数据集对代码智能与软件工程交叉领域具有重要影响,推动了对大模型代码生成能力更精细化的理解。
当前挑战
该数据集所解决的领域问题在于大语言模型生成代码的可靠性与可解释性评估挑战:传统的通过率指标无法全面反映代码的语义正确性、结构复杂度与维护难度,更无法捕捉模型对生成结果的不确定性。在构建过程中,面临的挑战包括:1)需同时整合执行测试结果与多种静态代码度量指标,确保数据维度间的协调与互补;2)需从模型输出中准确提取预测性熵值,评估模型对自身生成代码的置信度;3)仅164条训练样本的规模限制了统计效力,需解决小样本场景下度量的稳定性问题。这些挑战共同刻画了从代码生成到全自动质量审核的完整闭环中存在的技术瓶颈。
常用场景
经典使用场景
该数据集专为代码生成与执行质量评估而设计,聚焦于模型生成代码的功能正确性与软件度量分析。在经典使用中,研究者利用其包含的任务标识、执行状态、测试通过率等核心字段,系统评估不同大语言模型在自动编程任务中的表现。同时,Halstead复杂度、圈复杂度、可维护性指数等软件工程指标被用于深入剖析生成代码的质量特征,为理解模型输出在结构合理性、可读性和维护性方面的差异提供了量化基准。数据集还融入了香农熵与预测熵等不确定性度量,使得对模型生成行为的置信度分析成为可能,从而形成从正确性到鲁棒性的全方位评估框架。
解决学术问题
该数据集有效解决了代码生成领域长期存在的评估维度单一化问题。传统评估往往仅关注生成代码的功能正确性,忽视了其软件工程属性对实际部署的影响。通过集成多维度度量指标,研究者得以深入探究模型在代码复杂度控制、可维护性保障以及错误类型识别等方面的瓶颈。这为构建更可靠的代码生成系统提供了理论依据,也推动了大语言模型在代码合成场景下的可信评估范式转型,促进了从单纯追求功能通过率到兼顾代码质量与工程可落地的学术方向演进。
实际应用
在实际工程应用中,该数据集可用于自动化代码审查与辅助编程工具的性能检测。开发团队能够利用其度量体系,在持续集成环境中对模型生成的代码片段进行快速质量筛选,识别出高复杂度或低可维护性的实现,从而优先进行人工干预与重构。此外,企业可基于数据集的测试结果分布,制定模型选型策略,选择在特定任务上功能与稳定性兼备的预训练模型。教育场景中,该数据集还能支持编程作业自动批改系统,通过对学生代码进行类似维度的度量,提供除正确性外的结构化反馈。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可解释性度量,通过整合Halstead复杂度、圈复杂度、维护性指数与香农熵等软件工程经典指标,构建了多维度代码质量评价体系。在大型语言模型(如Qwen3)生成代码的验证场景中,数据集不仅记录执行正确性与测试通过率,还深入捕捉错误类型与代码结构特征,为理解模型生成行为的语义可信度提供量化依据。这一研究方向直接响应了当前AI编码工具(如GitHub Copilot)面临的可靠性挑战,通过建立可复现的基准评测框架,推动代码智能领域的评估标准从单一功能正确性向可维护性、可解释性跃迁,对实现人机协同开发中的信任校准具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务