遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run2_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,用于代码或软件工程相关任务的分析。特征包括任务标识、入口点、可执行性、正确性、测试结果(通过/失败数、运行时间)、错误类型、Halstead软件度量指标(如词汇量、长度、体积、难度、工作量、时间)、圈复杂度、可维护性指数、代码行数(总行数和源代码行数)、注释百分比、类型-标记比、令牌字典、香农熵、预测熵(平均和最大值)、定义函数数量以及入口点是否重复。数据集可能适用于评估代码质量、复杂度、可维护性和测试性能,但具体目标、来源或应用场景未在README中说明。

This dataset contains 164 training samples for analyzing code or software engineering-related tasks. Features include task ID, entry point, executability, correctness, test results (passed/failed counts, run time), error type, Halstead software metrics (e.g., vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (total and source lines), comment percentage, type-token ratio, token dictionary, Shannon entropy, predictive entropy (mean and max), number of defined functions, and whether the entry point is repeated. The dataset may be suitable for evaluating code quality, complexity, maintainability, and test performance, but specific objectives, sources, or application contexts are not described in the README.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t1.25_g3_run2_metrics,源自对Qwen3-8B模型在代码生成任务上的评估与度量结果。数据集的构建围绕自动代码执行测试展开,每一条样本对应一个编程问题,并记录了模型生成的代码在测试环境中的执行状态。具体而言,数据集包含代码是否可执行、是否通过测试、通过和失败的测试数量、执行时间等关键指标,同时引入了Halstead复杂度、圈复杂度、维护性指数、代码行数、注释占比、词元多样性等软件工程与代码质量度量指标。此外,还涵盖了香农熵、预测熵等自然语言处理视角下的模型不确定性度量,以及函数定义数量、入口点重复性等结构特征,形成了多维度的代码评估数据集。
特点
该数据集的核心特点在于将代码功能性验证与代码复杂度、模型不确定性分析有机融合,为深入理解代码生成质量提供了系统视角。数据集中每个样本不仅通过执行结果反映代码的正确性,还通过Halstead系列指标、圈复杂度等传统软件度量刻画代码的结构复杂程度,并通过维护性指数、注释占比等衡量代码的可读性与可维护性。同时,香农熵和预测熵的引入,使得研究者能够量化模型生成代码时的预测信心与不确定性。整个数据集包含164条训练样本,数据类型涵盖字符串、整数、浮点数与布尔值,字段丰富、维度多元,特别适合用于分析代码生成模型的性能瓶颈与改进方向。
使用方法
该数据集以HuggingFace数据集格式存储,默认配置文件为default,训练数据存放于data/train-*路径下,可通过HuggingFace的datasets库直接加载。用户可以使用load_dataset()函数指定数据集名称即可读取,数据以表格形式呈现,字段名称清晰、类型明确,便于后续分析与建模。数据集适用于多类型研究,例如代码质量自动评估、模型生成代码的可维护性预测、基于复杂度的测试充分性分析,以及结合不确定性度量的模型校准研究。对于需要对代码功能性与非功能性特征进行联合建模的场景,该数据集提供了规范化、多维度的数据基础,研究者可直接基于其字段进行特征工程、统计分析或机器学习模型的训练与评估。
背景与挑战
背景概述
该数据集由学术界或工业界的研究团队构建,聚焦于代码生成与执行验证的交叉领域,旨在系统评估大语言模型在编程任务中的表现。数据集创建于大语言模型高速演进时期,包含164个训练样本,每个样本详细记录了任务的执行状态、测试通过率、代码复杂度(如圈复杂度、Halstead度量)以及预测熵等特征。其核心研究问题在于:如何通过多维度代码质量指标量化模型生成代码的正确性、可维护性与运行效率,进而构建更可靠的代码生成评价范式。该数据集的出现填补了现有基准测试在细粒度执行反馈与代码质量统计方面的空白,为后续设计更鲁棒的代码生成模型提供了关键的数据支撑与评估基础。
当前挑战
数据集面临的核心挑战之一在于代码生成领域的根本性难题:即便语法正确,模型生成的代码仍可能因逻辑缺陷导致运行时错误或不完全通过测试用例,数据集通过记录错误类型与测试失败次数捕捉了这一问题。构建过程中,挑战主要体现在多维度特征采集的复杂性——需同时提取代码的词法、语义、结构及熵值特征,确保各指标间不引入冗余或噪声;此外,有限样本(164条)难以覆盖多样化的编程场景与罕见错误模式,可能限制模型泛化能力的评估效度。如何在小样本条件下平衡特征丰富性与数据代表性,并确保执行环境的高度一致性与结果的可复现性,也是该数据集持续演进中亟待解决的瓶颈。
常用场景
经典使用场景
该数据集汇集了代码执行正确性、测试用例通过率、运行时误差、代码复杂度以及多种Halstead度量指标,为评估大型语言模型在代码生成任务中的表现提供了多维度、细粒度的评测基准。经典使用场景聚焦于模型生成代码的功能正确性与质量评估,研究者可借助数据集中的'is_correct'、'tests_passed'等字段,精准衡量模型在特定编程问题上的执行能力。同时,通过引入圈复杂度、维护指数等软件工程指标,该数据集能够深入剖析模型所生成代码的可读性、可维护性及内在结构优劣。这使得它成为对比不同策略(如信任阈值、生成轮次)下模型性能差异的理想工具,为代码智能领域的基准测试提供了坚实的数据支撑。
实际应用
在实际应用中,该数据集可作为自动化代码审查与代码质量评估系统的核心组件。开发团队能够依托数据集中的Halstead复杂度、圈复杂度和维护指数等指标,快速识别模型生成代码中存在的潜在缺陷、冗余逻辑或可维护性风险,进而优化代码生成策略。此外,在开发环境集成智能代码补全或自动编程助手时,该数据集有助于建立模型输出质量的实时监控与反馈机制,促使模型生成更符合工业级代码标准的解决方案。它还可应用于教育场景,用于评估学生或编程初学者的代码质量,辅助编程教学与自动化辅导系统。
衍生相关工作
基于该数据集衍生了一系列关于模型代码生成策略优化的研究工作。研究者利用数据集中的多维度度量指标,探索了不同信任阈值、生成轮次以及数据增强方法对模型输出质量的影响,从而提出更为精准的模型选择与调优策略。此外,数据集中的代码复杂性特征被应用于训练代码质量预测模型,实现了对生成代码可维护性的前向估计。相关工作还拓展至代码克隆检测、缺陷定位及反模式识别等任务,通过引入圈复杂度和Halstead特征,显著提升了传统检测模型的准确性。这些衍生工作共同推动了代码智能从生成到评估、再到优化全链条的闭环发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务