遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run1_metrics

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含164个训练样本,每个样本代表一个代码任务,具有多个特征字段。这些字段包括任务ID(task_id)、入口点(entry_point)、可执行性(is_executable)、正确性(is_correct)、通过和失败的测试数量(tests_passed、tests_failed)、测试运行时间(test_run_time_ms)、错误类型(error_type)、Halstead复杂度度量(如词汇量、长度、体积、难度、努力和时间)、圈复杂度(cyclomatic_complexity)、维护性指数(maintainability_index)、代码行数(loc和sloc)、注释百分比(comment_percentage)、令牌类型比率(TTR)、令牌字典(token_dict)、香农熵(shannon_entropy)、预测熵的均值和最大值(mean_predictive_entropy、max_predictive_entropy)、定义函数数量(n_func_defined)以及入口点是否重复(entry_point_repeated)。数据集旨在支持代码分析、质量评估和机器学习任务,可能用于研究代码复杂度、可维护性和执行性能。

This dataset contains 164 training examples, each representing a code task with multiple feature fields. These fields include task ID (task_id), entry point (entry_point), executability (is_executable), correctness (is_correct), number of tests passed and failed (tests_passed, tests_failed), test run time (test_run_time_ms), error type (error_type), Halstead complexity metrics (such as vocabulary, length, volume, difficulty, effort, and time), cyclomatic complexity (cyclomatic_complexity), maintainability index (maintainability_index), lines of code (loc and sloc), comment percentage (comment_percentage), token type ratio (TTR), token dictionary (token_dict), Shannon entropy (shannon_entropy), mean and maximum predictive entropy (mean_predictive_entropy, max_predictive_entropy), number of functions defined (n_func_defined), and whether the entry point is repeated (entry_point_repeated). The dataset is designed to support code analysis, quality assessment, and machine learning tasks, potentially for research on code complexity, maintainability, and execution performance.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run1_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run1_metrics,源自对代码生成模型Qwen3-4B在'mercury'任务上的评估结果。构建过程基于特定的信任策略(trust策略)和温度参数t1.1、生成次数g6,对模型输出的代码样本进行多维度测试与度量。每条数据记录了代码执行的正确性、通过/失败的测试用例数量、运行时错误类型,以及通过静态分析工具提取的Halstead复杂度指标(包括词汇量、长度、体积、难度、努力度和时间)、圈复杂度、可维护性指数、代码行数(loc和sloc)、注释占比、文本重复率(TTR)、token分布、香农熵和预测熵等丰富特征。数据集共包含164条训练样本,以JSON结构存储,字段类型涵盖字符串、布尔、整数和浮点数,确保信息全面且结构化。
特点
该数据集最显著的特点在于其多维度的代码质量与复杂度评估体系。除了基本的执行正确性(is_correct)和测试通过/失败计数外,还引入了Halstead系列指标(如词汇量、体积、难度、努力度和时间)和圈复杂度,从认知负荷和控制流角度量化代码难度。可维护性指数和注释比例则反映了代码的可读性与长期维护成本。特别地,数据集包含了香农熵和预测熵(包括均值和最大值),这些信息论特征能揭示代码令牌的随机性和可预测性,为模型行为的细粒度分析提供支撑。此外,entry_point_repeated字段标记了函数入口点是否重复,n_func_defined统计了定义函数的数量,这些设计使得数据集不仅能评估模型生成代码的功能正确性,还能深入剖析其结构特性与潜在缺陷。
使用方法
本数据集可直接用于代码生成模型的性能评估与行为分析。用户可通过加载HuggingFace上的默认配置(config_name: default),读取train分片(数据路径为data/train-*),共164条样本。每条样本中的task_id和entry_point可用于关联原始任务,is_executable和is_correct字段帮助快速筛选可执行代码及其功能正确性。研究人员可利用Halstead指标、圈复杂度和可维护性指数等特征,构建代码复杂度与模型表现之间的关联模型。香农熵和预测熵则适合用于探究模型输出的不确定性分布。建议结合原始模型输出和测试用例集,对错误类型(error_type)进行深入分析,以定位模型在特定领域或复杂度级别上的薄弱环节。
背景与挑战
背景概述
该数据集名为 autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g6_run1_metrics,由相关研究团队在近期创建,旨在评估大语言模型在自动代码生成任务中的性能表现。随着大语言模型在编程辅助领域的广泛应用,如何系统性地衡量生成代码的正确性、效率与可维护性成为关键研究问题。该数据集聚焦于代码质量的多维度量,涵盖执行正确性、测试通过率、运行时性能以及包括Halstead复杂度、圈复杂度、可维护性指数等在内的软件工程指标。通过对164条训练样本的精细标注,该数据集为探究模型生成代码的可靠性与鲁棒性提供了量化基础,对推动代码智能评估标准的发展具有重要意义。
当前挑战
该数据集所解决的领域核心挑战在于大语言模型生成代码的可信度评估。一方面,模型生成的代码在面对复杂边界条件时往往存在隐式错误,仅靠测试通过率难以全面反映代码质量,需引入多维度软件度量指标进行综合评判。另一方面,数据集构建过程面临标注一致性难题,不同代码执行环境的差异可能导致测试结果偏差,同时代码复杂度度量如Halstead指标的计算依赖准确的词汇和操作符解析,对于包含语法错误的代码片段统计结果易出现失真。此外,样本量仅164条,规模有限,难以覆盖多样化的编程任务场景,限制了模型泛化能力的验证深度,亟需在后续工作中扩充数据规模与任务类型。
常用场景
经典使用场景
该数据集广泛应用于代码执行正确性评估与代码质量度量的交叉研究场景。通过记录每个编程任务在模型生成后的执行结果(如测试通过数、失败数、运行时间)以及复杂的语义错误类型,研究者可以系统量化代码的功能正确性。同时,数据集提供了Halstead复杂度指标(如词汇量、长度、容积、难度、工作量)、圈复杂度、可维护性指数等经典软件工程度量项,使得评估生成代码的复杂度与可读性成为可能。这一设计使得该数据集成为连接代码自动生成任务执行性能与软件质量保障的桥梁性资源。
实际应用
在实际应用中,该数据集可服务于大语言模型代码生成质量的自动化评测流水线。开发者可以基于数据集中记录的测试执行结果与代码度量数据,设计精准的评分机制,用于模型训练阶段的强化学习奖励信号或推理阶段的筛选策略。在工业级代码审查平台中,该数据集可作为评价生成代码可维护性与执行风险的标准参考。此外,它也适用于代码教学评价系统,帮助识别学生编写的代码在正确性与简洁性之间的平衡状况。
衍生相关工作
基于此数据集,衍生出一系列针对生成代码质量的多维度评估工作。研究者利用Halstead复杂度与执行指标,构建了考虑代码结构简洁性的模型排名方法。另有工作聚焦于可维护性指数与香农熵的关联分析,探索模型生成代码的冗余模式与可理解性之间的内在联系。部分经典研究通过TTR(词符比例)与预测熵指标,揭示了不同训练策略下模型输出差异性的演化规律,为后续量化代码多样性提供方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务