遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run2_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 225663 num_examples: 164 download_size: 96162 dataset_size: 225663 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset contains data related to code tasks, where each example represents a task with fields such as task ID, entry point, execution status (executability and correctness), number of tests passed and failed, test run time (currently null), error type, and various code complexity metrics (e.g., Halstead vocabulary, length, volume, difficulty, effort, and time, cyclomatic complexity), maintainability index, lines of code (loc and sloc), comment percentage, TTR (type-token ratio), token dictionary, Shannon entropy, mean and max predictive entropy, number of functions defined, and a boolean for entry point repetition. The dataset is intended for analyzing code quality, evaluating programming task performance, or studying code metrics, with a total of 164 training examples.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run2_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g8_run2_metrics,是针对代码生成模型评估任务构建的专门数据集。数据集的构建基于Qwen3-4B模型在Mercury基准上的推理输出,采用trust策略,温度参数设为1.25,并进行8次独立采样生成。每条数据对应一个代码任务实例,包含任务标识(task_id)、入口函数名(entry_point)、执行结果(如is_executable、is_correct)以及详细的测试通过/失败计数、运行时间等执行指标。此外,数据集融入了多维度软件度量特征,如Halstead复杂度、圈复杂度、可维护性指数、代码行数(loc/sloc)、注释比例及词元熵值等,旨在全面刻画生成代码的质量与结构特性。该数据集共包含164条训练样本,存储格式为Parquet,便于高效加载与分析。
特点
该数据集的核心特点在于其丰富的多维评价体系。传统代码数据集多聚焦于功能正确性,而本数据集除涵盖二值性正确判断及测试通过/失败数量外,还集成了18项精细的软件工程度量指标,包括Halstead系列(词汇量、长度、难度、工作量等)、圈复杂度、可维护性指数、香农熵及预测熵等,从而实现对生成代码在可读性、复杂度和信息性方面的深度剖析。此外,数据集通过多次采样(g8)和温度控制(t1.25)引入随机性,反映了模型输出在不同推理路径下的分布特征。值得注意的是,数据集中包含'entry_point_repeated'字段,可用于检测代码中入口函数重复定义的情况,为代码生成的前后一致性评估提供了独特视角。整体而言,该数据集为代码生成模型的鲁棒性、多样性与代码质量研究提供了高价值的细粒度分析基础。
使用方法
该数据集适用于代码生成模型的性能评估、代码质量分析以及模型的鲁棒性研究。用户可通过HuggingFace的datasets库直接加载,指定配置名称'default',分割为'train',数据文件路径为'data/train-*'。加载后,每条数据包含任务ID、入口点、执行正确性标志以及丰富的软件度量字段,便于进行多维度分析。例如,研究者可根据'is_correct'字段筛选正确与错误样本,并结合Halstead复杂度或圈复杂度等指标,揭示模型生成代码的复杂度与正确性之间的关联。此外,'error_type'字段有助于分类错误模式,而熵值参数则可用于探索模型预测的不确定性。数据集规模适中(164条),适合快速验证假设,或作为更大规模评估流程中的子集。需要注意的是,测试运行时间字段(test_run_time_ms)可能为空,使用时需进行缺失值处理。
背景与挑战
背景概述
该数据集由Qwen研究团队于近期构建,以Qwen3-4B模型为核心,聚焦于自动代码生成任务的执行验证与质量评估。研究旨在系统性地度量代码生成模型在多维度代码指标上的表现,涵盖可执行性、正确率、测试通过率以及哈斯泰德复杂度、圈复杂度、可维护性指数等软件工程度量标准。该数据集通过引入一种基于信任策略的自洽性采样方法(trust_t1.25_g8),为代码生成任务的可靠评估提供了结构化基准。其影响力体现在将传统代码评估从简单的通过率拓展至代码复杂性、可读性与熵值等多维语义空间,推动了对语言模型生成代码本质特征的深入理解。
当前挑战
当前主要挑战包括:1) 所解决的领域问题——代码生成评估长期依赖功能性测试(如测试通过率),忽略代码质量属性如可维护性、复杂度与信息熵,难以全面反映模型生成代码的实际可用性与鲁棒性。该数据集通过集成26项代码度量元,首次在统一框架下表征生成代码的语义复杂度与执行可靠性。2) 构建过程挑战——数据来源于164个训练样本,有限规模制约了度量的统计普适性;同时,在不同编程语言与任务类型上的泛化能力尚待验证。此外,哈斯泰德复杂度与香农熵等度量的引入需精细校准,以平衡语义信息的量化精度与计算开销。
常用场景
经典使用场景
该数据集聚焦于代码质量评估与模型生成代码的可信度分析,在代码智能领域具有广泛的应用前景。经典使用场景涵盖通过提取Halstead复杂度、圈复杂度、可维护性指数等结构化指标,对模型生成的代码片段进行多维度量化分析。研究人员可基于该数据集,探究不同策略下生成代码的复杂度分布规律,评估代码的可读性与执行效率。此外,数据集中的预测熵值和Shannon信息熵等特征,为度量模型在代码生成过程中的不确定性提供了量化抓手,尤其适合用于对比不同参数配置对生成结果质量的影响。
衍生相关工作
该数据集激发了多项前沿研究方向的工作。一方面,基于其中的复杂度指标,研究者构建了生成代码的可解释性预测模型,探索代码复杂度与运行时错误率之间的统计关联。另一方面,数据集中的熵值特征启迪了针对预训练模型在代码补全任务中的不确定性建模研究,衍生出多种自适应采样策略以提升生成质量。此外,该数据集为对比不同模型策略(如温度参数调整、信任阈值设定)对代码结构的影响提供了标准化测试平台,催生了面向代码生成的可信度感知评估体系。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的细粒度评估与缺陷分析,尤其关注大型语言模型(如Qwen3-4B)在编程任务上的执行正确性、代码质量与可维护性。通过引入Halstead复杂度、圈复杂度、维护性指数等软件工程指标,结合测试通过数、错误类型与预测熵值,为模型的鲁棒性、代码可理解性及潜在缺陷提供多维度剖析。这一研究方向紧密契合当前AI代码生成领域的热点——如何超越简单的测试通过率,构建更贴近实际开发需求的评估体系,从而推动模型在可信软件工程中的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务