遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run1_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 250385 num_examples: 164 download_size: 103031 dataset_size: 250385 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g7_run1_metrics 数据集图片
构建方式
该数据集由autophagycode团队基于Qwen3-4B模型构建,采用了名为“mercury”的策略,在信任参数设置为1.25、生成组数为7的条件下,针对代码生成任务进行了一次运行与评估。数据集的构建核心在于对代码片段的多维度量化,不仅记录了每个任务的基本标识(task_id)和入口函数(entry_point),还通过执行测试用例来判定代码的正确性(is_correct)、通过率(tests_passed)与失败数(tests_failed),并收集了诸如Halstead复杂度指标(包括词汇量、长度、体积、难度、工作量及预期时间)、圈复杂度、可维护性指数、代码行数(loc与sloc)、注释比例、文本重复率(TTR)、香农熵以及模型预测熵等多层次特征,从而实现了对代码质量与结构特性的精细化刻画。
特点
本数据集的一大特色在于其融合了软件工程中的经典度量(如Halstead和McCabe指标)与信息论中的熵度量,构建起一个从代码静态属性到执行动态表现的全方位评估体系。其中,token_dict字段提供了代码词元的原始分布,为深入分析代码模式提供了依据;mean_predictive_entropy与max_predictive_entropy等预测熵指标,则反映了模型对生成结果的不确定度,这在代码生成的可信度研究中具有重要价值。此外,数据集包含164条训练样本,每条样本涵盖超过20个数值与非数值字段,数据量紧凑但维度丰富,特别适合用于小样本场景下的代码质量预测与模型的鲁棒性分析。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库直接加载默认配置,指定split='train'即可获取全部164条样本。每条样本以字典形式返回,包含所有预设特征,便于进行结构化分析与模型输入。研究人员可重点关注is_correct与tests_passed等标签,结合Halstead复杂度、熵值等特征,训练代码正确性预测模型或进行代码质量聚类。同时,error_type字段可用于错误模式分类任务,而诸如n_func_defined与entry_point_repeated等字段则有助于分析函数定义模式。建议在加载后对halstead_volume、cyclomatic_complexity等数值列进行归一化处理,以提高下游模型的泛化性能。
背景与挑战
背景概述
该数据集由autophagycode团队于近期构建,旨在评估Qwen3-4B模型在代码生成任务中的执行正确性与代码质量。核心研究问题聚焦于大语言模型生成代码的功能正确性、复杂度与可维护性之间的平衡。数据集包含164个训练样本,记录了模型在特定策略下的代码执行结果、错误类型以及多种软件工程度量指标,如圈复杂度、Halstead度量、可维护性指数等。该工作填补了代码智能领域中对生成代码进行多维度量化评估的空白,为理解大语言模型在自动化编程中的可靠性提供了重要支撑。
当前挑战
当前数据集面临的挑战包括三个方面:其一,代码生成任务的本质在于确保生成代码的功能正确性与语法合法性,然而模型输出的代码常存在逻辑错误或运行时异常,如何系统性地提升代码的语义保真度是亟待解决的难题。其二,构建过程中需对模型生成的代码进行自动化编译、执行与测试,这一环节涉及复杂的沙箱环境搭建与异常处理机制,尤其在处理非可执行代码或依赖缺失时,数据采集的完整性与一致性极难保障。其三,样本量仅164例,限制了度量指标的统计效力与泛化能力,如何在小样本场景下进行有意义的代码质量分析仍是重要挑战。
常用场景
经典使用场景
在代码智能与软件工程领域,该数据集为评估代码生成模型的正确性与鲁棒性提供了重要基准。通过精心设计的164个训练样本,每条样本不仅记录了任务标识与入口函数,还细致刻画了代码的可执行性、测试通过率及运行耗时,使得研究者能够多维度衡量模型生成代码的功能完备性。同时,数据集引入了Halstead复杂度、圈复杂度、维护指数等软件度量指标,为深入理解模型输出代码的结构质量与可维护性开辟了分析窗口。这一设计使其成为检验大语言模型在自动化编程任务中表现的首选资源。
实际应用
在实际工业级软件开发中,该数据集赋能了自动化代码审查与智能编程辅助工具的迭代优化。通过利用其中的Halstead复杂度与圈复杂度数据,开发团队能够量化评估AI生成的代码是否易于理解与维护,从而将其安全地集成到持续集成流水线中。此外,基于测试运行时间与通过率的细粒度记录,该数据集可帮助训练具备自适应测试能力的代码补全模型,使其在生成后立即提供质量反馈,极大提升了人机协作编程的效率与可靠性。
衍生相关工作
该数据集催生了多项富有影响力的衍生研究。首先,基于其提供的错误类型与熵值特征,研究者构建了面向代码错误的预测性分类模型,显著提升了调试过程中缺陷定位的速度。其次,数据集中的维护指数与注释百分比被用于训练代码可读性自动评分系统,为自动化代码审查工具提供了新的评估维度。最后,围绕Shannon熵与预测熵的分布特性,学界探索了代码生成模型在不确定性感知下的行为规律,孕育出了生成质量不确定性量化这一新兴研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务