遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g10_run1_metrics

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含代码分析或编程任务相关的数据,具体特征包括任务ID、入口点函数、可执行性状态、正确性标记、测试通过和失败数量、测试运行时间、错误类型,以及多种代码度量指标如Halstead复杂度(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、类型标记比(TTR)、令牌字典、香农熵、平均预测熵、最大预测熵、定义函数数量和入口点重复标记。数据集分为训练集,包含164个示例,总大小约230KB。

This dataset contains data related to code analysis or programming tasks, with features including task ID, entry point function, executability status, correctness flag, number of tests passed and failed, test run time, error type, and various code metrics such as Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, type-token ratio (TTR), token dictionary, Shannon entropy, mean predictive entropy, max predictive entropy, number of functions defined, and entry point repetition flag. The dataset is split into a training set with 164 examples and a total size of approximately 230KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g10_run1_metrics 数据集图片
构建方式
在程序合成与自动化代码评估领域,该数据集依托Qwen3-8B模型,采用策略信任机制(strategy trust)于温度参数0.75、组规模10的条件下生成运行记录,经单次运行后汇集为训练集。每条样本以task_id与entry_point标识代码任务,系统执行测试用例并比对预期结果,生成可执行性、正确性、通过/失败测试数等指标,同时提取Halstead度量、圈复杂度、可维护性指数、代码行与注释比例等静态特征,以及TTR、token字典、香农熵与预测熵等文本统计量,最终形成164条样本的训练集。
特点
数据集聚焦于代码生成质量的细粒度量化评价,兼具动态执行结果与静态结构度量。除常规正确性标签外,还提供测试通过数量、失败数量、运行耗时及错误类型等运行时信息,并以Halstead系列指标、圈复杂度、可维护性指数、代码行数、注释百分比刻画代码的复杂性与可读性。文本层面引入类型-标记比、token分布、香农熵与预测熵,用以衡量生成内容的多样性与不确定性,entry_point重复标记则有助于识别任务冗余,整体特征维度丰富,便于多角度分析模型行为。
使用方法
该数据集可直接通过HuggingFace datasets库加载,默认配置对应train划分,共164条样本。研究者可基于task_id与entry_point定位具体代码任务,利用is_correct、tests_passed与tests_failed评估功能正确性,借助error_type归因失败模式;结合Halstead度量、圈复杂度与可维护性指数分析代码复杂度,利用TTR、token字典与熵值探讨生成多样性与不确定性。数据适用于代码生成模型的性能诊断、错误分析、特征工程及预测建模等场景,亦可作为基准用于比较不同解码策略或模型规模的影响。
背景与挑战
背景概述
在代码生成与程序理解研究领域,如何量化评估大语言模型生成代码的质量与鲁棒性一直是核心议题。autophagycode_D_he_train-mercury_Qwen3-8B_strategy_trust_t0.75_g10_run1_metrics数据集于2024年前后由相关研究团队构建,基于Qwen3-8B模型在trust策略下以温度0.75、分组数10进行采样生成,聚焦于代码执行正确性与多维度静态度量。该数据集融合了测试通过率、Halstead度量、圈复杂度、可维护性指数及信息熵等特征,为探究模型生成代码的可靠性提供了细粒度基准,对自动化编程与软件工程领域具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于代码生成评估往往偏重功能正确性而忽视代码质量与模型不确定性之间的关联。构建过程中的挑战包括:确保生成代码可执行且测试用例覆盖充分,平衡样本规模与特征维度,以及准确提取Halstead、圈复杂度等静态指标。此外,预测熵等不确定性度量的引入需与代码结构特征有效对齐,而测试运行时间缺失亦对全面分析造成制约。这些挑战共同构成了该数据集在推动可信代码生成研究中的关键难点。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集凭借对代码可执行性、测试通过率以及Halstead度量、圈复杂度、可维护性指数等多维度静态特征的完整记录,成为评估大语言模型生成代码质量与鲁棒性的经典基准。其训练集包含164个样本,每个样本均附有任务标识、入口点、测试执行结果及错误类型等关键字段,并融合了标记熵、预测熵等模型行为指标,为研究者系统剖析生成代码的语法正确性与语义可靠性提供了细粒度观测窗口。
解决学术问题
针对代码生成研究中长期存在的执行反馈缺失与质量评估单一化问题,该数据集通过同步采集测试通过数、失败数、运行时间以及词法多样性、香农熵等统计量,构建了从表层文本特征到深层语义正确性的多维评价体系。其字段设计使得模型预测不确定性与代码实际可执行性之间的关联得以量化,从而缓解了传统评估仅依赖字符串匹配而忽视运行时行为的局限,为程序理解与自动修复研究提供了可复现的经验证据。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于代码生成模型的自我修正机制与不确定性校准研究。部分学者利用其预测熵字段开展基于置信度的拒绝采样与迭代修复实验,另一些工作则结合Halstead度量与复杂度指标探索生成代码的可维护性预测模型。这些后续研究进一步拓展了数据集在程序合成、缺陷定位与模型可信度评估等方向的应用边界,形成了一系列以执行反馈驱动优化为核心的学术脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务