遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g5_run0_metrics

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个代码分析数据集,包含多个编程任务的评估指标和代码复杂度特征。每个样本代表一个任务,具有任务ID和入口点信息,并标注了可执行性、正确性、测试通过/失败数量、错误类型等评估结果。此外,数据集提供了丰富的代码度量指标,包括Halstead复杂度(词汇量、长度、体积、难度、努力程度、时间)、圈复杂度、可维护性指数、代码行数(LOC和SLOC)、注释百分比、TTR(类型标记比)、令牌字典、香农熵、预测熵(均值和最大值)以及定义函数数量。数据集用于分析代码质量、可维护性和测试性能,适用于机器学习或软件工程研究。数据集包含164个训练样本,文件大小约237KB。

This dataset is a code analysis dataset containing evaluation metrics and code complexity features for multiple programming tasks. Each sample represents a task with task ID and entry point information, annotated with executability, correctness, number of tests passed/failed, error type, and other evaluation results. Additionally, the dataset provides extensive code metrics, including Halstead complexity (vocabulary, length, volume, difficulty, effort, time), cyclomatic complexity, maintainability index, lines of code (LOC and SLOC), comment percentage, TTR (Type-Token Ratio), token dictionary, Shannon entropy, predictive entropy (mean and maximum), and number of defined functions. The dataset is used for analyzing code quality, maintainability, and testing performance, suitable for machine learning or software engineering research. It contains 164 training samples with a file size of approximately 237KB.

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g5_run0_metrics 数据集图片
构建方式
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.25_g5_run0_metrics,是在程序合成与代码生成评估领域的一次精细建模实践。其构建基于Qwen3-4B模型在特定策略(trust策略,温度参数t=1.25,生成次数g=5)下对训练集代码任务的输出结果,系统性地收集了每一段生成代码的执行状态与静态度量指标。每条样本包含任务标识、入口函数名称、可执行性与正确性布尔标记、通过与失败的测试用例计数、运行耗时以及错误类型字段。此外,还融入了Halstead复杂度系列指标(词汇量、长度、难度、工作量等)、圈复杂度、可维护性指数、代码行数、注释占比、TTR、Shannon熵与预测熵等语言学与信息论特征,形成一个多维度的代码质量与复杂度剖面。
特点
该数据集的核心特质在于其对代码多维性能与结构复杂度的全景刻画。它并非仅关注功能正确性,而是通过整合静态代码度量(如Halstead系列、圈复杂度、可维护性指数)与动态执行信息(测试通过/失败数量、运行耗时),提供了从逻辑复杂性到执行效率的立体分析视图。特别地,数据集中引入了shannon_entropy、mean_predictive_entropy与max_predictive_entropy等熵值特征,结合TTR(类符形符比)与词袋表示token_dict,使得研究方向可延伸至代码语言模式的信息密度与可预测性分析。此外,错误类型的标注为诊断模型生成缺陷提供了精细分类依据,而入口函数重复性布尔标记则有助于识别任务混淆现象。
使用方法
数据集以标准的HuggingFace格式组织,包含单一训练集split,共164条样本,总大小约237KB,便于快速加载与迭代。用户可通过HuggingFace Datasets库的load_dataset()函数直接读取,数据以JSON Lines或Parquet格式存储,且支持按config名称(default)筛选。该数据集适用于多种下游任务:可基于静态复杂度特征训练回归模型预测代码执行正确性;也可利用熵值与TTR特征进行代码语言模型的行为归因分析;还可将entry_point与error_type作为标签,探究不同代码逻辑框架下的错误模式。建议在分析与建模前对halstead_time、shannon_entropy等连续特征进行标准化处理,并注意is_executable与is_correct布尔特征在分类任务中的标签平衡性。
背景与挑战
背景概述
该数据集聚焦于代码智能领域的代码生成任务,旨在评估和优化大规模语言模型(LLM)在自动化编程中的表现。由Qwen团队于2024年创建,以Qwen3-4B为基座模型,采用信任策略(trust strategy)并结合温度参数1.25与生成次数5(g5)进行多次采样,收集了164条程序运行实例。核心研究问题在于如何通过量化代码的静态复杂度(如Halstead度量、圈复杂度)与动态执行结果(如测试通过率、运行时间)来精准刻画模型生成代码的可靠性。该数据集为代码生成模型的鲁棒性评估提供了多维度指标,推动了自动化编程中信任机制与性能度量的交叉研究。
当前挑战
当前数据集面临的核心挑战包括:1)领域问题方面,代码生成模型常因缺乏对执行语义的深度理解而输出语法正确但逻辑错误的代码,需要细粒度度量指标来区分显式错误(如测试失败)与隐式缺陷(如低可维护性);2)构建过程中,仅依赖单一模型(Qwen3-4B)和固定采样策略可能引入采样偏差,且164条样本的规模限制了泛化性分析;此外,静态复杂度指标(如Halstead难度)与动态执行结果之间的关联性尚未被充分验证,如何设计跨模型、跨任务的标准化评估体系仍是重要挑战。
常用场景
经典使用场景
该数据集广泛应用于代码生成模型的可信度评估与安全性验证研究领域。它通过记录每个代码生成任务的执行结果(如测试通过数、失败数、运行时错误类型),并结合软件工程中的复杂性度量指标(如圈复杂度、Halstead复杂度、可维护性指数),为评估大型语言模型生成代码的功能正确性与结构质量提供了系统化工具。研究者利用该数据集可深入剖析模型在特定策略(如信任阈值1.25、温度5)下的生成行为,从而优化模型的输出可靠性。
衍生相关工作
该数据集衍生了一系列极具影响力的相关研究,包括基于复杂度度量引导的代码生成策略优化工作,以及利用熵值与测试通过率进行模型置信度校准的研究。学术界围绕此数据集发展了多任务学习框架,将功能性测试结果与结构性指标联合建模,显著提升了生成代码的首次通过率。此外,该数据集还催生了自动化代码修复系统的评估基准,为对话式代码生成平台的安全性与鲁棒性研究提供了关键评测依据。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型的自动化评估与可信度分析,通过融合Halstead复杂度、圈复杂度及可维护性指数等多维度软件度量指标,为大规模语言模型生成的代码质量提供量化标尺。结合香农熵与预测熵的引入,研究者正探索模型输出不确定性对代码正确性的影响,这一方向与当前大模型可信编程、高阶代码推理以及鲁棒性测试的前沿领域紧密相连。在自动化代码生成蓬勃发展的当下,该数据集为构建透明、可解释的模型评估基准提供了关键支撑,推动软件工程与人工智能交叉领域迈向更严谨的实证研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务