遇见数据集

stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run0_metrics

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: task_id dtype: string - name: entry_point dtype: string - name: is_executable dtype: bool - name: is_correct dtype: bool - name: tests_passed dtype: int64 - name: tests_failed dtype: int64 - name: test_run_time_ms dtype: 'null' - name: error_type dtype: string - name: halstead_vocabulary dtype: int64 - name: halstead_length dtype: int64 - name: halstead_volume dtype: float64 - name: halstead_difficulty dtype: float64 - name: halstead_effort dtype: float64 - name: halstead_time dtype: float64 - name: cyclomatic_complexity dtype: int64 - name: maintainability_index dtype: float64 - name: loc dtype: int64 - name: sloc dtype: int64 - name: comment_percentage dtype: float64 - name: TTR dtype: float64 - name: token_dict dtype: string - name: shannon_entropy dtype: float64 - name: mean_predictive_entropy dtype: float64 - name: max_predictive_entropy dtype: float64 - name: n_func_defined dtype: int64 - name: entry_point_repeated dtype: bool splits: - name: train num_bytes: 233460 num_examples: 164 download_size: 100056 dataset_size: 233460 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
stefanocarrera
搜集汇总
数据集介绍
stefanocarrera/autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run0_metrics 数据集图片
构建方式
该数据集构建于代码生成与自动评测的背景下,专注于评估代码生成模型的执行正确性与代码质量。数据集共包含164个训练样本,每个样本对应一个编程任务。构建过程中,首先利用代码生成模型为每个任务生成代码,随后通过执行测试用例来判定代码的正确性,记录测试通过数、失败数及执行时间。同时,对生成的代码进行多维度的静态分析,提取Halstead复杂度指标(如词汇量、长度、体积、难度、工作量与时间估算)、圈复杂度、可维护性指数、代码行数(LOC与SLOC)、注释比例、词元比(TTR)以及香农熵和预测熵等信息。此外,还统计了任务中定义的函数数量与入口点重复情况,从而形成一套融合执行结果与代码质量特征的综合性评估数据集。
使用方法
该数据集主要用于训练和评估代码生成任务中的模型性能与代码质量。使用者可将其作为评测基准,利用is_correct、tests_passed等字段分析模型的执行正确率,结合Halstead复杂度与圈复杂度等指标筛选出高质量或存在潜在问题的代码样本。在训练过程中,可以将这些结构化特征作为额外标注信息,用于训练质量感知的代码生成模型或构建多任务学习框架。数据集的164个样本以HuggingFace Dataset格式提供,支持通过load_dataset快速加载,默认配置下只有train拆分,便于集成到现有的深度学习流水线中。研究者还可依据error_type与is_executable字段过滤无效样本,或利用test_run_time_ms字段进行效率分析。
背景与挑战
背景概述
该数据集名为autophagycode_D_he_train-mercury_Qwen3-4B_strategy_trust_t1.1_g4_run0_metrics,由项目“autophagycode”创建,旨在评估代码生成模型在自动化编程任务中的表现。数据集核心研究问题聚焦于通过多维度度量(如代码复杂度、可维护性、熵等)量化模型生成代码的质量与正确性,对智能代码生成与软件工程领域具有重要影响力。该数据集包含164个训练样本,涵盖任务标识、执行状态、测试通过率、Halstead复杂度、圈复杂度、维护指数等丰富特征,为研究代码自动生成的可信性与鲁棒性提供了宝贵的基准资源。
当前挑战
该数据集面临的挑战包括:1) 领域问题挑战:代码生成任务需平衡正确性与代码质量,现有研究多关注功能正确性而忽视可读性与可维护性,该数据集通过引入Halstead度量和熵等指标尝试解决此问题。2) 构建过程挑战:构建中需准确标注多种代码质量特征,如圈复杂度与维护指数的计算依赖精确的静态分析工具;此外,测试通过率与实际运行时间等动态属性需在可控环境中执行,对数据集构建的标准化与可复现性提出了高要求。
常用场景
经典使用场景
该数据集聚焦于代码合成与大模型生成质量的评测场景,尤其适用于对大型语言模型(如Qwen3-4B)在代码生成任务中的可信度与策略性进行系统性评估。数据集涵盖了任务标识、代码入口、可执行性、正确性、测试通过/失败数等多种细粒度质量指标,同时引入了Halstead复杂度、圈复杂度、可维护性指数等软件工程中的经典度量维度。这种多维度的设计使其成为研究代码生成准确性、程序复杂度与模型生成策略之间微妙关系的理想平台,广泛应用于代码智能领域的模型比较与基准测试。
解决学术问题
该数据集突破了传统代码评测仅关注功能正确性的局限,着力解决代码生成中模型的可信度评估与策略选择这一核心学术难题。通过结构化地记录模型生成结果在多种软件度量指标上的表现,研究者得以深入探析模型在不同复杂度问题上的失败模式与性能瓶颈。数据集为探讨模型生成的代码是否具备良好的可维护性、是否在复杂性控制上有所取舍,以及模型的生成策略如何影响最终产出质量提供了关键支撑。这些分析有助于揭示模型在代码生成中的泛化能力与内在局限性,对推动可信代码生成理论的发展具有深远意义。
实际应用
在实际应用中,该数据集可作为评估和优化代码生成模型性能的标准化测试平台,服务于自动化软件开发的各个环节。开发者可以利用数据集中的多维度指标高效筛选模型生成的候选代码,剔除存在结构性缺陷或难以维护的生成结果,从而提升代码审查与集成的效率。数据集中关于测试通过率与代码复杂度的关联分析,还为智能编程助手提供了明确的优化方向,例如引导模型生成更简洁、更可维护的代码片段。这些应用场景使得该数据集成为连接代码生成前沿研究与工业级自动编程实践的重要桥梁。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在自动化编程任务中的执行可靠性评估与代码质量度量,尤其关注Qwen3-4B模型在信任策略下的表现。结合当前人工智能辅助软件开发的前沿动态,该研究深入探索了模型生成代码的可执行性、测试通过率及错误类型分布,并引入Halstead复杂度、圈复杂度、可维护性指数及香农熵等多维代码度量指标,构建起对生成代码的全面质量画像。这一方向直接回应了大语言模型在生成可部署代码时面临的语义正确性与稳健性挑战,与近期业界对AI生成代码安全性与可信赖性的热点关切相呼应。通过剖析模型在164个训练样例上的执行反馈与复杂度特征,研究为优化模型训练策略、提升代码生成任务的实用化水平提供了宝贵的数据支撑与分析依据,对推动下一代智能编程助手的成熟应用具有重要奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务