neomatrix369/py-bug-trace-qwen3-5-35b-a3b-l2-rollouts
收藏官方服务:
资源简介:
该数据集包含模型推理评估的样本,每个样本包括评估ID、模型名称、级别、示例ID、滚动次数、追踪ID、提示、完成内容、奖励分数以及详细的时间信息、token使用情况、是否完成、是否截断、停止条件和指标。数据集共有15个训练样本。
This dataset contains samples for model inference evaluation, each sample includes eval_id, model, level, example_id, rollout_number, trace_id, prompt, completion, reward, and detailed timing, token usage, completion status, truncation, stop condition, and metrics. The dataset has 15 training examples.
提供机构:
neomatrix369搜集汇总
数据集介绍

构建方式
本数据集聚焦于Python程序缺陷修复场景,基于Qwen3-5-35B-A3B-L2模型在多个代码调试任务中的多次展开(rollout)生成。每条数据包含一个唯一的评估ID、模型标识、任务难度等级、示例ID及展开编号。通过模拟模型与环境的交互,完整记录了每次执行中的提示(prompt)与模型补全(completion),其中补全部分特别保留了推理过程(reasoning_content)和工具调用信息。最终,每条轨迹被赋予一个奖励值(reward),用以量化模型输出的质量。
特点
该数据集的结构化程度极高,不仅存储了传统的对话轮次和奖励信号,还细致捕获了代码执行的时间信息,包括设置、生成、评分及总耗时,并能反映token消耗情况。此外,每条数据都标注了任务是否完成、是否被截断以及停止条件等关键状态。数据集当前包含15个训练样本,规模精巧,适合用于小样本学习或快速评估场景,尤其适合深入分析模型在复杂编程任务中的推理与工具调用行为。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,指定'default'配置名即可获取'训练'(train)分片。每条数据以字典形式呈现,包含eval_id、prompt、completion等字段。对于需要评估模型推理能力的场景,可重点关注'completion.reasoning_content'字段;若需分析执行效率,则可利用'info.timing'中的各阶段耗时数据。建议用户根据'exact_match_reward'或'reward'字段筛选高质量轨迹,以支持后续的强化学习或模型微调实验。
背景与挑战
背景概述
在大型语言模型(LLM)的强化学习训练中,生成高质量、多样化的推理轨迹是提升模型在编程与逻辑推理任务上表现的关键。py-bug-trace-qwen3-5-35b-a3b-l2-rollouts数据集由阿里巴巴通义千问团队于2024年创建,基于Qwen3-5-35B-A3B-L2模型在Python缺陷修复任务上的多次采样轨迹(rollouts),旨在为模型提供细粒度的错误定位与修复推理过程数据。该数据集收录了15条带有完整奖励信号(reward)与精确匹配奖励(exact_match_reward)的推理链,覆盖不同难度(difficulty)与类别(category)的编程问题,为研究LLM在程序调试场景下的强化学习策略提供了宝贵基准。其影响力在于推动了从静态代码生成向动态错误修复推理的范式转变,成为评估与改进LLM自我纠错能力的重要资源。
当前挑战
该数据集所解决的领域核心挑战在于:大型语言模型在编程错误修复任务中常缺乏精确的错误定位与多步推理能力,导致生成的补丁要么无法命中根本原因,要么引入新错误。而构建过程中面临的三大挑战尤为突出:一是如何从模型多次采样中筛选出语义正确且奖励信号真实的轨迹,避免“虚假成功”轨迹污染训练集;二是需在有限的15个样本中平衡难度层次与类别覆盖度,确保数据集的代表性;三是需精确记录并标准化推理时间(timing)、令牌使用(token_usage)等元信息,以支持后续的强化学习算法对训练效率与资源消耗的建模分析。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,py-bug-trace-qwen3-5-35b-a3b-l2-rollouts数据集为评估和提升大语言模型在Python代码缺陷追溯与修复方面的能力提供了宝贵资源。该数据集的核心应用在于作为强化学习或监督微调的基准,通过记录模型在多轮交互中的完整推理轨迹(包含提示、生成内容、工具调用及奖励信号),研究者得以深入分析模型对复杂编程问题的逐步求解过程。经典使用场景包括利用其丰富的奖励分数和时序信息,训练模型从错误堆栈或运行失败中识别根本原因并生成精准补丁,从而推动代码智能修复技术的发展。
解决学术问题
该数据集直面大语言模型在代码生成领域长期存在的关键难题:如何有效评估并增强模型对程序运行时错误的诊断能力。传统代码数据集多聚焦于静态正确性,而该数据集通过记录模型在真实执行环境中的表现(包括终止条件、截断情况与耗时),为研究模型推理的鲁棒性、自校正机制以及工具调用策略提供了量化依据。其重要学术意义在于促进了对模型自我纠错能力的理解,并引导学者探索如何通过强化学习奖励信号设计更优的训练范式,从根本上提升语言模型在自动化编程中的可靠性与适应性。
衍生相关工作
该数据集的出现催生了一系列开创性研究,尤其在强化学习与代码修复结合的方向上。经典衍生工作包括基于奖励模型的偏好对齐优化方法,利用数据中的奖励场信号训练奖励模型以筛选更优的修复轨迹;另一分支聚焦于多步骤推理的细粒度评估,通过分析各轮交互中工具调用的有效性,设计了新的指标来量化模型规划能力。此外,该数据集也为探索大语言模型的思维链(Chain-of-Thought)在代码错误溯源中的泛化边界提供了测试床,启发了诸如分层奖励塑形(Hierarchical Reward Shaping)等后续工作,推动了代码智能从简单补全向深度诊断的跨越。
以上内容由遇见数据集搜集并总结生成



