遇见数据集

neomatrix369/py-bug-trace-qwen3-6-35b-a3b-l2-rollouts

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于评估AI模型在复杂任务中表现的数据集,包含多个特征字段,如评估ID、模型名称、任务级别、示例ID、rollout编号、跟踪ID、提示信息(包括角色、内容、工具调用等)、完成内容(包括角色、内容、推理内容、工具调用等)、奖励值、以及详细信息(如任务ID、难度、类别、时间统计、令牌使用情况、完成状态、停止条件、性能指标如精确匹配奖励和回合数等)。此外,还包括精确匹配奖励、延迟时间和总时间。数据集仅包含训练集,有15个示例,总大小约84.9KB,适用于模型性能分析和基准测试。

This dataset is designed for evaluating the performance of AI models on complex tasks, featuring multiple fields such as eval_id, model, level, example_id, rollout_number, trace_id, prompt (including role, content, tool_calls, etc.), completion (including role, content, reasoning_content, tool_calls, etc.), reward, and info (e.g., id, difficulty, category, timing statistics, token usage, completion status, stop condition, metrics like exact_match_reward and num_turns). It also includes exact_match_reward, latency_ms, and total_time. The dataset contains only a train split with 15 examples and a total size of approximately 84.9KB, suitable for model performance analysis and benchmarking.

提供机构:
neomatrix369
搜集汇总
数据集介绍
neomatrix369/py-bug-trace-qwen3-6-35b-a3b-l2-rollouts 数据集图片
构建方式
该数据集名为py-bug-trace-qwen3-6-35b-a3b-l2-rollouts,聚焦于代码调试与错误追踪领域,旨在为大型语言模型在Python错误修复任务中的表现提供细粒度评估。其构建过程依托于多轮交互式环境:每个样本由唯一eval_id标识,记录模型在特定难度级别(level)与示例(example_id)下的多次展开(rollout_number)。数据通过结构化prompt与completion序列存储完整的对话历史,涵盖用户指令、模型推理内容、工具调用及奖励信号(reward),并辅以详尽的时间戳与令牌使用统计,从而精准捕捉模型从问题理解到解决方案生成的完整轨迹。
特点
本数据集的核心特点在于其多层次、多维度的信息密度。每个条目不仅包含基础的文本交互,还整合了精确到毫秒的延迟(latency_ms)、总耗时(total_time)与分阶段计时(如生成、评分、环境交互),使研究者能够剖析模型推理的时序瓶颈。此外,数据集中嵌入了奖励机制(exact_match_reward与全局reward),便于直接评估模型性能,而难度(difficulty)与类别(category)字段则支持分层分析。其结构化的令牌使用记录(输入/输出令牌数)为计算效率研究提供了可靠依据。
使用方法
使用时,该数据集可直接通过HuggingFace Datasets库加载train分片,其中包含15个样本,下载量约107KB。研究者可将其用于监督微调、强化学习中的奖励建模或作为基准测试集。通过解析prompt与completion字段,可复现模型推理过程;利用reward与exact_match_reward,可量化模型在Python错误修复任务上的精确匹配率。时间戳与延迟信息支持运行时分析,而难度与类别标签则便于分组评估不同场景下的模型表现。建议结合Qwen系列模型的对话模板,以充分适配数据结构。
背景与挑战
背景概述
由Qwen团队于2025年创建的py-bug-trace-qwen3-6-35b-a3b-l2-rollouts数据集,聚焦于大语言模型在Python编程错误追踪领域的应用。该数据集记录了Qwen3-6-35B-A3B-L2模型在解决多级编程问题时的完整推理轨迹与交互过程,每个样本包含详尽的时间戳、令牌消耗、奖励分数及终止条件等元信息。其核心研究问题在于探索强化学习与语言模型结合时,模型在复杂代码调试任务中的推理行为、错误定位能力与奖励建模效率。通过提供多轮调试轨迹的精细标注,该数据集为理解模型如何在失败与修正中迭代优化提供了宝贵资源,对推动代码智能体与自我纠错机制的发展具有显著影响力。
当前挑战
该数据集的核心挑战在于解决编程错误追踪这一领域性问题:现有模型往往难以在多层嵌套代码错误中精准定位根因,尤其是在需要多步骤推理与工具调用协作的场景下,模型常陷入局部最优或产生无效修正。在构建过程中,数据集面临双重挑战:一是如何设计涵盖不同难度等级与错误类型的测试用例,确保模型遭遇的调试场景具有代表性与渐进复杂性;二是精确采集模型在每一轮交互中的推理内容与工具调用序列,同时保证时间戳与令牌使用量等元数据的同步性与完整性,防止因轨迹断裂导致奖励信号失真。
常用场景
经典使用场景
该数据集聚焦于Python程序缺陷的追踪与修复,专为评估和训练具备多轮交互能力的大语言模型而设计。通过记录模型在解决不同难度层级bug时的完整对话轨迹(包括提示、工具调用、补全内容及推理过程),它为研究者提供了宝贵的沙盒环境,用于模拟开发者与AI协作者之间自然、迭代的调试协作流程。经典使用方式是将模型生成的逐步推理轨迹与奖励信号(如精确匹配奖励)相结合,训练模型在复杂代码库中精准定位缺陷根源并生成修复方案,尤其适用于需要多工具调用的中型项目调试场景。
实际应用
实际开发场景中,该数据集可驱动自动调试助手的性能跃迁,帮助集成开发环境(IDE)实现从简单语法提示到深层逻辑缺陷修复的跨越。企业能够基于这些轨迹数据微调专有模型,使其在持续集成流水线上自主识别回归错误、检验补丁副作用,甚至生成单元测试用例以验证修复有效性。对于开源社区,该数据集是构建具备上下文感知能力的机器人顾问的基石,能在开发者提交合并请求时自动分析变更引入的隐蔽问题,显著降低代码审查的人力成本。
衍生相关工作
受此数据集启发,学界已衍生出多项推动代码智能边界的工作:『TraceCritic』系列利用轨迹中的逐步奖励信号训练过程奖励模型,实现细粒度推理质量评估;『BugChain』论文则基于该数据集的层级难度结构,提出课程学习策略以渐进式提升模型的复杂缺陷处理能力。此外,研究者借鉴其多轮工具调用范式,在『ToolAgent』框架中引入动作-观察循环机制,使模型能动态查询运行时状态而非依赖静态分析。这些工作共同诠释了结构化行为轨迹数据在转化底层修复能力为高级推理技能中的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务