遇见数据集

py-bug-trace-laguna-xs-2-l3-rollouts

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

该数据集包含了一系列用于评估和训练代码生成AI模型的交互轨迹数据。每个数据样本代表一次完整的模型任务执行过程,其中包含用户提示(prompt)、模型的多轮响应(completion)以及相应的评估结果。数据以结构化格式存储,核心字段包括:唯一轨迹标识(trace_id)、提示消息列表(包含角色和内容)、模型完成消息列表(额外包含推理内容 reasoning_content)、任务奖励(reward, pytest_reward)以及详细的性能元数据(info)。元数据信息丰富,涵盖了任务难度(difficulty)、类别(category)、测试代码(test_code)、精确的时间消耗统计(timing)和令牌使用情况(token_usage)。数据集规模较小,包含15个训练样本,适用于代码生成模型的强化学习训练、性能基准测试、智能体行为分析以及包含推理链的模型评估等研究场景。

This dataset contains a series of interaction trajectory data for evaluating and training code generation AI models. Each data sample represents a complete model task execution process, including user prompts, multi-turn model responses (completions), and corresponding evaluation results. The data is stored in a structured format, with core fields including: unique trace identifier (trace_id), prompt message list (with roles and content), model completion message list (additionally containing reasoning_content), task rewards (reward, pytest_reward), and detailed performance metadata (info). The metadata is rich, covering task difficulty, category, test code, precise timing statistics, and token usage. The dataset is small in scale, containing 15 training samples, and is suitable for research scenarios such as reinforcement learning training for code generation models, performance benchmarking, agent behavior analysis, and model evaluation with chain-of-thought reasoning.

创建时间:
2026-06-02
原始信息汇总

数据集概述

数据集名称:py-bug-trace-laguna-xs-2-l3-rollouts

数据集链接:https://huggingface.co/datasets/neomatrix369/py-bug-trace-laguna-xs-2-l3-rollouts

数据集规模

  • 总下载大小:133,812 字节
  • 数据集大小:97,341 字节
  • 数据划分:仅包含训练集(train),共 15 个样本

特征字段

每条数据包含以下字段:

字段名 类型 说明
trace_id string 追踪ID
example_id int64 示例ID
rollout_number int64 回滚编号
task null 任务(空)
prompt list 提示信息,包含 role、content、tool_calls、tool_call_id
completion list 完成结果,包含 role、content、reasoning_content、tool_calls、tool_call_id
answer null 答案(空)
reward float64 奖励值
score null 分数(空)
correct null 是否正确(空)
num_steps null 步数(空)
total_time float64 总耗时
latency_ms int64 延迟(毫秒)
created_at string 创建时间
difficulty_score int64 难度分数
pytest_reward float64 pytest奖励值
info struct 详细信息结构体

info 结构体包含:

  • id (string):数据ID
  • level (int64):级别
  • difficulty (string):难度
  • included (bool):是否包含
  • category (string):类别
  • task_bank_version (string):任务库版本
  • test_code (string):测试代码
  • prompt_test_code (string):提示测试代码
  • timing (struct):时间记录,包含 start_time、setup、generation、scoring、model、env、total、overhead 等子字段
  • token_usage (struct):Token使用量,包含 input_tokens、output_tokens、final_output_tokens、final_input_tokens
  • is_completed (bool):是否完成
  • is_truncated (bool):是否被截断
  • stop_condition (string):停止条件
  • metrics (struct):指标,包含 num_turns(轮次数量)和 pytest_reward(pytest奖励值)

数据集用途

该数据集包含 Python 编程相关的任务追踪与回滚记录,侧重于程序调试与错误追踪场景,适用于训练或评估代码生成、调试、推理等任务的模型。

搜集汇总
数据集介绍
py-bug-trace-laguna-xs-2-l3-rollouts 数据集图片
构建方式
该数据集源于针对Python编程任务的强化学习(RL)环境下的智能体行为追踪,具体采用逐步回滚(rollout)策略收集交互轨迹。每个样本以trace_id和example_id唯一标识,记录一次完整的任务尝试过程,包含多轮提示(prompt)与补全(completion)对话。补全内容不仅保留模型生成的文本,还额外存储推理过程(reasoning_content),为理解模型决策逻辑提供细粒度信息。数据构建过程中,每轮交互均通过pytest测试框架自动评估代码正确性,并依据测试通过率计算奖励信号(reward与pytest_reward),从而将程序合成任务转化为可量化的强化学习反馈。此外,系统详尽记录每次尝试的步骤数、总耗时及延迟,使研究者能对模型效率与性能进行联合分析。
特点
本数据集的核心特点在于其多维度的结构化信息与精细的时间戳记录。每个样本囊括任务的元数据(如难度、类别)以及丰富的性能指标,包括token使用量、回合数、是否截断及停止条件等。尤为突出的是,数据集内嵌完整的计时信息,将一次交互划分为环境初始化、模型生成、评分三个阶段,并单独追踪模型推理与环境执行的子时间跨度,为延迟分析提供像素级视角。同时,奖励与分数字段的分离设计,允许区分客观测试结果与潜在修正后的得分,从而支持对模型纠错能力的评估。这些特性使数据集不仅适用于训练代码生成模型,更可用于研究模型在不同难度任务上的行为模式与资源分配策略。
使用方法
该数据集以HuggingFace Datasets格式发布,仅包含训练分割,共15个样本,可直接通过datasets库加载。使用时,用户可访问每条记录中的prompt与completion列表以获取多轮对话历史,结合奖励信号构建强化学习训练流程。对于需要细粒度性能分析的研究,info字段内的timing与token_usage子结构提供了毫秒级的时间戳与计数数据,便于绘制资源消耗曲线或诊断瓶颈。此外,pytest_reward字段可直接作为监督学习标签,用于训练奖励预测模型。建议将在分析时复用test_code与prompt_test_code字段进行单元测试复现,以确保评估的可重复性。研究人员也可依据difficulty与category字段进行分层抽样,探索模型在不同编程任务上的泛化能力。
背景与挑战
背景概述
该数据集由未知机构于近期创建,专注于Python程序执行的轨迹追踪与错误分析,旨在利用大规模语言模型(LLM)生成的交互式对话数据,探讨代码生成与自动调试中的时序特征与推理过程。数据集收录了15个样本,每条记录包含trace_id、多轮对话中的prompt与completion、细粒度的时间戳信息(如生成、评分、环境搭建耗时)以及测试代码执行后的奖励分数。核心研究问题围绕LLM在复杂编程任务中的多步推理能力与效率评估,尤其关注模型在遭遇错误中断或截断时的行为模式。尽管规模较小,但该数据集为理解LLM在代码生成中的延迟分布、资源消耗与决策稳定性提供了珍贵视角,有望推动程序合成领域的实证研究。
当前挑战
当前数据集面临的首要挑战在于规模极为有限,仅有的15个样本难以支撑统计意义上的显著结论,限制了其对LLM代码生成行为的泛化分析能力。领域层面,该数据集致力于解决如何精准刻画模型在交互式编程调试中的动态决策过程,尤其是面对多重故障轨迹时的适应性与鲁棒性评估,这是一项尚未完善的复杂任务。构建过程中,数据采集经历了多轮rollout迭代,每个样本均需记录模型多步推理的时间开销、资源占用与测试结果的一致性,技术难度较高,且需要确保不同难度级别的代码任务在时序特征上具备可分性,以避免引入噪声干扰后续的延迟分析与奖励学习。
常用场景
经典使用场景
在软件工程与人工智能交叉领域,数据集py-bug-trace-laguna-xs-2-l3-rollouts为代码生成模型的多轮交互式调试与修复提供了独特的研究素材。该数据集记录了模型在完成编程任务时,通过多次rollout(展开)迭代改进生成结果的过程,涵盖了每次交互的prompt、completion、奖励分数以及详细的时序与token消耗信息。经典使用场景包括:利用多回合轨迹数据训练强化学习策略,使模型学会根据反馈逐步修正代码错误;评估模型在复杂编程难题中的纠错能力与稳定性;研究延迟、步数与最终正确性之间的关联,从而优化模型推理效率。这些场景聚焦于提升代码生成模型在真实开发环境中的自适应性。
解决学术问题
该数据集系统性地解决了代码生成领域长期存在的几个关键学术难题。其一,传统静态评估难以捕捉模型在迭代调试过程中的动态行为,而本数据集通过细粒度的时序和奖励记录,为分析模型自我修正机制提供了量化依据。其二,针对多轮对话式编程场景,数据集中丰富的rollout信息帮助研究者探究模型从初始错误到正确输出的收敛路径,进而理解错误传播与纠正的模式。其三,结合pytest_reward等客观指标,数据集支持对模型性能进行严格评估,填补了现有基准在高频迭代场景下的评价空白。这些特性推动了可解释性调试、在线学习策略以及基于奖励的代码合成等方向的发展。
衍生相关工作
该数据集衍生出多项前沿研究成果,典型代表包括基于轨迹感知的强化学习算法,如利用rollout奖励序列进行策略梯度优化的方法,显著提升了模型在多步推理任务中的成功率。另一类相关工作聚焦于评估框架的革新,研究者借鉴该数据集中的时序与token消耗信息,提出了考虑时间代价的代码生成评估指标,推动了领域向更贴近工业实践的评估标准演进。此外,还有工作利用数据集中的错误-修正配对轨迹,训练专门用于代码缺陷定位的预测模型,实现了对潜在bug的早期预警。这些衍生工作共同拓展了智能化软件工程的研究边界,并为后续数据集设计提供了范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务