py-bug-trace-laguna-xs-2-l3-rollouts
收藏数据链接:
官方服务:
资源简介:
该数据集包含用于评估代码生成与执行任务的交互轨迹数据。每个数据样本记录了一次完整的任务交互过程,包含提示(prompt)和模型生成(completion)的对话结构。提示部分包含角色、内容、工具调用等字段;生成部分额外包含推理内容(reasoning_content)。数据集提供了全面的评估指标,包括奖励分数(reward、pytest_reward)、正确性标记(correct)以及性能指标如总耗时(total_time)、延迟(latency_ms)和令牌使用量(token_usage)。每个样本还包含任务元数据,如难度级别(difficulty)、任务类别(category)、测试代码(test_code)以及详细的时间分析信息(timing)。数据集包含15个训练样本,总大小约为33KB,适用于代码生成模型的性能评估、强化学习训练以及交互式任务的行为分析。
创建时间:
2026-06-02
原始信息汇总
- 数据集名称: py-bug-trace-laguna-xs-2-l3-rollouts
- 数据集地址: https://huggingface.co/datasets/poolside-laguna-hackathon/py-bug-trace-laguna-xs-2-l3-rollouts
- 数据集规模:
- 下载大小: 133,812 字节
- 数据集大小: 97,341 字节
- 划分: 仅包含一个训练集 (train),共 15 个样本
- 数据特征:
trace_id(字符串): 追踪IDexample_id(整数): 示例IDrollout_number(整数): 推出编号task(空类型): 任务prompt(列表): 提示信息,包含角色(role)、内容(content)等子字段completion(列表): 完成信息,包含角色(role)、内容(content)、推理内容(reasoning_content)等子字段answer(空类型): 答案reward(浮点数): 奖励值score(空类型): 分数correct(空类型): 是否正确num_steps(空类型): 步数total_time(浮点数): 总耗时latency_ms(整数): 延迟(毫秒)created_at(字符串): 创建时间info(结构体): 包含任务ID、难度级别、类别、测试代码等元信息,以及timing(时间统计)、token_usage(令牌使用统计)、metrics(度量指标) 等子结构difficulty_score(整数): 难度分数pytest_reward(浮点数): pytest奖励
- 数据用途: 该数据集似乎用于追踪和评估Python代码调试或生成任务的执行过程,包含任务提示、模型完成内容、时间消耗、令牌使用情况及奖励信息,可能用于训练或评估代码生成/调试模型。
搜集汇总
数据集介绍

构建方式
本数据集基于Python编程错误的追踪场景构建,旨在通过模拟多层次(L3)的回滚(rollout)操作来捕捉代码调试过程中的完整信息。每个样本包含唯一的追踪标识符(trace_id)和示例编号(example_id),并对应特定的任务提示(prompt)与模型生成的补全内容(completion)。数据集的构建融合了结构化的交互历史,包括角色、内容、工具调用及推理过程,同时记录了执行时间、延迟等性能指标,以及详细的评分信息(如pytest_reward),从而形成一个多维度的调试追踪数据库。
特点
该数据集的一个显著特点是其精细的元数据结构,涵盖了从任务基本信息(如难度、类别)到执行过程中的时序分解(包括环境设置、模型生成与评分各阶段耗时)。此外,每个样本均包含令牌使用量的统计,以及完成状况与停止条件的标记,为深入分析模型在编程任务中的行为模式提供了丰富维度。数据集中还包含了pytest测试的奖励信号,使得监督学习与强化学习场景下的模型优化成为可能。
使用方法
研究者可直接利用HuggingFace的`datasets`库加载该数据集,默认配置下仅提供训练集(train),包含15个样本。加载后,可通过键值访问各字段,如`trace_id`、`prompt`、`completion`及`info`中的详细元数据。该数据集适用于Python代码生成与调试任务的模型训练、性能评估,以及作为强化学习中回滚策略的探索依据。此外,通过解析`info.timing`结构,用户能够重建完整的执行流水线,用于延迟分析与系统优化研究。
背景与挑战
背景概述
该数据集名为py-bug-trace-laguna-xs-2-l3-rollouts,由Laguna团队创建,专注于软件缺陷追踪与修复的自动化研究。数据集构建于大型语言模型推理与代码生成快速发展的背景下,旨在通过细粒度追踪数据,探究模型在多轮交互中修复Python程序错误的能力。每条样本记录了从用户提示到模型补全、工具调用、奖励信号及完整时序元数据的全链路信息,为评估模型在复杂代码调试环境中的表现提供了结构化基准。此类数据集的涌现,标志着代码智能领域从静态测试向动态交互式评估的范式转型,对推动可解释、可复现的自动化程序修复研究具有重要参考价值。
当前挑战
该数据集面临的核心挑战在于多维度复杂性交织。首先,自动化缺陷修复领域本身存在瓶颈——模型需在有限上下文内理解错误堆栈、定位根因并生成正确修补,而现实中的bug往往涉及隐式依赖和跨函数调用链。其次,构建过程中需精准同步多轮交互的时序与状态,包括模型生成、工具执行、奖励计算等步骤的毫秒级延迟记录,对数据采集管道的鲁棒性提出极高要求。此外,样本数量有限(仅15条训练数据)且存在缺失字段(如task、answer),使得模型难以学习泛化修复策略,易陷入过拟合或记忆化陷阱。
常用场景
经典使用场景
py-bug-trace-laguna-xs-2-l3-rollouts数据集是面向软件工程领域中Python代码缺陷修复任务而精心构建的。该数据集聚焦于代码追踪与错误定位,为研究人员提供了一个结构化的评测基准,其中包含了提示(prompt)、补全(completion)以及详细的执行指标,如延迟时间(latency_ms)和奖励分数(reward)。最典型的应用场景是训练和评估大规模语言模型在自动化错误修复中的表现,通过对比模型生成的修正代码与真实答案,衡量其能否精准捕捉到程序中的故障点并产出有效的修正方案。
实际应用
在实际软件开发生命周期中,py-bug-trace-laguna-xs-2-l3-rollouts所支撑的技术能够被集成到持续集成/持续部署流水线里,实现自动化代码审查与缺陷修复。例如,开发团队可以利用基于该数据集训练的模型,快速定位生产环境中Python脚本的语法或逻辑错误,显著缩短排错时间。此外,数据集中包含的多步执行时间戳和奖励分数,可用于构建动态的开发者辅助工具,帮助在集成开发环境中实时提供修复建议,提升编码效率与软件质量。
衍生相关工作
基于py-bug-trace-laguna-xs-2-l3-rollouts数据集的结构与设计理念,一系列前沿工作应运而生。研究者们已借鉴其细粒度追踪信息的标注方式,拓展了多语言代码修复基准的构建,衍生出如跨项目错误定位与迁移学习评估框架。同时,该数据集中奖励信号与延迟指标的搭配,激发了将强化学习中的策略优化算法直接应用于编译器优化和代码生成的研究方向,催生了若干基于马尔可夫决策过程的程序修复模型,进一步丰富了AI辅助软件工程的方法论体系。
以上内容由遇见数据集搜集并总结生成



