遇见数据集

poolside-laguna-hackathon/py-bug-trace-laguna-xs-2-l3-rollouts

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

这是一个用于评估AI模型在代码生成或任务完成场景下表现的数据集。数据集包含多个特征字段,如trace_id(跟踪ID)、example_id(示例ID)、rollout_number(展开编号)、task(任务)、prompt(提示,包含角色和内容)、completion(完成,包含角色、内容和推理内容)、answer(答案)、reward(奖励)、score(分数)、correct(正确性)等。其中,info字段提供了任务的元信息,包括难度级别、类别、任务库版本和测试代码,而pytest_reward字段表明与Python测试框架相关。数据集可能用于训练或测试模型在编程任务中的性能,通过奖励和分数来衡量模型输出质量。数据分片为训练集,包含15个示例,总大小约97KB。

This is a dataset designed for evaluating AI model performance in code generation or task completion scenarios. It includes multiple features such as trace_id, example_id, rollout_number, task, prompt (with role and content), completion (with role, content, and reasoning content), answer, reward, score, and correct. The info field provides metadata about tasks, including difficulty level, category, task bank version, and test code, while pytest_reward indicates relevance to the Python testing framework. The dataset is likely used for training or testing models on programming tasks, with rewards and scores measuring output quality. It is split into a training set with 15 examples and a total size of approximately 97KB.

搜集汇总
数据集介绍
poolside-laguna-hackathon/py-bug-trace-laguna-xs-2-l3-rollouts 数据集图片
构建方式
该数据集源自自动化强化学习框架下的程序错误追踪任务,通过记录智能体在多轮交互中修复Python代码缺陷的完整过程而构建。每个样本包含唯一的追踪标识符、回合编号以及结构化的提示与完成序列,其中完成序列不仅保存了模型生成的修复建议,还额外捕获了推理过程内容,为分析模型决策逻辑提供了细粒度素材。构建时同步采集了环境执行时序数据,覆盖从测试代码加载到模型生成响应直至评分结束的全链路时间信息,并依据pytest执行结果计算奖励值,以此衡量修复方案的有效性。
特点
数据集的核心特点在于其多维度、层次化的信息组织架构。除了标准的对话式提示-完成对,每条记录嵌入了详尽的环境元数据,包括任务难度等级、类别归属以及测试代码片段,便于按特定条件筛选子集。时序数据被精细拆分为设置、生成、评分与模型调用等多个阶段,支持对性能开销进行针对性分析。此外,标记了回合是否完成或被截断以及终止条件,结合pytest奖励得分,使研究者能够从过程与结果两个层面评估智能体的行为模式与修复质量。
使用方法
使用时,可通过HuggingFace Datasets库加载数据,并利用配置项中的train拆分直接获取15个样本。每条记录中的prompt字段可与completion字段配对,作为监督式微调或强化学习训练中的输入-目标对;对于需要探索模型推理过程的研究,可提取completion中的reasoning_content内容。借助info字段内的timing与token_usage子结构,开发者能够量化生成延迟与资源消耗,而metrics中的pytest_reward则提供了客观的奖励信号,适用于训练奖励模型或评估策略的收敛效果。
背景与挑战
背景概述
在软件工程与人工智能的交叉领域,大型语言模型(LLM)驱动的代码生成与修复研究备受关注,其中对模型输出进行细粒度、多维度评估成为核心挑战之一。py-bug-trace-laguna-xs-2-l3-rollouts数据集由相关研究机构于近期构建,旨在捕捉模型在Python代码调试任务中的多步推理与回溯过程。该数据集包含15个训练样本,每个样本记录了模型从接收任务提示到生成最终答案的完整轨迹,包括多轮交互、工具调用、时序信息及基于pytest的奖励分数。通过结构化的字段设计如trace_id、rollout_number、latency_ms及详尽的timing子结构,该数据集为研究模型在复杂代码修复场景下的推理效率、回滚策略与中间状态演化提供了高保真数据基础,对推动LLM在自动化调试领域的评估方法论具有重要影响。
当前挑战
该数据集所应对的领域核心挑战在于,现有代码生成数据集多聚焦于单轮输入-输出映射,缺乏对模型在复杂、多步骤调试过程中推理路径与错误恢复行为的建模能力。具体而言,1)领域问题挑战:Python代码调试任务要求模型具备多步推理、错误根因定位及策略性回溯的能力,而传统静态评估指标难以衡量中间步骤的合理性、工具调用的有效性以及模型在面对分支错误时的自适应调整能力;2)构建过程挑战:数据集构建需精确记录模型在多轮交互中的完整时序信息、中间状态及环境反馈,但现有框架在确保轨迹数据的一致性、消除实验噪声以及高效标注工具调用与奖励信号方面存在显著困难,且样本规模仅15条,限制了统计泛化分析的有效性。
常用场景
经典使用场景
在软件工程与人工智能交叉领域中,py-bug-trace-laguna-xs-2-l3-rollouts数据集为研究者提供了一套结构精良的代码缺陷追踪与修复语料。通过记录模型在多次迭代生成中的提示词(prompt)、补全结果(completion)、奖励信号(reward)及延迟指标(latency_ms),该数据集成为评估大语言模型在Python程序纠错任务中表现的核心基准。研究者可借助其中的pytest_reward字段量化修复方案的通过率,利用trace_id串联多轮交互轨迹,进而深入分析模型在处理复杂缺陷时的收敛策略与行为模式。
衍生相关工作
该数据集催生了一系列围绕多轮交互式程序修复与过程奖励建模的经典工作。研究者基于其分层轨迹结构,提出了多步推理的信用分配算法,利用过程奖励模型对中间步骤的合理性进行细粒度评判。部分工作进一步将pytest_reward作为弱监督信号,构建了无需人工标注的强化学习训练框架,显著提升了模型在未知缺陷上的泛化能力。同时,数据集中的时序与token开销信息也启发了针对低延迟代码生成模型的架构设计研究,推动了高效推理引擎在编程任务中的落地实践。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成与调试过程中智能体行为的评估与优化,特别是在复杂编程任务中追踪和奖励信号的构建。研究前沿涉及利用多轮交互轨迹和细粒度时序数据来训练或微调大型语言模型,以提升其在代码修复和逻辑推理中的表现。随着AI编程辅助工具(如GitHub Copilot)的普及,该数据集为理解模型在动态错误追踪和代码补全中的决策过程提供了宝贵资源,推动了从简单代码生成到深度调试与优化能力的跨越,对自动化软件工程领域具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务