遇见数据集

poolside-laguna-hackathon/py-bug-trace-laguna-xs-2-l1-rollouts

收藏
Hugging Face2026-06-03 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于评估AI代理或强化学习模型性能的数据集,包含任务执行过程中的追踪信息。数据特征包括trace_id(追踪标识)、example_id(示例标识)、rollout_number(滚动编号)、task(任务)、prompt(提示,包含角色和内容)、completion(完成响应,包含角色、内容和推理内容)、answer(答案)、reward(奖励分数)、score(得分)、correct(正确性)、num_steps(步数)、total_time(总时间)、latency_ms(延迟毫秒)、created_at(创建时间)以及info(信息,包括任务难度、类别、时间统计、令牌使用量、完成状态、截断状态、停止条件和评估指标如精确匹配奖励和轮次数量)。数据集有35个训练样本,旨在分析模型在复杂任务中的表现、效率和准确性。

This dataset is designed for evaluating the performance of AI agents or reinforcement learning models, containing trace information during task execution. Features include trace_id, example_id, rollout_number, task, prompt (with role and content), completion (with role, content, and reasoning content), answer, reward, score, correct, num_steps, total_time, latency_ms, created_at, and info (including task difficulty, category, timing statistics, token usage, completion status, truncation status, stop condition, and evaluation metrics such as exact match reward and number of turns). The dataset consists of 35 training examples and aims to analyze model performance, efficiency, and accuracy in complex tasks.

搜集汇总
数据集介绍
poolside-laguna-hackathon/py-bug-trace-laguna-xs-2-l1-rollouts 数据集图片
构建方式
该数据集源于对Python代码缺陷追踪过程的系统性模拟与采集,通过构建回合制交互环境,记录模型在完成特定编程任务时的完整轨迹。每条数据以trace_id唯一标识,包含多轮提示与补全对,其中补全内容不仅存储模型输出文本,还捕获了推理过程与工具调用信息。数据集的构建采用了滚动采样策略,以rollout_number区分不同试次,并辅以精细的时间戳与延迟记录,从而还原出模型在执行任务时从环境交互到生成推理的完整时序。此外,每条轨迹均经过自动化评分系统的评估,赋予精确匹配奖励值作为效能度量。
特点
该数据集具备多维嵌套的精细结构,不仅包含基础的对话轮次与角色标记,还深入记录了模型内部的推理轨迹与工具调用序列。在元信息层面,每条数据被标记了任务类别、难度等级以及是否完整执行或截断等状态。尤为突出的是其详尽的性能度量体系,涵盖令牌消耗、各阶段耗时(如环境设置、模型生成、评分计算等),并精确到毫秒级延迟。这种结构使得研究者能够从行为效率、计算资源占用和推理过程等多个维度对模型进行深入剖析。
使用方法
使用时,用户可通过HuggingFace Datasets库加载该数据集,利用其包含的35条训练样本进行模型微调或强化学习策略评估。开发者可以提取prompt字段作为输入,将completion中的推理内容作为监督信号,结合reward分数进行优化。数据集中结构化的timing与token_usage字段可用于构建模型的成本感知训练目标,而info字段中的category与difficulty则支持按任务类型进行条件化训练。对于需要模拟真实编程环境交互的场景,tool_calls字段提供了工具调用的完整序列,便于训练模型的工具使用能力。
背景与挑战
背景概述
在软件工程领域,自动化漏洞检测与程序修复一直是研究焦点,尤其是基于大型语言模型的智能体应用近年展现出巨大潜力。py-bug-trace-laguna-xs-2-l1-rollouts数据集由相关研究团队构建,旨在为Python程序运行时错误追踪与修复任务提供标准化训练与评估基准。该数据集创建于现代LLM智能体技术快速发展的背景下,核心研究问题聚焦于如何利用轨迹级交互数据提升模型对复杂错误的理解与修复能力。数据集包含35个样本,详实记录了多轮交互中的提示、补全、奖励信号及时间、令牌使用等元信息,为探索智能体在任务执行中的推理过程与性能优化提供了细粒度数据支撑,对推动可解释、可复现的自动化程序修复研究具有重要价值。
当前挑战
该数据集所解决的核心领域挑战在于,真实世界程序错误具有高度多样性与隐蔽性,传统静态或动态分析方法难以有效建模复杂上下文依赖与修复策略。同时,构建过程中面临显著困难:首先,需从大量代码片段中筛选并模拟具有教学意义的非平凡错误场景,确保数据具备领域代表性;其次,多轮交互轨迹的精确追踪需平衡模拟环境真实性与数据采集成本,避免因环境截断或超时导致样本失效;最后,奖励信号设计中精确匹配与多回合性能指标的权重分配,直接关系模型对修复策略的鲁棒学习,成为数据集质量控制的突出挑战。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,py-bug-trace-laguna-xs-2-l1-rollouts数据集专注于Python代码缺陷的追踪与修复任务。其经典使用场景为训练和评估大语言模型在复杂多轮交互环境中的代码调试能力。数据集记录了模型从接收含缺陷的代码提示、逐步调用工具进行错误定位与修正,直至最终生成正确补丁的完整轨迹,并附带了详细的时序、延迟和令牌消耗等性能指标,为研究模型在真实软件工程任务中的推理过程与效率提供了标准化的评估框架。
解决学术问题
该数据集深刻回应了自动化程序修复领域中长期存在的两大核心挑战:多步推理能力的量化评估与细粒度过程监督。传统研究多聚焦于最终修复结果,而忽视了模型在探索、尝试和纠错中的中间行为。通过记录完整的修复轨迹与回合级奖励,该数据集使得研究者能够分析模型在不同难度缺陷下的策略选择、工具调用模式及停火条件,从而推动了从'结果导向'到'过程导向'的学术范式转换,为构建更鲁棒、可解释的代码修复智能体奠定了数据基础。
衍生相关工作
该数据集的发布催生了若干富有影响力的衍生工作。一方面,研究者利用其多回合交互特性,构建了基于强化学习的代码修复智能体,将每步模型输出转化为策略梯度更新的信号,显著提升了缺陷定位的准确率。另一方面,其丰富的时序与令牌使用数据被用于分析不同规模语言模型在编程任务中的开销-性能权衡,孕育出关于模型推理效率优化的新研究分支。此外,基于数据集中明确的停止条件与奖励设计,衍生出模拟人类调试行为的困难感知自适应推理框架,进一步弥合了机器修复与人工调试之间的鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务