遇见数据集

poolside-laguna-hackathon/umpalumpas

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Umpalumpas Oracle Trajectories 10-Row Subset是一个基于SWE-Smith的压缩数据集样本,属于一个更大数据集的10行子集,目前仍在开发中。该数据集专注于软件工程智能体的上下文压缩任务,旨在解决长运行智能体上下文耗尽的问题。数据集包含一个Parquet文件,每行代表一个oracle轨迹,预处理器联的离线检查点、oracle记忆和oracle延续。数据通过oracle模型(如Claude Opus 4.8)在SWE-Smith任务上生成,包括oracle rollout、压缩点、oracle摘要、探针/恢复和延续等元素,用于训练智能体主动执行压缩动作,并在压缩后有效恢复,以减少幻觉和重复。数据集支持SFT和RL训练,适用于文本生成任务。

Umpalumpas Oracle Trajectories 10-Row Subset is a sample of a larger dataset based on SWE-Smith, containing 10 rows and is a work in progress. This dataset focuses on context compaction for software engineering agents, addressing the issue of context exhaustion in long-running agents. It includes a single Parquet file with one row per oracle trajectory, preprocessed with linked offline checkpoints, oracle memories, and oracle continuations. Data is generated using an oracle model (e.g., Claude Opus 4.8) on SWE-Smith tasks, encompassing oracle rollouts, compaction points, oracle summaries, probe/recovery, and continuations. The dataset trains agents to actively perform compaction at semantic boundaries and recover effectively afterward, aiming to reduce hallucination and repetition. It supports both SFT and RL training and is categorized under text-generation tasks.

搜集汇总
数据集介绍
poolside-laguna-hackathon/umpalumpas 数据集图片
构建方式
该数据集基于SWE-Smith框架构建,采用Oracle模型(Claude Opus 4.8)生成端到端验证通过的软件工程任务轨迹。通过在轨迹中插入压缩点,模拟上下文窗口跨越场景,由Oracle模型在压缩点生成结构化摘要作为目标记忆,并在此基础上构建探测与恢复样本,以增强模型对不完整或压缩上下文的鲁棒性。最终形成包含Oracle轨迹、压缩摘要、恢复样本及成功延续动作的SFT与RL训练数据。
特点
数据集的核心创新在于将上下文压缩从被动运行时行为转变为智能体主动执行的语义级动作。每个轨迹行同时包含原始轨迹与派生的压缩训练标注,支持离线H2固定里程碑检查点。数据集提供结构化记忆字段,包括目标、相关文件、证据、测试、假设、约束与后续步骤,并专门设计恢复性训练样本以应对不完美摘要,从而减少幻觉与重复问题。
使用方法
数据集支持两种训练范式:对于SFT,直接使用Oracle轨迹中的消息、工具调用、压缩与恢复步骤进行监督学习;对于RL,保留可执行任务环境(仓库、镜像、测试命令等),在Pi兼容的展开环境中训练智能体自主调用compact_context工具管理上下文,并通过确定性验证器评估任务完成度。使用者可通过Laguna轨迹查看器交互式浏览示例轨迹,快速理解轨迹结构与压缩事件。
背景与挑战
背景概述
随着大型语言模型在软件工程智能体领域的广泛应用,上下文窗口限制成为制约长周期自动化任务执行效率的核心瓶颈。由研究者构建的Umpalumpas数据集(亦称Oracle Trajectories 10-Row子集)诞生于2024年,旨在应对智能体在复杂软件开发任务中因上下文耗尽而导致的推理中断问题。该数据集依托SWE-Smith框架,通过Oracle模型(Claude Opus 4.8)生成经过验证的完整执行轨迹,并创新性地定义了压缩点、Oracle摘要与延续行为三级结构。其研究核心在于将上下文压缩从被动的运行时预算事件转变为智能体的主动决策能力,强调在语义边界处进行结构化记忆的生成与不完美摘要的恢复,为软件工程智能体的上下文管理提供了全新的训练范式与评估基准。该数据集在智能体推理效率、幻觉抑制及重复行为减少等方向上展现出显著影响力,推动了端到端强化学习训练框架在可验证多步骤任务中的应用。
当前挑战
领域问题层面的挑战在于,现有上下文压缩方案多为阈值驱动的被动机制,智能体无法自主判断何时压缩以及如何压缩,导致关键任务状态丢失或压缩后信息丢失致任务失败。Umpalumpas数据集针对性地要求模型学会在语义里程碑处主动触发压缩,并基于不完整或噪声摘要完成恢复与延续,这直接挑战了当前模型在推理连贯性与任务完整性之间的平衡能力。构建过程中的挑战同样艰巨:数据生成依赖Oracle模型的高质量轨迹,需对每个轨迹插入压缩点并生成精准的结构化摘要,同时设计探针与恢复样本以模拟压缩后的信息损失场景。此外,将SFT数据转换为RL任务时需剥离Oracle解法而保留可执行问题设置,并构建Pi兼容的交互环境,确保智能体在真实工具调用中学习压缩技能,这要求高度复杂的工程化数据流水线与验证机制。
常用场景
经典使用场景
该数据集围绕软件工程智能体(SWE Agent)的上下文压缩能力展开,核心使用场景是训练大语言模型在长时间运行的任务中自主管理上下文窗口。具体而言,数据集中包含了经过验证的 Oracle 轨迹(oracle trajectories),每个轨迹记录了模型在解决软件工程任务时的完整交互过程,包括消息、工具调用、编辑操作、测试执行以及关键里程碑处的压缩点(compaction points)。研究者可基于这些数据训练模型学习何时进行压缩、如何将历史交互转化为结构化记忆,并在压缩后继续完成任务。数据集以 Parquet 格式存储,每条记录同时包含原始轨迹及其衍生的压缩训练标注,便于开展监督微调与强化学习训练。
实际应用
在实际应用层面,该数据集直接服务于构建能够处理长时间跨度的软件工程智能体系统。例如,在自动修复 GitHub 代码仓库中的缺陷任务中,智能体需要浏览文件、运行测试、尝试多个修复方案,整个过程可能消耗数万 token。数据集训练出的模型可以主动在完成探索或验证假设后调用压缩工具,将对话历史替换为包含目标、相关文件、测试证据和下一步计划的结构化记忆,从而在不丢失关键信息的前提下持续执行。这种能力同样适用于代码审查自动化、持续集成中的故障诊断、大型项目的重构建议等场景,显著提升智能体在资源受限环境下的任务完成率。
衍生相关工作
基于该数据集,已催生了一系列重要的研究方向与工作。最经典的是将 SFT 轨迹转换为强化学习任务,通过剥离 Oracle 解决方案,仅保留可执行的问题设置(仓库镜像、任务提示、验证命令),构建出可严格验证的 RL 环境。研究者在此基础上设计了工具增强的 rollout 循环,将压缩(compact_context)作为智能体的一个原生工具,训练模型不仅学会总结历史,更能在真实任务执行中调度压缩操作并成功达到验证标准。该范式直接启发了面向软件工程智能体的 RLVR(Reinforcement Learning from Verifiable Rewards)训练框架,推动了智能体上下文管理从规则驱动向学习驱动的转变,并为后续的长时任务规划、分层记忆管理等研究提供了数据基础和方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务