遇见数据集

AutoCompact

收藏
github2026-07-31 更新2026-08-04 收录
官方服务:

资源简介:

AutoCompact数据集包含在SWE-rebench上收集的1,052个由评判者指导的、基于策略的SFT示例,用于训练模型何时压缩上下文、保留什么以及如何从压缩状态继续。

The AutoCompact Dataset contains 1,052 judge-guided, policy-based supervised fine-tuning (SFT) examples collected on the SWE-rebench benchmark, which are designed to train models to determine when to compress context, what information to retain, and how to resume from the compressed state.

创建时间:
2026-07-31
原始信息汇总

AutoCompact 数据集概述

AutoCompact 是一个用于训练长时程编码智能体在上下文中进行压缩决策的数据集,其核心思想是教会智能体何时压缩上下文、保留哪些内容、以及如何从压缩状态继续执行

数据集内容

  • 规模:包含 1,052 条 基于评委引导(judge-guided)、在线策略(on-policy)的监督微调(SFT)示例。
  • 来源:数据收集自 SWE-rebench 平台。
  • 记录内容:每条数据记录了评委如何评估并在必要时修订基础模型的三类输出:
    • 提出的动作(proposed action)
    • 压缩摘要(compact summary)
    • 压缩后的继续执行内容(post-compaction continuation)

数据用途

这些示例旨在训练模型将嘈杂的完整轨迹替换为紧凑的 # Auto Context Summary,该摘要需保留:

  • 任务目标
  • 当前工作区状态
  • 未解决的问题
  • 继续执行所需的信息

发布计划

  • 数据集文件
  • 模式(schema)与字段定义
  • 任务来源及预处理说明
  • 加载与使用示例
  • 许可证与使用条款

引用信息

bibtex @misc{zhang2026autocompact, title = {AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents}, author = {Zhang, Xuan and Zheng, Longtao and Du, Cunxiao and An, Bo and Dong, Xin}, year = {2026}, url = {https://autocompact.github.io/} }

许可证

数据集的许可证和使用条款将随数据集发布时一并公布。

搜集汇总
数据集介绍
AutoCompact 数据集图片
构建方式
在长程编码智能体的研究领域中,上下文窗口的有限性常成为制约智能体效能的瓶颈。为应对这一挑战,研究者提出了AutoCompact数据集,其构建方式别具匠心。该数据集包含1,052个由裁判引导的、基于策略的SFT示例,这些示例在SWE-rebench平台上采集。每个示例详细记录了裁判对基础模型提出的动作、紧凑摘要以及压缩后延续的评估与修订过程。通过此构建流程,数据集旨在引导模型摒弃冗长嘈杂的完整轨迹,转而生成精炼的“# Auto Context Summary”,其中保留了任务目标、当前工作区状态、未解决问题及继续执行所需的关键信息。
特点
AutoCompact数据集的核心特点在于其前瞻性与自适应性。传统方法往往依赖于固定的上下文长度阈值,而AutoCompact则训练智能体在任务状态指示早期探索已无裨益时,主动调用compact()函数,实现动态、按需的上下文压缩。这种机制不仅提升了长程编码任务的效率,还增强了模型对复杂任务状态的敏感性。数据集通过裁判的智能评估与修正,确保了示例的高质量与教学价值,使模型能够学习何时压缩、保留什么以及如何从压缩状态继续,从而在长时程编码智能体领域树立了新的标杆。
使用方法
该数据集的使用方法将随其正式发布一并详尽阐述。预计将提供数据集文件、模式与字段定义、任务来源及预处理说明、加载与使用示例,以及许可证和使用条款。研究人员可基于这些资源,将AutoCompact数据集应用于微调编码智能体模型,使其学会在适当的时机进行上下文压缩。通过遵循提供的示例与文档,用户能够顺利集成该数据集,训练出能够高效管理上下文、提升长程任务完成质量的智能体,推动编码智能体在实际应用中的进一步发展。
背景与挑战
背景概述
随着大语言模型在长时程编码任务中的广泛应用,上下文窗口的长度限制成为制约其性能的瓶颈。AutoCompact数据集由张旋、郑龙涛、杜存孝、安波和董欣等研究人员于2026年创建,旨在解决编码智能体在长时程任务中何时压缩上下文、保留何种信息以及如何从压缩状态继续执行的问题。该数据集基于SWE-rebench平台,包含1,052条经过法官引导的在线策略SFT样本,记录了法官对基础模型提出的动作、压缩摘要及压缩后延续的评估与修订过程。通过引入主动压缩机制,AutoCompact突破了传统固定阈值压缩的局限性,为提升编码智能体的上下文管理能力提供了新的研究范式,对推动长时程智能体领域的发展具有重要意义。
当前挑战
AutoCompact数据集面临的挑战主要体现在两个层面。在领域问题层面,长时程编码智能体常因上下文窗口溢出而性能下降,现有压缩策略缺乏对压缩时机的智能判断,无法在任务状态变化时及时调整,导致信息丢失或冗余累积。在构建过程中,如何确保法官引导的SFT样本覆盖多样化的任务场景和压缩决策,以及如何精确标注压缩摘要与延续动作的质量,成为数据集构建的难点。此外,判别压缩后摘要的有效性、避免信息缺失或误导后续决策,也是数据集设计时需要克服的关键挑战。这些问题的解决对于提升编码智能体的鲁棒性和适应性至关重要。
常用场景
经典使用场景
AutoCompact数据集专为长时程编码代理(coding agents)中的上下文管理而设计,其经典使用场景是训练模型在复杂的多步骤软件工程任务中主动判断何时压缩上下文、保留哪些关键信息以及如何基于压缩状态无缝继续执行。该数据集基于SWE-rebench平台收集了1,052条经过裁判指导的在线策略监督微调(SFT)样本,每条样本详细记录了裁判对基线模型提出的动作、压缩摘要及压缩后延续的评估和修订过程。这一场景聚焦于替代传统的固定长度阈值触发机制,使代理能够根据当前任务状态动态调整上下文,从而避免上下文膨胀导致的性能退化。研究者可直接利用该数据集开发、微调或评估编码代理的上下文压缩策略,提升其在真实长时程编程任务中的鲁棒性和效率。
解决学术问题
该数据集针对长时程编码代理在处理复杂软件工程问题时面临的上下文长度瓶颈这一核心学术难题。传统方法通常依赖固定上下文窗口或简单截断策略,但这种方法无法感知任务的内在进展,导致重要历史信息丢失或无关噪声累积。AutoCompact通过引入‘何时压缩’的智能决策机制,解决了上下文管理的动态权衡问题,使代理能够在早期探索不再产生价值时主动触发压缩,同时保留任务目标、当前工作区状态、未解决问题及延续所需的关键信息。这一创新不仅提升了模型在长时程任务中的持续推理能力,还为上下文压缩策略的自动化学习提供了标准化数据基准,推动了自主编码代理和智能体上下文管理理论的研究进展。
衍生相关工作
AutoCompact数据集的出现预示着一系列后续研究工作的展开,其格式和内容可能催生多个经典研究方向。首先,围绕‘何时压缩’的决策模型,衍生出强化学习或元学习算法,用于优化压缩时机选择以最大化长期任务性能。其次,该数据集中裁判修订的文本对可被复用来训练独立的摘要生成器,进一步提升压缩后的信息保真度。此外,该数据集与SWE-rebench生态的兼容性鼓励与现有基准的集成比较,推动统一评估协议的产生。潜在的研究包括上下文压缩策略的迁移学习、多语言代码场景的扩展,以及将压缩机制融入多代理协作框架。最终,这些工作将共同推进智能编码代理的自主性和效率边界,成为该领域后续创新的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务