遇见数据集

ACC-dataset

收藏
Hugging Face2026-05-23 更新2026-05-24 收录
官方服务:

资源简介:

ACC(Agent Context Compilation)数据集是一个包含10,802个编译的长上下文问答对的数据集,源自多轮智能体轨迹。该数据集旨在解决标准智能体监督微调(SFT)中工具响应被掩码、仅监督轮次级工具选择而未能利用分散证据信号的问题。通过Agent Context Compilation(ACC)方法,将搜索、软件工程(SWE)和SQL智能体的轨迹转换为长上下文问答对,将原始问题与多轮收集的工具响应和环境观察组合起来,使问题与遥远证据之间的依赖关系显式化,从而实现对长上下文推理的直接监督,无需额外人工标注。数据集包含三个独立配置:search_agent(3,369个示例,将网络搜索轨迹编译为长上下文文档问答)、swe_agent(4,368个示例,将软件工程轨迹编译为代码库上下文问答)以及sql_agent(3,065个示例,将SQL智能体轨迹编译为表上下文关系问答)。每个示例遵循适用于长上下文推理监督微调的用户-助手对话格式,包含dialogs(两轮对话列表,含角色和内容)、ground_truth_answer(参考答案)等字段,具体字段因配置而异。该数据集适用于问答、文本生成、智能体、长上下文处理、软件工程和SQL等相关任务。

The ACC (Agent Context Compilation) dataset is a collection of 10,802 compiled long-context question-answer pairs derived from multi-turn agent trajectories. It aims to address issues in standard agent supervised fine-tuning (SFT), where tool responses are masked and only turn-level tool selection is supervised, failing to leverage scattered evidence signals. Through the Agent Context Compilation (ACC) method, trajectories from search, software engineering (SWE), and SQL agents are transformed into long-context QA pairs, combining original questions with multi-turn collected tool responses and environmental observations. This makes dependencies between questions and distant evidence explicit, enabling direct supervision of long-context reasoning without additional manual annotation. The dataset includes three independent configurations: search_agent (3,369 examples, compiling web search trajectories into long-context document QA), swe_agent (4,368 examples, compiling software engineering trajectories into codebase-context QA), and sql_agent (3,065 examples, compiling SQL agent trajectories into table-context relational QA). Each example follows a user-assistant dialogue format suitable for long-context reasoning SFT, containing fields such as dialogs (a two-turn dialogue list with roles and content) and ground_truth_answer (reference answer), with specific fields varying by configuration. The dataset is applicable to tasks related to question answering, text generation, agents, long-context processing, software engineering, and SQL.

创建时间:
2026-05-20
原始信息汇总

数据集概述

ACC (Agent Context Compilation) 是一个用于长上下文推理训练的数据集,包含 10,802 个编译后的长上下文问答对。这些问答对源自多轮智能体(Agent)轨迹,将搜索、软件工程和 SQL 智能体的轨迹转化为明确的长上下文问答对,从而直接监督模型的长上下文推理能力,无需额外的人工标注。

数据集组成

数据集包含三个子配置,每个配置独立存储为 JSONL 文件:

配置名称 样本数量 描述
search_agent 3,369 将网络搜索轨迹编译为长上下文文档问答对
swe_agent 4,368 将软件工程轨迹编译为代码库上下文问答对
sql_agent 3,065 将 SQL 智能体轨迹编译为表上下文关系型问答对
总计 10,802

数据字段

每个配置的字段结构略有不同:

search_agent

  • dialogs (list):包含两轮对话,每轮对话有 roleuser / assistant)和 content 字段。
  • ground_truth_answer (string):从编译轨迹中提取的参考答案。
  • context_length (string):目标长上下文规模,例如 100k

swe_agent

  • dialogs (list):包含两轮对话,每轮对话有 roleuser / assistant)和 content 字段。
  • instance_id (string):SWE-bench 格式的实例标识符。
  • repo (string):源仓库,格式为 owner/repo
  • base_commit (string):代码库上下文的 Git 提交哈希。

sql_agent

  • id (string):唯一示例标识符。
  • dialogs (list):包含两轮对话,每轮对话有 roleuser / assistant)和 content 字段。
  • ground_truth_answer (string):参考答案,通常包裹在 <answer></answer> 标签内。
  • task_type (string):SQL 任务类别。
  • metadata (object):包含 sqlscalecomplexitytask_type 等额外字段。

所有示例均遵循用户-助手的对话格式,适用于长上下文推理的监督微调。

使用方式

可通过 datasets 库加载,每个配置需单独加载:

python from datasets import load_dataset

search_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "search_agent", split="train") swe_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "swe_agent", split="train") sql_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "sql_agent", split="train")

注意事项

  • 三个配置具有不同的数据模式,应分开加载。
  • 部分示例包含很长的 content 字段,若在线预览出现 TooBigContentError,可下载后本地加载。
  • 示例来源于智能体轨迹,可能继承了源环境和工具中的偏差或错误。

引用与许可

搜集汇总
数据集介绍
ACC-dataset 数据集图片
构建方式
ACC-dataset(Agent Context Compilation Dataset)旨在解决标准智能体监督微调中工具响应被掩码、证据信号分散的问题。该数据集通过一种称为“智能体上下文编译”(Agent Context Compilation, ACC)的构建方法,将来自搜索(Search)、软件工程(SWE)和SQL三类智能体的多轮交互轨迹,转化为长上下文问答对。具体而言,构建过程将原始问题、工具响应以及跨回合收集的环境观察进行整合,使问题与远处证据之间的依赖关系显式化,从而在不依赖额外人工标注的情况下,实现了对长上下文推理能力的直接监督训练。最终,数据集共包含10,802个经编译的长上下文问答样本。
特点
ACC-dataset拥有三大显著特点。其一,该数据集以智能体类型为划分依据,提供了search_agent、swe_agent和sql_agent三种独立配置,分别对应网络搜索文档问答、软件工程代码库问答及SQL表上下文关系型问答,覆盖了多元化的长上下文应用场景。其二,每个样本均遵循用户-助手的双轮对话格式,并携带丰富的元数据字段,例如在search_agent中包含上下文长度标签,swe_agent中提供仓库与提交哈希信息,sql_agent中则包含任务类型与SQL语句等细节,极大地便利了针对性的研究。其三,部分样本的content字段长度极大,这是长上下文特性的直接体现,也意味着该数据集对模型的长序列处理能力提出了严峻挑战。
使用方法
使用ACC-dataset十分便捷。用户可通过Hugging Face的datasets库,利用load_dataset函数加载对应配置,例如使用load_dataset("groundhogLLM/acc-agent-context-compilation", "search_agent", split="train")来获取search_agent的数据。需要注意的是,三种配置具有不同的数据模式,因此必须分别加载。每个样本可通过访问其dialogs字段获取对话内容,利用ground_truth_answer字段获取参考答案。由于部分样本序列极长,在线预览可能因“TooBigContentError”而受限,此时可直接下载至本地后使用datasets库加载。此外,该数据集采用Apache License 2.0许可,研究用途需引用相关论文。
背景与挑战
背景概述
在多智能体系统与长上下文语言模型迅速发展的时代背景下,如何高效利用多轮交互中散布的证据信号来训练模型的长程推理能力,成为自然语言处理领域的重要议题。ACC(Agent Context Compilation)数据集于2026年由Qisheng Su、Zhen Fang等研究团队创建,旨在解决标准智能体监督微调(SFT)仅关注单轮工具选择而忽略跨轮次依赖关系的局限。该数据集通过将搜索、软件工程(SWE)及SQL三类智能体的轨迹编译为长上下文问答对,显式关联问题与远距离证据,从而无需额外人工标注即可实现长上下文推理的直接监督。其发布对提升大语言模型在复杂、多轮交互场景中的上下文理解与推理能力具有里程碑式的影响。
当前挑战
ACC数据集面临的核心挑战包括:首先,在领域问题层面,传统智能体SFT方法仅以工具选择为监督信号,未能有效利用轨迹中散落的上下文证据,导致模型在处理需要跨多轮推理的复杂任务(如代码库漏洞定位、结构化表格查询)时表现欠佳,亟需一种能将分散信息整合为结构化长上下文训练样本的方法。其次,在构建过程中,不同智能体(搜索、SWE、SQL)产生的轨迹格式各异,数据结构与语义复杂度迥异,如何统一地将异质轨迹编译成格式规范、质量可控的长上下文问答对,同时保留原始环境中的关键依赖关系且避免引入噪声,是构建过程的核心技术难点。此外,长上下文样本规模庞大(如100k tokens),对数据加载与预览工具的性能构成了工程性挑战。
常用场景
经典使用场景
ACC-dataset专为长上下文推理任务而设计,其经典使用场景涵盖多智能体轨迹的监督微调。数据集将搜索、软件工程(SWE)和SQL三种智能体在多次交互中生成的工具响应与环境观测结果,系统性地编译为超过10,000条长上下文问答对。每个样本以简洁的双轮对话形式呈现,其中用户问题与散布在多轮交互中的证据信号被紧密关联,从而为模型提供明确的远程依赖监督信号。研究者可直接利用该数据集对大型语言模型进行长序列理解训练,显著提升其在复杂多跳推理场景下的表现。
衍生相关工作
围绕ACC-dataset已衍生出多项具有影响力的研究工作。其核心方法论启发了将智能体多渠道交互转化为结构化监督信号的系列技术,催生了基于轨迹编译的自动化长上下文训练范式。相关学者在此基础上进一步探索了证据链可视化与推理路径解析方法,开发出能够动态追踪模型注意力分布的工具。数据集本身作为基准,也支撑了多项对比实验,验证了显式远程监督相较于传统掩码训练在不同模型规模与架构上的泛化优势。此外,ACC的编译框架已被扩展至多模态智能体场景,推动了视觉-语言联合推理数据集的设计与长视频理解等前沿方向的发展。
数据集最近研究
最新研究方向
当前,随着大语言模型在复杂任务中扮演愈发重要的角色,如何让模型具备长程依赖推理能力成为研究焦点。ACC-dataset应运而生,其核心突破在于将多轮智能体轨迹转化为长上下文问答对,无需额外人工标注即可监督模型对远端证据的推理。该数据集覆盖搜索、软件工程与SQL三大典型代理场景,总计超过一万条样本,直接呼应了学术界对高效长上下文训练数据的迫切需求。其提出的Agent Context Compilation方法,巧妙整合了分散在工具响应与环境观察中的信号,为突破传统监督微调中信号稀疏的瓶颈提供了全新路径。这一工作不仅填补了智能体长上下文推理数据集的空白,更可能推动下一代自主代理在真实复杂环境中的表现跃升,具有深远的应用价值与前沿引领意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务