ACC-dataset
收藏资源简介:
ACC(Agent Context Compilation)数据集是一个包含10,802个编译的长上下文问答对的数据集,源自多轮智能体轨迹。该数据集旨在解决标准智能体监督微调(SFT)中工具响应被掩码、仅监督轮次级工具选择而未能利用分散证据信号的问题。通过Agent Context Compilation(ACC)方法,将搜索、软件工程(SWE)和SQL智能体的轨迹转换为长上下文问答对,将原始问题与多轮收集的工具响应和环境观察组合起来,使问题与遥远证据之间的依赖关系显式化,从而实现对长上下文推理的直接监督,无需额外人工标注。数据集包含三个独立配置:search_agent(3,369个示例,将网络搜索轨迹编译为长上下文文档问答)、swe_agent(4,368个示例,将软件工程轨迹编译为代码库上下文问答)以及sql_agent(3,065个示例,将SQL智能体轨迹编译为表上下文关系问答)。每个示例遵循适用于长上下文推理监督微调的用户-助手对话格式,包含dialogs(两轮对话列表,含角色和内容)、ground_truth_answer(参考答案)等字段,具体字段因配置而异。该数据集适用于问答、文本生成、智能体、长上下文处理、软件工程和SQL等相关任务。
The ACC (Agent Context Compilation) dataset is a collection of 10,802 compiled long-context question-answer pairs derived from multi-turn agent trajectories. It aims to address issues in standard agent supervised fine-tuning (SFT), where tool responses are masked and only turn-level tool selection is supervised, failing to leverage scattered evidence signals. Through the Agent Context Compilation (ACC) method, trajectories from search, software engineering (SWE), and SQL agents are transformed into long-context QA pairs, combining original questions with multi-turn collected tool responses and environmental observations. This makes dependencies between questions and distant evidence explicit, enabling direct supervision of long-context reasoning without additional manual annotation. The dataset includes three independent configurations: search_agent (3,369 examples, compiling web search trajectories into long-context document QA), swe_agent (4,368 examples, compiling software engineering trajectories into codebase-context QA), and sql_agent (3,065 examples, compiling SQL agent trajectories into table-context relational QA). Each example follows a user-assistant dialogue format suitable for long-context reasoning SFT, containing fields such as dialogs (a two-turn dialogue list with roles and content) and ground_truth_answer (reference answer), with specific fields varying by configuration. The dataset is applicable to tasks related to question answering, text generation, agents, long-context processing, software engineering, and SQL.
数据集概述
ACC (Agent Context Compilation) 是一个用于长上下文推理训练的数据集,包含 10,802 个编译后的长上下文问答对。这些问答对源自多轮智能体(Agent)轨迹,将搜索、软件工程和 SQL 智能体的轨迹转化为明确的长上下文问答对,从而直接监督模型的长上下文推理能力,无需额外的人工标注。
数据集组成
数据集包含三个子配置,每个配置独立存储为 JSONL 文件:
| 配置名称 | 样本数量 | 描述 |
|---|---|---|
search_agent |
3,369 | 将网络搜索轨迹编译为长上下文文档问答对 |
swe_agent |
4,368 | 将软件工程轨迹编译为代码库上下文问答对 |
sql_agent |
3,065 | 将 SQL 智能体轨迹编译为表上下文关系型问答对 |
| 总计 | 10,802 |
数据字段
每个配置的字段结构略有不同:
search_agent
dialogs(list):包含两轮对话,每轮对话有role(user/assistant)和content字段。ground_truth_answer(string):从编译轨迹中提取的参考答案。context_length(string):目标长上下文规模,例如100k。
swe_agent
dialogs(list):包含两轮对话,每轮对话有role(user/assistant)和content字段。instance_id(string):SWE-bench 格式的实例标识符。repo(string):源仓库,格式为owner/repo。base_commit(string):代码库上下文的 Git 提交哈希。
sql_agent
id(string):唯一示例标识符。dialogs(list):包含两轮对话,每轮对话有role(user/assistant)和content字段。ground_truth_answer(string):参考答案,通常包裹在<answer></answer>标签内。task_type(string):SQL 任务类别。metadata(object):包含sql、scale、complexity和task_type等额外字段。
所有示例均遵循用户-助手的对话格式,适用于长上下文推理的监督微调。
使用方式
可通过 datasets 库加载,每个配置需单独加载:
python from datasets import load_dataset
search_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "search_agent", split="train") swe_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "swe_agent", split="train") sql_ds = load_dataset("groundhogLLM/acc-agent-context-compilation", "sql_agent", split="train")
注意事项
- 三个配置具有不同的数据模式,应分开加载。
- 部分示例包含很长的
content字段,若在线预览出现TooBigContentError,可下载后本地加载。 - 示例来源于智能体轨迹,可能继承了源环境和工具中的偏差或错误。
引用与许可




