遇见数据集

CooperBench/qwen9b-coop-claude-code-compressed

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

qwen9b-coop-claude-code-compressed-ak是一个合成的压缩合作代理轨迹数据集,源自CooperBench/qwen9b-coop-claude-code数据集。该数据集通过压缩原始合作代理轨迹生成,移除了冗余步骤,修复了提交仪式,并在需要的地方插入了合作事件(如coop-send/coop-broadcast/coop-recv等)。数据集采用Format B(OpenAI工具调用模式)格式,包含带有结构化tool_calls的assistant消息和tool角色结果,适用于聊天模板的监督微调(SFT)。数据集包含347对合作轨迹,涉及26个代码仓库,原始步骤48,942条被压缩至18,032条,压缩率达63.2%。每个代理平均26.0步,中位数25步。数据集保留了原始代理的实际状态,包括失败案例,旨在提供压缩形式的训练信号而非修正后的标准答案。

Synthetic compressed cooperative agent trajectories derived from CooperBench/qwen9b-coop-claude-code. Each raw pair (two LLM coding agents on overlapping features in the same repo, communicating via Redis messaging + a team git remote) is condensed into an idealized version: wasted steps dropped, broken submission rituals fixed, missing cooperation events inserted where needed. The output is in Format B (OpenAI tool-calls schema) — assistant messages with structured tool_calls, tool role for results — ready for chat-template SFT.

提供机构:
CooperBench
搜集汇总
数据集介绍
CooperBench/qwen9b-coop-claude-code-compressed 数据集图片
构建方式
该数据集源自CooperBench/qwen9b-coop-claude-code,原始数据包含368对由Qwen/Qwen3.5-9B模型驱动的智能体在26个代码仓库中通过Redis消息和team远程仓库协作的轨迹。构建过程采用cooperdata.synth_traj.compress工具,由gemini/gemini-3.5-flash模型驱动,分四步进行:首先对原始轨迹进行索引,建立标准化的步骤列表并剔除重复的读取操作;随后由Flash模型对每个步骤进行压缩决策,保留关键步骤或生成简短的Bash协作调用;接着通过提交仪式归一化器修复无效的git diff命令;最终输出为符合OpenAI工具调用模式的Format B格式,包含结构化的tool_calls和tool角色消息。整个处理过程并行化执行,共产生694条智能体轨迹,压缩率达63.2%。
特点
本数据集的核心特点在于对原始协作轨迹的理想化压缩:不仅剔除了无效步骤和错误的提交流程,还智能插入了缺失的协作事件,如coop-send、coop-recv和git fetch/diff等,使每条轨迹成为更纯净的协作范例。数据集提供了丰富的元数据,包括每个轨迹的原始步骤数、压缩步骤数、输入输出token数及生成成本,便于研究者筛选和训练。值得注意的是,数据集保留了原始智能体的真实失败状态,不进行人为修正,因此可作为失败恢复和错误处理的训练信号。此外,协作消息被分为技术性、状态和中立三类,为细粒度分析提供了基础。
使用方法
使用该数据集进行监督微调时,可依据index.csv中的元数据进行灵活筛选。建议利用metadata.coop_events_in_pair字段筛选出协作事件丰富的样本(≥3个)用于训练智能体的协调能力;通过raw_status字段区分成功和失败的轨迹,可将失败样本作为恢复训练用例;根据synth_steps对轨迹长度进行分层采样,以平衡训练数据分布。数据集以Format B格式组织,可直接用于基于聊天模板的SFT训练,无需额外格式转换。实际使用时,可通过load_dataset接口加载index.csv,根据log_dir路径访问完整的轨迹JSON文件,包括压缩后的代理轨迹、跨智能体协作消息和生成元数据。
背景与挑战
背景概述
该数据集由Arpandeep Khatua于2026年创建,源自CooperBench项目,旨在解决多智能体协作编程中的轨迹压缩问题。研究聚焦于如何将真实多代理协同过程中产生的冗长、碎片化交互轨迹,转化为结构化的理想化训练样本,以支持大语言模型(LLM)在协作编码场景下的监督微调(SFT)。通过对694条代理轨迹(涵盖26个代码仓库、347个协作对)的压缩与重构,数据集保留了关键的协作事件(如coop-send/recv、git操作),同时丢弃了63.2%的冗余步骤。这一工作填补了高质量、结构化多代理协作数据集的空白,为提升LLM在分布式版本控制、实时通讯等真实协作环境中的自适应能力提供了重要基础资源。
当前挑战
当前面临的核心挑战包括:1) 领域问题方面,原始多代理协作轨迹常因通讯基础设施缺陷(如coop-broadcast工具调用失败)而失真,需在压缩过程中插入合理化的协作事件,但可能引入不反映真实失败模式的合成噪声;2) 构建过程中,35%的轨迹长度偏离理想窗口(30-50步),极端不对称或过短的轨迹难以有效压缩,且代理的实际代码修改(补丁)未经验证,致使失败轨迹在压缩后仍保持错误状态,无法作为纠正性训练信号;3) 语义真实性维护困难——基于提示约束的生成模型受限插入简短占位符结果,与真实工具返回的复杂上下文之间存在信息损失,可能削弱下游SFT模型的鲁棒性。
常用场景
经典使用场景
在智能体协同编程研究领域,多智能体协作轨迹数据是训练模型理解分工、通信与任务协调能力的重要基石。该数据集以Qwen3.5-9B为基底模型,在26个真实代码仓库中采集347对协同编程智能体的原始交互轨迹,经过精炼压缩后形成694条标准化轨迹。其最经典的使用场景在于为大型语言模型提供结构化的协作行为训练信号——每条轨迹遵循OpenAI工具调用格式,保留完整的工具调用序列与环境反馈,可无缝对接聊天模板监督微调流程。研究者常利用其`coop_events_in_pair`元数据筛选高协作质量样本,重点训练模型在代码开发场景下的通信发起、信息广播与远程仓库同步等关键协作技能,从而提升多智能体系统在复杂编程任务中的协调效率。
衍生相关工作
围绕本数据集的构建与特性,衍生出了一系列具有方法论价值的关联工作。其一,其采用的`cooperdata.synth_traj.compress`压缩框架启发了面向轨迹数据的理想化重构管线研究,包括确定性索引配对、大语言模型驱动的操作选择与验证,以及提交仪式规范化模块,为后续研究者创建特定领域(如科学研究、自动驾驶)的合成轨迹数据集提供了可复现的工程范式。其二,数据集的`_synthesis_meta.json`元数据结构(记录操作、成本与token消耗)催生了关于合成数据效率评估的基准研究,探讨如何在预算约束下最大化轨迹信息的保留量与协作行为覆盖率。其三,因其保留失败轨迹作为恢复示例的设计理念,学界开始关注“负样本协作轨迹”在训练鲁棒性智能体中的价值,多篇后续工作借鉴其`raw_status`过滤策略来构建包含错误恢复能力的对抗性协作训练集。
数据集最近研究
最新研究方向
在多智能体协作编程的前沿研究中,轨迹压缩技术正成为提升训练效率的核心手段。该数据集聚焦于将Qwen3.5-9B模型在Claude Code框架下产生的原始协作智能体轨迹进行精炼,通过剔除冗余步骤、修复断裂的协作事件(如coop-send/broadcast/recv及git团队操作),生成结构化的工具调用格式数据,为监督微调(SFT)提供高质量训练信号。这一方向与当前热点——利用合成数据增强智能体协调能力——高度契合,尤其针对多智能体在代码仓库中进行特征重叠开发时的通信缺陷与流程优化。其价值在于,63.2%的步骤压缩率与343个合作事件分类(技术/状态/中性)表明,该方法能有效提炼长尾轨迹中的关键协作模式,为构建更鲁棒的编码智能体系统提供了可复现的数据基础,推动从单智能体指令追踪向多智能体同步协调的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务