遇见数据集

CooperBench/qwen9b-coop-claude-code

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

qwen9b-coop-claude-code数据集是通过在CooperData任务集上以coop模式运行CooperBench生成的双代理协作编码轨迹,使用Qwen/Qwen3.5-9B模型和Claude Code代理框架。每个配对并行运行两个代理(每个功能一个),通过Redis消息传递和共享git远程进行协调。数据集包含368个配对,总令牌数(输入+输出,两个代理)约为23.4亿,双功能通过率为9.0%(33/368),单功能通过率为19.3%(142/736)。源数据集为CooperData,涵盖26个仓库和混合编程语言。

--- 许可证:MIT协议 语言: - 英语 - 代码 样本规模类别: - 样本数少于1000 任务类别: - 文本生成 - 文本分类 标签: - CooperBench(CooperBench) - CooperData(CooperData) - coop - claude-code - Qwen - 多智能体(multi-agent) - 智能体轨迹(agentic-trajectories) - 训练中阶段(mid-training) 配置项: - 配置名称:default 数据文件: - 拆分方式:训练拆分 路径:index.csv --- # qwen9b-coop-claude-code 数据集 本数据集包含通过以下方式生成的双智能体协作式编码轨迹:在[CooperData(CooperData)](https://github.com/cooperbench/CooperData)任务集上以`coop`模式运行[CooperBench(CooperBench)](https://github.com/cooperbench/CooperBench),以**Qwen/Qwen3.5-9B**作为基础模型,以**Claude Code(`claude_code`)**作为智能体框架。每一组任务并行运行两个智能体,分别对应一个功能特性,并通过Redis消息传递与共享Git远程仓库实现协作调度。 与之匹配的单智能体基线数据集可在[CooperBench/qwen9b-solo-claude-code](https://huggingface.co/datasets/CooperBench/qwen9b-solo-claude-code)获取。二者使用完全相同的任务语料、模型与智能体框架,仅协作调度方式存在差异,因此可通过二者对比精准隔离出协作机制带来的性能缺口。 ## 概览 | 指标 | 详情 | |---|---| | 实验设置 | `coop`模式(双智能体,Redis消息传递+共享Git远程仓库) | | 基础模型 | `Qwen/Qwen3.5-9B`(基于Modal平台H100显卡部署vLLM 0.19.0,上下文长度128K,采用FP8量化KV缓存) | | 智能体框架 | `claude_code` | | 源数据集 | CooperData,涵盖26个代码仓库,包含多种编程语言 | | 任务组数 | **368** | | 总Token(Token)数(双智能体的输入+输出) | **约23.4亿** | | 双功能均通过占比 | 33 / 368 = **9.0%** | | 单功能通过占比 | 142 / 736 = 19.3% | ## 文件结构 qwen9b-coop-claude-code/ ├── README.md ├── index.csv # 轻量化索引表(每组任务对应一行,详见下文Schema) └── coop/ # 原始运行日志目录 └── <repo>/<task>/<features>/ ├── result.json # 智能体状态、执行步骤与Token统计 ├── eval.json # 各功能特性的测试通过/失败结果与输出 ├── agent{1,2}_session.jsonl # 原始Claude Code会话事件 ├── agent{1,2}_stream.jsonl # 模型输出流数据 ├── agent{1,2}_traj.json # 整理后的智能体轨迹 ├── agent{1,2}.patch # 智能体生成的代码差异文件 └── conversation.json `index.csv` 是Hugging Face数据集查看器顶部展示的索引文件,其Schema包含10个字段: | 字段名 | 说明 | |---|---| | `repo`、`task_id`、`features` | 任务标识信息 | | `setting`、`agent_framework`、`model` | 实验溯源信息 | | `both_passed` | 双功能均通过的结果标记 | | `pair_tokens` | 单组任务中双智能体的输入与输出总Token数(训练中阶段的规模统计) | | `log_dir` | 当前行对应原始日志子树的路径 | | `metadata` | JSON格式元数据:包含各智能体状态与Token统计、各功能特性测试计数(不含`test_output`)、代码合并/应用结果、时间戳与产物文件名 | `metadata`字段采用轻量化设计(平均每行约1.4KB),较重的产物文件(如`test_output`、`merge.diff`、补丁文件主体、原始轨迹等)均存储在原始`coop/`目录中,可通过`log_dir`字段访问。 ## 数据集生成流程 bash # 1. 在Modal平台部署vLLM模型端点(一次性操作) QWEN_MAX_MODEL_LEN=131072 modal deploy src/cooperdata/eval/serve/qwen_modal.py # 2. 以coop模式运行CooperBench .venv/bin/cooperbench run --base-url https://cooperbench--qwen35-9b-128k-serve.modal.run --auth-token dummy -m Qwen/Qwen3.5-9B -a claude_code --setting coop --git -c 4 -n qwen-coop-claude-code ## 训练中阶段Schema核心说明 - `pair_tokens`:单组任务中双智能体的输入与输出Token总数。全数据集训练拆分后的总Token数约为**23.4亿**。 - `agent_framework`、`model`、`setting`:用于与匹配的单智能体数据集进行分层抽样对比。 - `both_passed`:结果过滤标记。 - 如需获取单智能体/单功能特性的细分数据,可解析`metadata`字段: python import csv, json for r in csv.DictReader(open("index.csv")): m = json.loads(r["metadata"]) ... ## 注意事项 本数据集的评估流水线存在若干已知问题,受影响的样本已在事后修正,但仍需注意以下几点: 1. CooperBench的评估逻辑会将**任意**测试用例失败标记为`both_passed = False`,包括补丁文件涉及的代码文件中原本就存在的不稳定测试。可通过`metadata.eval.feature{1,2}.tests_passed/_failed/_exit_code`字段区分近乎通过的任务与空补丁任务。 2. CooperBench的Cargo解析器会低估Rust多二进制项目的输出,因此针对Rust仓库(`anyhow_task`)的样本已重新解析。 3. 部分`runner.sh`文件(`anyhow`、`avro`、`click`、`pygments`、`oauthlib`、`sqlfluff`、`typeguard`)以及`axios`的Dockerfile在实验过程中存在模板/Node版本兼容性问题,受影响的任务组已通过固定镜像重新评估。 ## 引用格式 bibtex @dataset{qwen9b_coop_claude_code, title = {qwen9b-coop-claude-code: two-agent cooperative coding trajectories on Qwen 3.5-9B}, author = {CooperBench Team}, year = 2026, url = {https://huggingface.co/datasets/CooperBench/qwen9b-coop-claude-code}, } 完整的双智能体协作与单智能体对比分析可参阅该PR:<https://github.com/cooperbench/CooperData/pull/100>

提供机构:
CooperBench
搜集汇总
数据集介绍
CooperBench/qwen9b-coop-claude-code 数据集图片
构建方式
该数据集由CooperBench团队在coop模式下运行生成,以CooperData任务集为底层代码仓库,采用Qwen/Qwen3.5-9B作为驱动模型,结合Claude Code代理框架,实现双代理并行协作。每个任务对中的两个代理分别负责一个独立功能,通过Redis消息队列与共享的Git远程仓库进行通信与代码合并,从而模拟真实的多人协同编程场景。整个生成流程依托vLLM端点部署于Modal H100平台,支持128K上下文窗口与fp8 KV缓存优化,最终产出368个协作轨迹样本,总计约23.4亿个token。
特点
该数据集以双代理协同编码的完整轨迹为核心,记录了每个代理的会话事件、流式输出、精简轨迹、代码补丁及合并结果,结构层次分明。关键指标both_passed反映了双功能同时通过测试的比例(9.0%),而per-feature pass率则为19.3%,便于研究者量化协作损失。数据集同时提供轻量级index.csv索引文件,包含pair_tokens、agent_framework、setting等字段,便于构建中训练样本的按需采样与过滤。配套的单代理基线数据集可直接对比,两者仅在协调机制上存在差异,从而精准隔离协作对模型性能的影响。
使用方法
用户可通过HuggingFace Dataset Viewer直接查看index.csv表,获取每个任务对的元数据摘要。如需访问完整的原始轨迹、补丁文件及评估结果,可依据log_dir字段路径进入coop/目录下的子文件夹。对于中训练(mid-training)场景,推荐利用pair_tokens字段估算样本规模,并结合both_passed进行结果筛选;若需逐代理、逐功能的细粒度分析,则可解析metadata中的JSON字段,提取各代理状态、token数量、测试通过/失败计数及退出码等信息。该数据集支持与单代理基线进行配对分析,用于评估协作机制带来的性能增益或损失。
背景与挑战
背景概述
qwen9b-coop-claude-code数据集由CooperBench团队于2026年发布,旨在探索多智能体协作编程的效能边界。该数据集依托Qwen/Qwen3.5-9B模型与Claude Code智能体框架,在CooperData任务集上生成了368对双智能体协作编程轨迹,每对智能体通过Redis消息传递与共享Git仓库实现并行协作。数据集提供了约23.4亿token的交互数据,覆盖26个混合语言代码仓库,为评估多智能体系统在代码生成与协同调试中的表现提供了标准化基准。通过同步发布的单智能体基线数据集,研究者可独立分析协作带来的性能增益或损耗,其设计为后续多智能体训练策略优化奠定了重要数据基础。
当前挑战
该数据集主要面临三方面挑战:首先,在领域问题层面,多智能体编程需要解决任务分解、通信同步与代码冲突解决等核心难题,当前9.0%的双特征通过率揭示了协作效率与单智能体模式间的显著差距;其次,构建过程中遭遇了评估管道的技术瓶颈,包括Rust项目的Cargo解析器对多二进制输出的误判、测试套件中既有不稳定测试对结果准确性的干扰,以及部分代码仓库因模板或Node版本兼容性问题导致的运行失败;最后,后处理阶段需对上述错误行进行逐一校正与重新评估,增加了数据集的维护复杂度。
常用场景
经典使用场景
在协作式代码生成的研究范式中,qwen9b-coop-claude-code数据集扮演着不可或缺的基准角色。该数据集源自CooperBench框架在CooperData任务集上的运行,以Qwen/Qwen3.5-9B为底层模型、Claude Code为代理框架,生成了368对双智能体协作编程轨迹。每对轨迹中,两个智能体通过Redis消息队列与共享的Git远程仓库协同工作,分别处理一个特性开发任务。这一精巧的设计使其成为评估多智能体系统在真实代码协作场景中表现的核心数据资源,尤其适用于对比双智能体协作模式与单智能体独立工作的性能差异。
衍生相关工作
围绕该数据集已衍生出一系列富有影响力的研究工作。最为直接的是其配套的单智能体基线数据集qwen9b-solo-claude-code,两者共同构建了对比分析的基础框架。CooperData仓库中的完整评测管线,实现了自动化的测试评估与补丁验证,为后续研究提供了可复现的实验范式。此外,从该数据集中提取的协作失败模式分析,已促使研究者对Cargo多二进制解析器与特定项目运行环境的问题进行修复,进而改进了整体评测基础设施。这些衍生工作共同构筑了多智能体代码生成领域的实证研究基础。
数据集最近研究
最新研究方向
该数据集聚焦于多智能体协作编码的前沿探索,利用Qwen3.5-9B模型与Claude Code智能体框架生成的双智能体协作轨迹,揭示了协同编程中的“合作赤字”现象。通过对比独立与配对执行模式下的任务完成率(双功能通过率仅9.0%,单功能通过率为19.3%),为端到端的多智能体协调机制研究提供了标准化评估基准。其核心价值在于系统量化了语言模型在分布式协作场景中的性能瓶颈,为后续优化联合推理、通信协议及冲突解决策略提供了关键实证基础,对推动工业级代码智能体的实际部署具有重要导向意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务