CooperBench/qwen9b-solo-claude-code
收藏官方服务:
资源简介:
该数据集包含通过运行CooperBench在solo模式下,基于CooperData任务集生成单智能体编码轨迹。使用Qwen/Qwen3.5-9B作为模型和Claude Code作为智能体框架,每个任务中一个智能体实现两个功能。
Single-agent coding trajectories generated by running CooperBench in solo mode on the CooperData task set, using Qwen/Qwen3.5-9B as the model and Claude Code as the agent framework. One agent implements both features in each task.
提供机构:
CooperBench搜集汇总
数据集介绍

构建方式
该数据集以Qwen/Qwen3.5-9B为基座模型,依托Claude Code智能体框架,在CooperBench评测平台的solo模式下生成。数据构建过程中,单个智能体独立完成每条任务中的两项功能,并基于CooperData任务集(包含26个混合语言代码仓库)进行自动化执行。运行环境配置于Modal H100平台,搭载vLLM 0.19.0推理引擎,支持128K上下文长度及fp8 KV缓存优化。整个生成流程通过部署模型端点后,调用cooperbench命令行工具、指定参数为solo模式与6并发数完成。最终产出包含368条编码轨迹,累计约11.4亿输入输出token,原始运行树按仓库、任务及特征分级存储。
使用方法
该数据集主要适用于智能体编码能力评估与中期训练(mid-training)场景。用户可直接通过HuggingFace数据集加载接口读取index.csv文件,获取每项任务的pair_tokens字段用于token规模估算;借助agent_framework、model与setting字段完成分层采样;利用both_passed筛选器提取模型在独立执行模式下所能达成的行为模式。深入分析时,需解析metadata字段中的JSON对象,获取逐特征测试通过/失败计数及退出码,并结合log_dir路径访问原始运行树中的完整轨迹与代码补丁。注意评估流程中存在的预置测试用例不稳定及单智能体数据结构较稀疏等限制,建议在细粒度分析时自行解析eval相关字段。
背景与挑战
背景概述
该数据集由CooperBench团队于2026年创建,聚焦于单智能体编码轨迹的生成与评估。研究核心在于利用Qwen3.5-9B模型与Claude Code智能体框架,在CooperData任务集上以独立模式运行,探索单智能体在同时实现两个编程特征时的表现能力。作为对比实验的关键组件,该数据集与同模型、同框架的双智能体协作版数据集共同构建,通过控制变量法隔离出协作效率的差异,为人工智能在复杂代码生成任务中的智能体交互机制研究提供了基准资源。其对相关领域的影响力体现在揭示了单智能体任务完成率(16.3%)显著优于双智能体(9.0%)的现象,量化了约45%的相对协作赤字,为后续优化多智能体协调策略奠定了数据基础。
当前挑战
当前数据集面临的首要挑战在于所解决的领域问题——编码任务中智能体独立与协作模式的效果差异。单智能体虽然避免了通信开销,却受限于单个决策路径的局限性,难以匹敌人类开发者间的资源互补。构建过程中遭遇的技术挑战包括:评估流水线因嵌入预先存在的测试缺陷而错误标记失败案例,需要手动解析元数据来区分真正的执行失败与测试环境干扰;此外,多个运行脚本因模板或Node版本兼容性问题导致任务重跑,增加了数据一致性的维护成本。这些挑战共同凸显了自动化代码生成测试基建的脆弱性,对数据集的可靠性与可比性构成了潜在障碍。
常用场景
经典使用场景
在代码智能与自动化编程领域,qwen9b-solo-claude-code数据集为单智能体编程轨迹研究提供了精细化基准。该数据集记录了Qwen3.5-9B模型通过Claude Code代理框架在CooperData任务集上生成的368个编程任务轨迹,涵盖26个不同编程语言的开源仓库。研究者可借助该数据集剖析单个编程代理在独立完成双特性任务时的行为模式、决策路径与性能边界,为理解大语言模型在代码生成中的自主学习能力与适应性提供系统化数据支撑。
解决学术问题
该数据集核心解决了单智能体与协作智能体在编程任务中的性能对比难题,尤其是量化了所谓的“合作赤字”(cooperation deficit)。通过solo模式与coop模式的对比,研究者能够精准揭示单一模型在独立完成任务与多代理协作完成任务之间的能力差异,分离出任务本身的挑战性与协调成本带来的额外负担。这为理解多智能体系统中的通信效率、任务分配策略及代理间信任机制提供了重要的实验证据。
实际应用
在实际应用层面,该数据集可助力软件工程自动化工具的研发与评估。开发者可利用其中包含的完整轨迹数据(如代理日志、测试结果、代码差异补丁)训练或微调代码生成模型,提升其在独立代码修复、功能实现及单元测试生成等场景中的表现。同时,数据集提供的token消耗与任务通过率等指标,为优化AI编程助手的计算成本与推理延迟提供了可量化的参考基准,推动低资源环境下高效编程代理的落地。
数据集最近研究
最新研究方向
该数据集聚焦于单智能体编程轨迹与协作机制的前沿对比研究,通过Qwen3.5-9B模型在CooperBench基准上运行Claude Code框架,生成了涵盖26个仓库、368个编程任务的单智能体执行数据。其核心价值在于与配对的双智能体版本形成对照,精准量化了协作缺陷——单智能体模式双特征通过率达16.3%,高出双智能体版本7.3个百分点(相对提升约45%),这一发现揭示了当前模型在协作编码场景中面临的深层瓶颈。数据集特别设计了用于中间训练(mid-training)的token统计和分层采样字段,为探索模型在独立执行与协同工作间的能力鸿沟提供了结构化视角。该工作不仅为智能体协作的度量基准建立了新范式,更对多智能体编程系统的优化方向具有重要启示意义。
以上内容由遇见数据集搜集并总结生成



