JetBrains-Research/agent-trajectories-swesmith-random-subset
收藏资源简介:
--- license: mit task_categories: - text-generation language: - en tags: - swe-bench - swe-smith - code - agent-trajectories pretty_name: Agent Trajectories on SWE-Smith (Random Subset, Single Model) size_categories: - 1K<n<10K --- # Agent Trajectories: SWE-Smith Random Subset — Single Model ## Summary Full multi-turn agent trajectories collected from a **random subset of SWE-Smith issues**, generated with a single model per trajectory (no branching or lookahead). Contains a `resolved` column from SWE-bench evaluation. Intended for SFT of agent models on diverse, synthetically generated coding tasks. ## Data Collection Each trajectory was produced by a mini-swe-agent run with an **LLM router** selecting between `gpt-5.2` and `gpt-5-mini` at each step. The selected model executed the step directly (no GT-aware lookahead — one branch only). ## Format Each row contains a single complete trajectory in **OpenAI messages format**: ```json { "messages": [ {"role": "system", "content": "You are a helpful assistant..."}, {"role": "user", "content": "<pr_description>...</pr_description>"}, {"role": "assistant", "content": "THOUGHT: ...\nACTION: ..."}, {"role": "user", "content": "<returncode>0</returncode>..."}, "...", {"role": "assistant", "content": "...submit..."} ], "instance_id": "weaveworks__grafanalib.5c3b17ed.func_basic__y65m92y7", "n_turns": 9, "n_messages": 19, "selected_models": ["litellm_proxy/openai/gpt-5-mini", "litellm_proxy/openai/gpt-5.2", "..."], "resolved": true, "exit_status": "Submitted" } ``` ## Statistics | Split | Instances | |--------|-----------| | train | 1465 | (No train/validation split — evaluation-only use case.) ## Source - **Issue source**: SWE-Smith (synthetic GitHub issues) - **Candidate models**: `gpt-5.2`, `gpt-5-mini` (router-selected per step) - **Router**: `LLMRouter` (no GT-aware oracle) - **Langfuse session**: `swesmith-datacollection-run_id-71ca4b115b711e29da274c9c1654448c-llm-2026-03-25_18-10-04`
license: MIT协议 task_categories: - 文本生成 language: - 英语 tags: - SWE-bench - SWE-Smith - 代码 - 智能体轨迹(agent-trajectories) pretty_name: SWE-Smith随机子集上的智能体轨迹(单模型版本) size_categories: - 1000 < 样本量 < 10000 # 智能体轨迹:SWE-Smith随机子集——单模型版本 ## 数据概述 本数据集包含从**SWE-Smith问题随机子集**中采集的完整多轮智能体轨迹,每条轨迹仅使用单个模型生成(无分支或前瞻推理)。数据集包含来自SWE-bench评估的`resolved`(任务完成状态)字段,适用于针对多样化合成编码任务的智能体模型监督微调(Supervised Fine-Tuning,SFT)。 ## 数据采集 每条轨迹均由mini-swe-agent运行生成,每一步均通过**大语言模型路由器(LLM router)**在`gpt-5.2`与`gpt-5-mini`之间进行选择。被选中的模型将直接执行该步骤(无基于真实标签(Ground Truth,GT)的前瞻推理,仅支持单分支)。 ## 数据格式 每条数据行包含一条采用**OpenAI消息格式(OpenAI messages format)**的完整独立轨迹,示例如下: json { "messages": [ {"role": "system", "content": "You are a helpful assistant..."}, {"role": "user", "content": "<pr_description>...</pr_description>"}, {"role": "assistant", "content": "THOUGHT: ... ACTION: ..."}, {"role": "user", "content": "<returncode>0</returncode>..."}, "...", {"role": "assistant", "content": "...submit..."} ], "instance_id": "weaveworks__grafanalib.5c3b17ed.func_basic__y65m92y7", "n_turns": 9, "n_messages": 19, "selected_models": ["litellm_proxy/openai/gpt-5-mini", "litellm_proxy/openai/gpt-5.2", "..."], "resolved": true, "exit_status": "Submitted" } ## 统计信息 | 数据集划分 | 样本数量 | |------------|----------| | 训练集 | 1465 | (注:本数据集无训练/验证集划分,仅适用于评估场景) ## 数据来源 - **问题来源**:SWE-Smith(合成GitHub问题) - **候选模型**:`gpt-5.2`、`gpt-5-mini`(每一步由路由器选择) - **路由器**:`LLMRouter`(无基于真实标签的神谕式推理) - **Langfuse会话标识**:`swesmith-datacollection-run_id-71ca4b115b711e29da274c9c1654448c-llm-2026-03-25_18-10-04`




