SynthTraces
收藏数据链接:
官方服务:
资源简介:
一个用于生成合成编码代理会话跟踪的最小代码库,每个会话配对两个模型在一个项目代码库中工作:远程托管的开放模型作为编码代理,本地模型作为用户,完整交换被记录为跟踪。数据集是每个代理模型×用户模型×代码库×起始问题的笛卡尔积,总计24,000个会话。
A minimal codebase for generating synthetic coding agent session traces. Each session pairs two models collaborating within a project codebase: a remotely hosted open model serves as the coding agent, while a local model acts as the user, with the complete interaction logged as a trace. The dataset is the Cartesian product of every agent model, user model, codebase, and starting prompt, totaling 24,000 sessions.
创建时间:
2026-06-03
原始信息汇总
数据集概述
SynthTraces 是一个用于生成合成编码智能体会话轨迹(agent traces)的数据集。它通过为编码智能体配备默认工具(如read、write、edit、bash),并模拟用户与智能体之间的对话,记录完整的交互过程。
核心特点
- 生成机制:会话由“远程托管开放模型”作为编码智能体,与“本地运行在 llama.cpp 的模型”作为用户,在项目代码库内协作完成。用户模型以预置问题开头驱动对话。
- 生成规模:会话总数为 24,000 条,由以下维度组合构成:
- 编码智能体模型(远程托管,开放):20 个
- 用户模型(本地,llama.cpp):3 个
- 项目代码库:20 个
- 起始问题:20 个
生成矩阵详情
| 维度 | 数量 | 示例 |
|---|---|---|
| 智能体模型(远程) | 20 | deepseek-ai/DeepSeek-V4-Pro, openai/gpt-oss-120b, Qwen/Qwen3.6-27B, zai-org/GLM-5.1 等 |
| 用户模型(本地) | 3 | ggml-org/Qwen3.6-27B-GGUF:Q8_0, ggml-org/Qwen3.6-35B-A3B-MTP-GGUF:Q8_0, ggml-org/gemma-4-26B-A4B-it-GGUF:Q8_0 |
| 项目代码库 | 20 | transformers, diffusers, lerobot, peft, candle 等 |
| 起始问题 | 20 | “如何运行这段代码?”、“此仓库的 CI 如何配置?”、“最近做了哪些更改以及为什么?”等 |
会话工作流程
- 用户模型(本地)以一个起始问题开始。
- 编码智能体模型(远程)使用工具(读取、编辑、运行)在项目代码库中工作。
- 双方进行多轮交互(最多 N 轮)。
- 完整交换过程被记录为一条轨迹,形成数据集。
数据集基本信息
- 语言:英语
- 许可证:MIT
- 生成者:julien-c
- 代码仓库:https://github.com/julien-c/synthtraces
- 数据仓库:https://huggingface.co/datasets/julien-c/synthtraces
最终统计
生成完成后的统计信息(如成功率、总轮数、token 数量、每个模型/代码库的轨迹数等)将在后续更新。
搜集汇总
数据集介绍

构建方式
SynthTraces数据集通过精心设计的生成矩阵构建,以模拟编码智能体会话轨迹为核心目标。其构建方式采用笛卡尔积策略,涵盖20个远程托管的开源模型作为编码智能体后端,配备默认的读写编辑及bash工具集;同时引入3个本地运行的llama.cpp模型扮演用户角色,从20个预设起始问题中发起对话。每个会话限定于20个开源项目代码库之一,最终形成20×3×20×20共计24,000条独立会话轨迹。整个生成过程通过Pi代码库自动化编排,完整记录智能体与用户之间的多轮交互、工具调用及代码变更,形成结构化的轨迹数据。
使用方法
使用者可通过Hugging Face数据集仓库直接访问SynthTraces,每条轨迹以标准格式存储会话历史、元数据及交互统计信息。推荐的方式是借助Pi工具库中的解析模块加载数据,从而还原智能体与用户间的完整对话流程。研究者可依据模型组合、代码库类型或问题类别进行过滤与抽样,适用于多维度分析任务。数据集适用于训练对话式编码助手、评估智能体行为模式,或作为合成数据增强真实轨迹数据的补充资源。许可证为MIT,允许自由使用与二次分发。
背景与挑战
背景概述
SynthTraces数据集由julien-c于近年来创建,旨在为编码智能体交互研究提供大规模、可复现的合成轨迹数据。其核心研究问题聚焦于模拟和记录远程开放模型与本地模型在多轮编程协作任务中的交互过程,通过构建20种远程模型(如DeepSeek-V4-Pro、Qwen3.6-27B)与3种本地模型在20个开源代码库(如transformers、diffusers)上的组合,并辅以20个初始提问,最终生成24,000条完整的会话轨迹。这一数据集填补了编码智能体行为研究领域缺乏标准化、可控生成流程的空白,为评估和优化多模型协作机制、智能体工具使用能力以及代码库理解能力提供了宝贵的基准资源。
当前挑战
SynthTraces所面临的挑战首先体现在领域问题的复杂性上:如何系统性地模拟真实世界中编码智能体与用户之间的多轮交互,而不仅仅是简单的问答或单步指令执行,这要求数据集能够捕捉到智能体在调用读写、编辑和bash等工具时的策略性决策与错误恢复过程。此外,构建过程中亦遭遇诸多技术瓶颈,例如确保远程模型的响应质量与本地模型生成的用户行为具有自然且一致的对话流,需平衡不同模型的推理速度与轨迹长度;同时,在20个代码库上同步生成约24,000条会话,需要精密设计任务分发与资源调度机制,以避免因模型调用超时、代码库环境差异或工具调用失败而导致的轨迹断裂或不完整。
常用场景
经典使用场景
在智能体与代码工程交叉的研究疆域中,SynthTraces数据集以其独特的合成范式,为编码智能体行为分析提供了大规模、可复现的基准资源。该数据集最经典的用途在于模拟远程开源模型驱动的编码智能体与本地用户模型之间的完整交互轨迹,通过20种智能体模型、3种用户模型、20个真实代码仓库与20类起始问题构成的笛卡尔积,产生了24,000条结构化的会话轨迹。研究者可借此系统性地剖析编码智能体在读取、编辑、执行命令时的决策逻辑,探究不同模型组合下的协作效率与任务完成质量。
解决学术问题
SynthTraces精准填补了编码智能体领域缺乏大规模、多维度、可控实验数据的学术空白。传统研究多依赖于人工标注或小规模采样,难以全面评估模型在真实代码库环境下的泛化能力与鲁棒性。该数据集通过标准化生成流程,解决了跨模型、跨代码库、跨任务场景的系统性对比难题,使研究者能够量化分析智能体工具调用策略、多轮对话的语义保持能力以及不同类型起始问题对任务成功率的影响。其开源属性与MIT许可协议,进一步降低了复现门槛,推动了编码智能体评估基准的标准化进程。
实际应用
在实际应用层面,SynthTraces直接服务于智能体驱动的自动化软件开发与运维场景。借助该数据集,工程师可模拟并优化编码智能体在GitHub开源项目中的协作表现,例如在transformers、diffusers等复杂代码库中自动完成代码解读、修改与调试任务。训练数据还可用于构建更智能的代码审查助手、自动CI/CD故障诊断系统,以及面向开发者的交互式编程导师。其合成数据特性避免了真实用户数据的隐私风险,同时允许对罕见或高成本场景(如大规模重构、跨模块依赖分析)进行安全、低成本的反复测试与迭代。
数据集最近研究
最新研究方向
在当前大语言模型(LLM)驱动的自主编码智能体领域,SynthTraces数据集通过系统性地生成合成编码智能体交互轨迹,为智能体行为分析与能力评估开辟了新的研究方向。该数据集采用远程开源模型与本地模型配对的设计,覆盖20种智能体模型、3种用户模型、20个真实项目代码库及20个起始问题,构建了横跨24,000个会话的庞大规模矩阵。这一设计不仅能够模拟真实编码场景中智能体与用户的协作模式,还为研究不同模型组合在多轮交互中的行为差异、工具使用模式及问题解决效率提供了标准化的测试基准。随着全球开发者社区对自主编码智能体的关注度持续攀升,SynthTraces为模型对比、鲁棒性测试以及下游任务微调提供了高保真度的训练资源,有望推动更高效、更可靠的编码智能体系统的研发,并促进开源生态中智能体协作范式的标准化与透明化。
以上内容由遇见数据集搜集并总结生成



