gpt-5.6-sol-coding-and-debugging-traces
收藏资源简介:
GPT-5.6 Sol 编码与调试轨迹数据集是一个包含来自 GPT-5.6 Sol 模型通过 Codex CLI 作为自主编码代理运行的真实、已验证轨迹的数据集。它捕获了完整的软件开发生命周期,包括检查代码仓库、复现故障、解释证据、编辑文件、运行编译器和测试套件、纠正错误以及验证最终结果。此外,数据集还专门包含安全代码审查会话,展示了安全推理、漏洞分类与修复、漏洞链分析以及对整个代码仓库的静态安全审计。数据集还包括了用于构建、调试和发布此数据收集与验证管道本身的“框架构建”轨迹。数据以 JSON Lines 格式存储,覆盖多种编程语言和任务类型,专为监督微调工具使用型编码代理和安全代码审查代理而设计,适用于训练构建-测试-修复行为、分类与修复模型、研究长期代码仓库工作流和工具选择,以及将 Codex 轨迹转换为其他代理工具协议。数据收集过程强调真实性和验证,采用 CC BY 4.0 许可证发布。
The GPT-5.6 Sol Coding and Debugging Traces Dataset is a dataset containing real, verified trajectories from the GPT-5.6 Sol model running as an autonomous coding agent via Codex CLI. It captures the full software development lifecycle, including inspecting code repositories, reproducing failures, interpreting evidence, editing files, running compilers and test suites, correcting errors, and validating final results. Additionally, the dataset specifically includes security code review sessions, demonstrating security reasoning, vulnerability classification and repair, vulnerability chain analysis, and static security audits of entire code repositories. The dataset also includes framework-building traces for constructing, debugging, and publishing the data collection and verification pipeline itself. The data is stored in JSON Lines format, covering multiple programming languages and task types, and is designed for supervised fine-tuning of tool-using coding agents and security code review agents. It is suitable for training build-test-fix behaviors, classification and repair models, researching long-term code repository workflows and tool selection, and converting Codex traces to other agent tool protocols. The data collection process emphasizes authenticity and verification, and it is released under the CC BY 4.0 license.
数据集概述:GPT-5.6 Sol Coding & Debugging Traces
基本信息
- 数据集名称:GPT-5.6 Sol Coding & Debugging Traces
- 许可证:CC BY 4.0
- 语言:英语
- 任务类别:文本生成、问答
- 数据规模:1K < n < 10K
- 当前快照:6,829 行累积下一步数据,来自 609 条已接受的源轨迹
数据集核心特征
数据来源
- 来自 GPT-5.6 Sol(模型 ID:
gpt-5.6-sol)通过 Codex CLI 作为自主编码代理运行的真实会话 - 每条数据源自真实的
codex exec会话,在真实 Git 工作区中操作 - 保留工具调用、命令输出、代码编辑、评论、修正和最终答案的原始顺序
独特设计
- 真实代理运行:非重构对话,全部内容来自实时开发循环
- 累积上下文:每条数据以单一助手下一步动作为监督目标,保留完整历史前缀
- 独立验证:每条轨迹经过补丁回放、验收测试和执行范围审查
- 隐藏参考答案安全评分:2,391 个安全教学提示使用隐藏参考答案进行评判
- 盲审仓库审计:18 个故意存在漏洞的仓库接受源代码审查,对照 196 个保留发现项
任务分类
| 模式 | 示例 |
|---|---|
| 构建 | 实现库、CLI、解析器、服务、游戏及完整小项目 |
| 调试 | 诊断竞争条件、状态、编码、API、资源和边界问题 |
| 功能扩展 | 在保留现有行为的前提下扩展仓库功能 |
| 重构/性能优化 | 在固定行为和测量契约下重构或优化 |
| 安全知识 | 解释、分类、检测、定位、修复、评估及应用 407 种安全审查技术 |
| 安全链 | 将可利用原语连接成实际高严重性路径并识别断点 |
| 全仓库安全审查 | 审查授权仓库,确认证据,确定优先级并制定修复方案 |
| 工具链构建 | 设计收集器/验证器、调试隔离、配置持久服务、构建数据集/模型卡 |
覆盖语言
- Python、TypeScript / JavaScript、Go、Rust、Java、Ruby、C#、Bash / Zsh、C / C++、PowerShell、x86-64 GNU 汇编
数据结构(Schema)
数据集提供单一文件 traces.jsonl,每行一个累积轨迹前缀:
| 列名 | 类型 | 内容 |
|---|---|---|
task |
字符串 | 稳定种子 ID |
source_trajectory_id |
字符串 | 同一源轨迹分组的指纹 |
lang |
字符串 | 主要实现语言 |
category |
字符串 | 任务家族标签 |
domain |
字符串 | coding、security 或 harness |
security_task |
可为空字符串 | 安全任务家族 |
verifier |
字符串 | 验收方式 |
split |
字符串 | train 或 val 划分 |
teacher_model |
字符串 | 教师模型 ID(gpt-5.6-sol) |
trace_format |
字符串 | 轨迹格式 |
tools_used |
字符串列表 | 会话中调用的工具 |
assistant_step |
整数 | 目标动作的序号 |
messages |
对象列表 | 有序前缀,以目标助手动作结束 |
tools |
JSON 字符串 | 行声明的工具模式 |
预期用途
- 工具使用编码代理的监督微调
- 防御性安全代码审查代理的监督微调
- 构建-测试-修复行为的训练与评估
- 分类、修复、链分析和证据支持的静态审查训练
- 构建、验证、发布和操作轨迹提取工具的代理训练
- 长期仓库工作和工具选择的研究
- 验证驱动完成和自我修正的分析
- Codex 轨迹到其他代理工具协议的转换
局限性
- 数据集按成功过滤设计,终端失败案例少于真实代理流量
- 参考答案评分使用模型评判加确定性结构标签检查,模型评判可能引入偏见
- 仓库审计语料库故意包含漏洞,其轨迹仅用于授权防御性审查
- 任务为特定工程环境,非公共仓库的随机样本
- 隐藏模型推理被加密,仅包含可见评论、假设、工具选择、修正和明文推理摘要
- 当前语料反映单一教师模型、单一高推理设置及 Codex CLI 行为
- 累积前缀可能较长,消费者需明确选择上下文限制
- 训练必须仅对最终助手动作应用损失
可复现性
- 收集管道保留完整的种子、原始轨迹、验证和最终差异来源
- 每个任务作为
tasks/seeds/<id>/{task.json,files/,reference_fix.patch}开始 - 参考补丁证明问题可解决,但从未放入教师工作区
- 记录最终差异、重放验证两次、检查受保护文件哈希和记录范围、要求独立验收审查、清理已接受的轨迹
教师配置
- 模型:
gpt-5.6-sol - 推理努力:
xhigh - 接口:非交互式 Codex CLI JSONL
- 安全工作区策略:Bubblewrap 文件系统隔离加 Codex 工作区沙盒





