遇见数据集

gpt-5.6-sol-coding-and-debugging-traces

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

GPT-5.6 Sol 编码与调试轨迹数据集是一个包含来自 GPT-5.6 Sol 模型通过 Codex CLI 作为自主编码代理运行的真实、已验证轨迹的数据集。它捕获了完整的软件开发生命周期,包括检查代码仓库、复现故障、解释证据、编辑文件、运行编译器和测试套件、纠正错误以及验证最终结果。此外,数据集还专门包含安全代码审查会话,展示了安全推理、漏洞分类与修复、漏洞链分析以及对整个代码仓库的静态安全审计。数据集还包括了用于构建、调试和发布此数据收集与验证管道本身的“框架构建”轨迹。数据以 JSON Lines 格式存储,覆盖多种编程语言和任务类型,专为监督微调工具使用型编码代理和安全代码审查代理而设计,适用于训练构建-测试-修复行为、分类与修复模型、研究长期代码仓库工作流和工具选择,以及将 Codex 轨迹转换为其他代理工具协议。数据收集过程强调真实性和验证,采用 CC BY 4.0 许可证发布。

The GPT-5.6 Sol Coding and Debugging Traces Dataset is a dataset containing real, verified trajectories from the GPT-5.6 Sol model running as an autonomous coding agent via Codex CLI. It captures the full software development lifecycle, including inspecting code repositories, reproducing failures, interpreting evidence, editing files, running compilers and test suites, correcting errors, and validating final results. Additionally, the dataset specifically includes security code review sessions, demonstrating security reasoning, vulnerability classification and repair, vulnerability chain analysis, and static security audits of entire code repositories. The dataset also includes framework-building traces for constructing, debugging, and publishing the data collection and verification pipeline itself. The data is stored in JSON Lines format, covering multiple programming languages and task types, and is designed for supervised fine-tuning of tool-using coding agents and security code review agents. It is suitable for training build-test-fix behaviors, classification and repair models, researching long-term code repository workflows and tool selection, and converting Codex traces to other agent tool protocols. The data collection process emphasizes authenticity and verification, and it is released under the CC BY 4.0 license.

创建时间:
2026-07-15
原始信息汇总

数据集概述:GPT-5.6 Sol Coding & Debugging Traces

基本信息

  • 数据集名称:GPT-5.6 Sol Coding & Debugging Traces
  • 许可证:CC BY 4.0
  • 语言:英语
  • 任务类别:文本生成、问答
  • 数据规模:1K < n < 10K
  • 当前快照:6,829 行累积下一步数据,来自 609 条已接受的源轨迹

数据集核心特征

数据来源

  • 来自 GPT-5.6 Sol(模型 ID:gpt-5.6-sol)通过 Codex CLI 作为自主编码代理运行的真实会话
  • 每条数据源自真实的 codex exec 会话,在真实 Git 工作区中操作
  • 保留工具调用、命令输出、代码编辑、评论、修正和最终答案的原始顺序

独特设计

  1. 真实代理运行:非重构对话,全部内容来自实时开发循环
  2. 累积上下文:每条数据以单一助手下一步动作为监督目标,保留完整历史前缀
  3. 独立验证:每条轨迹经过补丁回放、验收测试和执行范围审查
  4. 隐藏参考答案安全评分:2,391 个安全教学提示使用隐藏参考答案进行评判
  5. 盲审仓库审计:18 个故意存在漏洞的仓库接受源代码审查,对照 196 个保留发现项

任务分类

模式 示例
构建 实现库、CLI、解析器、服务、游戏及完整小项目
调试 诊断竞争条件、状态、编码、API、资源和边界问题
功能扩展 在保留现有行为的前提下扩展仓库功能
重构/性能优化 在固定行为和测量契约下重构或优化
安全知识 解释、分类、检测、定位、修复、评估及应用 407 种安全审查技术
安全链 将可利用原语连接成实际高严重性路径并识别断点
全仓库安全审查 审查授权仓库,确认证据,确定优先级并制定修复方案
工具链构建 设计收集器/验证器、调试隔离、配置持久服务、构建数据集/模型卡

覆盖语言

  • Python、TypeScript / JavaScript、Go、Rust、Java、Ruby、C#、Bash / Zsh、C / C++、PowerShell、x86-64 GNU 汇编

数据结构(Schema)

数据集提供单一文件 traces.jsonl,每行一个累积轨迹前缀:

列名 类型 内容
task 字符串 稳定种子 ID
source_trajectory_id 字符串 同一源轨迹分组的指纹
lang 字符串 主要实现语言
category 字符串 任务家族标签
domain 字符串 codingsecurityharness
security_task 可为空字符串 安全任务家族
verifier 字符串 验收方式
split 字符串 trainval 划分
teacher_model 字符串 教师模型 ID(gpt-5.6-sol
trace_format 字符串 轨迹格式
tools_used 字符串列表 会话中调用的工具
assistant_step 整数 目标动作的序号
messages 对象列表 有序前缀,以目标助手动作结束
tools JSON 字符串 行声明的工具模式

预期用途

  • 工具使用编码代理的监督微调
  • 防御性安全代码审查代理的监督微调
  • 构建-测试-修复行为的训练与评估
  • 分类、修复、链分析和证据支持的静态审查训练
  • 构建、验证、发布和操作轨迹提取工具的代理训练
  • 长期仓库工作和工具选择的研究
  • 验证驱动完成和自我修正的分析
  • Codex 轨迹到其他代理工具协议的转换

局限性

  • 数据集按成功过滤设计,终端失败案例少于真实代理流量
  • 参考答案评分使用模型评判加确定性结构标签检查,模型评判可能引入偏见
  • 仓库审计语料库故意包含漏洞,其轨迹仅用于授权防御性审查
  • 任务为特定工程环境,非公共仓库的随机样本
  • 隐藏模型推理被加密,仅包含可见评论、假设、工具选择、修正和明文推理摘要
  • 当前语料反映单一教师模型、单一高推理设置及 Codex CLI 行为
  • 累积前缀可能较长,消费者需明确选择上下文限制
  • 训练必须仅对最终助手动作应用损失

可复现性

  • 收集管道保留完整的种子、原始轨迹、验证和最终差异来源
  • 每个任务作为 tasks/seeds/<id>/{task.json,files/,reference_fix.patch} 开始
  • 参考补丁证明问题可解决,但从未放入教师工作区
  • 记录最终差异、重放验证两次、检查受保护文件哈希和记录范围、要求独立验收审查、清理已接受的轨迹

教师配置

  • 模型:gpt-5.6-sol
  • 推理努力:xhigh
  • 接口:非交互式 Codex CLI JSONL
  • 安全工作区策略:Bubblewrap 文件系统隔离加 Codex 工作区沙盒
搜集汇总
数据集介绍
gpt-5.6-sol-coding-and-debugging-traces 数据集图片
构建方式
本数据集源自GPT-5.6 Sol模型在Codex CLI环境中作为自主编程代理的真实运行轨迹。每条数据均来自实时的`codex exec`会话,操作于真实Git工作区,完整保留了工具调用、命令输出、文件编辑、可见注释、修正及最终答案的原始顺序。采集管道在代理退出后,于新工作区应用捕获的补丁,执行两次验收命令,并扫描记录动作以检查范围违规。独立只读会话进一步审查范围蔓延、遗漏需求、回归、错误及不可用代码。安全性任务采用隐藏参考答案的后评估机制,由模型裁判结合结构化CWE/OWASP存在性门控进行评分,而参考答案从未进入教师工作区。盲审仓库审计则通过主机端裁决器将`findings.json`与196个保留发现进行比对,强制执行最低召回率并拒绝过度发现。最终,通过确定性任务不相交划分,将源轨迹扩展为每个助手动作对应一个精确累积前缀的JSONL格式文件。
特点
该数据集的核心特色在于其真实性与可验证性。它并非事后重构的对话,而是保留了完整上下文与单一后续动作的原始代理运行记录,每个发布行仅监督下一个助手消息,且无前缀摘要或令牌限制。数据集包含丰富的任务类型,横跨软件构建与防御性安全两大领域,涵盖从库实现、调试、功能扩展、重构到安全知识分类、漏洞链分析及全仓库审计等多种模式。安全性训练采用隐藏引用分级机制与盲审仓库审计,确保评估客观性。数据集还注重隐私与安全,通过路径相对化、密钥过滤及陌生人沙箱隔离等措施保护敏感信息。此外,其多语言支持覆盖了Python、TypeScript、Go、Rust等主流语言,并保留了Codex工具调用源,包括外层JavaScript编排源码,为研究工具使用代理提供了无损资源。
使用方法
数据集以单一`traces.jsonl`文件形式提供,每行包含一个累积轨迹前缀,结束于由`assistant_step`标识的单个助手动作。用户可通过`split`列选择任务不相交的训练/验证划分。数据模式包含任务ID、源轨迹指纹、语言、类别、领域、验证器、分割、教师模型等关键字段,其中`messages`为原生JSON格式,`tools`为JSON编码字符串,需通过`json.loads`加载。典型应用场景包括对工具使用编程代理进行有监督微调、训练防御性安全代码审查代理、研究构建-测试-修复行为以及长视野仓库工作与工具选择。使用时需注意仅对最终助手动作施加损失,避免监督早期辅助跨度。消费方必须根据自身上下文限制显式选择合适长度,因为累积前缀可能较长。数据集采用CC BY 4.0许可,使用、修改、再分发及基于其训练模型时需署名。
背景与挑战
背景概述
在大型语言模型(LLM)驱动的软件工程领域,自主编码代理的真实行为数据极为稀缺。由研究者Greg Havens主导、基于OpenAI的GPT-5.6 Sol模型于2024年创建的该数据集,收录了通过Codex CLI执行的625条经过验证的软件工程与防御性安全轨迹,涵盖代码构建、调试、安全审计及训练流水线搭建等核心任务。其独特价值在于提供了完整的、未经重建的代理运行上下文,弥补了现有合成语料库在代理行为真实性方面的空白,为训练具备工具使用、自我纠错与长程推理能力的编码代理奠定了高保真数据基础,对推动安全编码自动化与自主软件工程研究具有里程碑意义。
当前挑战
该数据集主要面临三大挑战。其一,解决自主编码代理在真实开发环境中的行为建模难题,现有对话式数据集缺失工具调用、编译输出和错误修正等关键环节,难以有效支撑代理的监督微调。其二,构建过程中需在严格隔离的沙箱中执行安全审计任务,同时防范敏感信息泄露、确保196个隐蔽漏洞的盲审准确性,并应对19种编程语言和多样工具链的兼容性。其三,数据质量保障要求极高,包括设计独立验证器与评审机制以避免范围蔓延,以及实现隐藏参考的安全评分体系,防止教师模型通过上下文泄露答案,从而保证训练数据的纯净性和可靠性。
常用场景
经典使用场景
GPT-5.6 Sol Coding & Debugging Traces数据集的核心价值在于为构建工具调用型编码智能体提供了高质量的监督式微调轨迹。这些轨迹记录了智能体在真实Git工作空间中执行编码、调试、安全审查与测试验证任务的完整过程,涵盖从代码阅读、错误复现、文件编辑到编译运行、修正错误及结果验证的完整开发闭环。研究人员可基于这些累积式的下一步动作示例,训练模型在长跨度仓库作业中的工具选择、自我修正及验证驱动式完成行为。此外,该数据集特别适合用于防御性安全代码审查智能体的训练,其中包含漏洞分类、修复、链式分析及全仓库盲审等安全特定轨迹,使得模型能够学习到基于证据的安全推理与漏洞定位能力。
衍生相关工作
该数据集的发布衍生出多项具有深远影响的研究工作。在编码智能体领域,研究者基于其累积轨迹提出了新一代验证驱动式学习框架,将多步交互与外部编译器反馈深度融合,显著提升了模型在未见任务上的泛化性能。在安全代码分析方向,该数据集催生了隐蔽参考评估范式,促使后续工作探索将符号执行与大型语言模型结合的新型漏洞检测方法。其开放的工具调用表示协议,亦激发了对跨平台智能体动作标准化与迁移学习的研究,推动了不同智能体框架间的互操作性进步。此外,数据集构建流程中采用的精确溯源与轨迹分片策略,为后续大规模智能体数据生产工作提供了可复用的方法论样板,引领了面向复杂真实环境的因果推断训练数据设计方向。
数据集最近研究
最新研究方向
该数据集聚焦于构建自主编码智能体的监督微调与防御性安全审查能力,其核心特色在于收录了GPT-5.6 Sol模型在Codex CLI环境下实时执行的真实开发轨迹,而非事后重构的对话。前沿研究方向涵盖:利用累积式上下文前缀与单步监督机制训练模型完成长时程仓库级任务,涵盖构建、调试、重构、安全分类与脆弱性链式分析,并通过隐蔽参考评分与盲审机制确保安全任务的客观性。数据集中包含的7,003条经过独立验证的轨迹,结合多语言工具链与容器化隔离运行环境,为研究验证驱动的自我纠错、工具选择以及安全编码智能体的可迁移性提供了坚实基准。其独特之处在于完整保留了工具调用、命令输出与错误修复的原生顺序,为理解自主代理在真实开发环境中的推理与决策过程开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务