optiq-code-traces
收藏资源简介:
OptiQ Code Traces是一个包含1,706个经过黄金测试验证的智能体软件工程轨迹的数据集。这些轨迹由OptiQ Code终端编码智能体生成,针对真实代码仓库中的错误进行完整的工具调用运行。每个轨迹的resolved标签均通过在实际应用模型补丁后执行黄金测试(包括FAIL_TO_PASS和PASS_TO_PASS)来设置,而非依赖智能体的自我报告。数据集采用HuggingFace Session-Traces格式(agent-traces查看器),每个.jsonl文件代表一个会话:第一行为携带黄金标签的头部元数据,后续每行代表一个回合的消息,包含工具调用和结果。数据来源于三个基准:SWE-Gym(1,203个会话)、SWE-bench Verified(426个会话)和SWE-bench Lite(77个会话)。会话通常较长且密集,中位数为87条消息、22.5K个标记和41次工具调用,工具使用以bash命令为主(65%),其次是read_file(18%)。数据集的主要目的是用于微调本地模型,以便在OptiQ Code中使用,特别适用于训练小型本地量化模型。数据集中包含389个已通过黄金测试验证的已解决会话,以及104个智能体误报(自我报告为已解决但黄金测试未通过)和193个智能体漏报(自我报告为失败但黄金测试已通过)的案例,这些案例对于训练验证器或过程奖励模型具有较高价值。
OptiQ Code Traces is a dataset containing 1,706 gold-tested agent software engineering traces. These traces are generated by the OptiQ Code terminal coding agent, performing complete tool-call runs on bugs in real code repositories. The resolved label for each trace is set by executing gold tests (including FAIL_TO_PASS and PASS_TO_PASS) after applying model patches, rather than relying on the agents self-report. The dataset uses the HuggingFace Session-Traces format (agent-traces viewer), where each .jsonl file represents a session: the first line contains header metadata with gold labels, and each subsequent line represents a turn message, including tool calls and results. The data is sourced from three benchmarks: SWE-Gym (1,203 sessions), SWE-bench Verified (426 sessions), and SWE-bench Lite (77 sessions). Sessions are typically long and dense, with a median of 87 messages, 22.5K tokens, and 41 tool calls, with tool usage dominated by bash commands (65%), followed by read_file (18%). The primary purpose of the dataset is for fine-tuning local models for use in OptiQ Code, particularly for training small local quantized models. It includes 389 resolved sessions validated by gold tests, along with 104 agent false positives (self-reported as resolved but failing gold tests) and 193 agent false negatives (self-reported as failed but passing gold tests), which are valuable for training verifiers or process reward models.
数据集概述:OptiQ Code Traces
该数据集包含 1,706 条由 OptiQ Code 终端编码智能体生成的、针对真实仓库缺陷的完整工具调用轨迹,所有 resolved 标签均通过执行金标准测试验证。
数据格式与结构
- 格式:HuggingFace Session-Traces 格式(
agent-traces查看器),与optiq code export输出格式一致。 - 文件结构:每个
.jsonl文件代表一个完整会话。- 第 1 行(header):携带元数据及金标签,例如
resolved、gold_verified、self_repro_resolved、source等。 - 后续行:每条消息一个 JSON 对象,包含角色(
assistant/tool)、内容及工具调用信息。
- 第 1 行(header):携带元数据及金标签,例如
数据规模与统计
| 指标 | 数量 |
|---|---|
| 总会话数 | 1,706 |
| 金标签已验证 | 894 |
| 已解决(通过金测试) | 389 |
| 未解决 | 1,317 |
| 智能体误报(自报解决,金标签否) | 104 |
| 智能体漏报(自报失败,金标签解决) | 193 |
- 基准来源:swe-gym (1,203)、swe-bench-verified (426)、swe-bench-lite (77)。
- 会话特征:中位数 87 条消息、22.5k token、41 次工具调用。工具使用以 bash 为主(65%),其次是 read_file(18%),edit_file、run_tests、done 各占约 4-5%。
头标签字段说明
| 字段 | 含义 |
|---|---|
resolved |
金标签裁决,true 表示补丁通过金测试 |
gold_verified |
金测试是否实际运行(true)或无法运行(false) |
self_repro_resolved |
智能体自身裁决;与 resolved 的差异即假阳/假阴 |
source |
数据来源:swe-gym、swe-bench-lite、swe-bench-verified |
gen_run |
轨迹生成方式:progen、scale_flash、seed_pro |
repo、model、turns_used、sample |
来源仓库、生成模型、使用轮次、抽样标识 |
数据收集方式
轨迹由 OptiQ Code 驱动 OpenAI 兼容端点(指向 deepseek/deepseek-v4-pro 模型)生成,每个轨迹对应一个真实仓库缺陷的完整工具调用过程。
主要用途
- 微调本地模型:用于在 OptiQ Code 中使用的本地小量量化模型,金标签已解决的轨迹作为训练信号。
- 验证器/过程奖励模型训练:智能体自报与金标签不一致的 104 个假阳性 + 193 个假阴性案例,是训练判断修复是否真正完成的最佳数据。
- 训练注意事项:
swe-gym可安全用于训练。swe-bench-lite和swe-bench-verified是公开测试基准,在其上训练会污染评分。
数据来源
任务衍生自 SWE-bench(Lite / Verified)和 SWE-Gym。轨迹由 OptiQ Code 工作框架生成,金标签评分通过在每个任务的评估容器中应用补丁及金 test_patch,并运行官方 FAIL_TO_PASS / PASS_TO_PASS 测试完成。




