遇见数据集

optiq-code-traces

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

OptiQ Code Traces是一个包含1,706个经过黄金测试验证的智能体软件工程轨迹的数据集。这些轨迹由OptiQ Code终端编码智能体生成,针对真实代码仓库中的错误进行完整的工具调用运行。每个轨迹的resolved标签均通过在实际应用模型补丁后执行黄金测试(包括FAIL_TO_PASS和PASS_TO_PASS)来设置,而非依赖智能体的自我报告。数据集采用HuggingFace Session-Traces格式(agent-traces查看器),每个.jsonl文件代表一个会话:第一行为携带黄金标签的头部元数据,后续每行代表一个回合的消息,包含工具调用和结果。数据来源于三个基准:SWE-Gym(1,203个会话)、SWE-bench Verified(426个会话)和SWE-bench Lite(77个会话)。会话通常较长且密集,中位数为87条消息、22.5K个标记和41次工具调用,工具使用以bash命令为主(65%),其次是read_file(18%)。数据集的主要目的是用于微调本地模型,以便在OptiQ Code中使用,特别适用于训练小型本地量化模型。数据集中包含389个已通过黄金测试验证的已解决会话,以及104个智能体误报(自我报告为已解决但黄金测试未通过)和193个智能体漏报(自我报告为失败但黄金测试已通过)的案例,这些案例对于训练验证器或过程奖励模型具有较高价值。

OptiQ Code Traces is a dataset containing 1,706 gold-tested agent software engineering traces. These traces are generated by the OptiQ Code terminal coding agent, performing complete tool-call runs on bugs in real code repositories. The resolved label for each trace is set by executing gold tests (including FAIL_TO_PASS and PASS_TO_PASS) after applying model patches, rather than relying on the agents self-report. The dataset uses the HuggingFace Session-Traces format (agent-traces viewer), where each .jsonl file represents a session: the first line contains header metadata with gold labels, and each subsequent line represents a turn message, including tool calls and results. The data is sourced from three benchmarks: SWE-Gym (1,203 sessions), SWE-bench Verified (426 sessions), and SWE-bench Lite (77 sessions). Sessions are typically long and dense, with a median of 87 messages, 22.5K tokens, and 41 tool calls, with tool usage dominated by bash commands (65%), followed by read_file (18%). The primary purpose of the dataset is for fine-tuning local models for use in OptiQ Code, particularly for training small local quantized models. It includes 389 resolved sessions validated by gold tests, along with 104 agent false positives (self-reported as resolved but failing gold tests) and 193 agent false negatives (self-reported as failed but passing gold tests), which are valuable for training verifiers or process reward models.

提供机构:
MLX Community
创建时间:
2026-07-16
原始信息汇总

数据集概述:OptiQ Code Traces

该数据集包含 1,706 条由 OptiQ Code 终端编码智能体生成的、针对真实仓库缺陷的完整工具调用轨迹,所有 resolved 标签均通过执行金标准测试验证。

数据格式与结构

  • 格式:HuggingFace Session-Traces 格式(agent-traces 查看器),与 optiq code export 输出格式一致。
  • 文件结构:每个 .jsonl 文件代表一个完整会话。
    • 第 1 行(header):携带元数据及金标签,例如 resolvedgold_verifiedself_repro_resolvedsource 等。
    • 后续行:每条消息一个 JSON 对象,包含角色(assistant/tool)、内容及工具调用信息。

数据规模与统计

指标 数量
总会话数 1,706
金标签已验证 894
已解决(通过金测试) 389
未解决 1,317
智能体误报(自报解决,金标签否) 104
智能体漏报(自报失败,金标签解决) 193
  • 基准来源:swe-gym (1,203)、swe-bench-verified (426)、swe-bench-lite (77)。
  • 会话特征:中位数 87 条消息、22.5k token、41 次工具调用。工具使用以 bash 为主(65%),其次是 read_file(18%),edit_file、run_tests、done 各占约 4-5%。

头标签字段说明

字段 含义
resolved 金标签裁决,true 表示补丁通过金测试
gold_verified 金测试是否实际运行(true)或无法运行(false
self_repro_resolved 智能体自身裁决;与 resolved 的差异即假阳/假阴
source 数据来源:swe-gymswe-bench-liteswe-bench-verified
gen_run 轨迹生成方式:progenscale_flashseed_pro
repomodelturns_usedsample 来源仓库、生成模型、使用轮次、抽样标识

数据收集方式

轨迹由 OptiQ Code 驱动 OpenAI 兼容端点(指向 deepseek/deepseek-v4-pro 模型)生成,每个轨迹对应一个真实仓库缺陷的完整工具调用过程。

主要用途

  1. 微调本地模型:用于在 OptiQ Code 中使用的本地小量量化模型,金标签已解决的轨迹作为训练信号。
  2. 验证器/过程奖励模型训练:智能体自报与金标签不一致的 104 个假阳性 + 193 个假阴性案例,是训练判断修复是否真正完成的最佳数据。
  3. 训练注意事项
    • swe-gym 可安全用于训练。
    • swe-bench-liteswe-bench-verified 是公开测试基准,在其上训练会污染评分。

数据来源

任务衍生自 SWE-bench(Lite / Verified)和 SWE-Gym。轨迹由 OptiQ Code 工作框架生成,金标签评分通过在每个任务的评估容器中应用补丁及金 test_patch,并运行官方 FAIL_TO_PASS / PASS_TO_PASS 测试完成。

搜集汇总
数据集介绍
optiq-code-traces 数据集图片
构建方式
OptiQ Code Traces 数据集由 Mac 平台上的终端编码代理 OptiQ Code 生成,通过驱动任意兼容 OpenAI 接口的模型(本数据集选用 deepseek/deepseek-v4-pro),对 SWE-bench 及 SWE-Gym 中的真实仓库缺陷执行完整工具调用轨迹。每个轨迹均经过黄金级验证:在应用模型生成的补丁后,实际运行官方测试用例(包括 FAIL_TO_PASS 和 PASS_TO_PASS),而非依赖代理自身的自我报告,从而确保 resolved 标签的可靠性。数据以 HuggingFace Session-Traces 格式存储,每个 jsonl 文件代表一个会话,首行承载元数据和黄金标签,后续每行对应一次消息交互。
特点
该数据集包含 1,706 个代理会话,其中 389 个经黄金测试验证为已解决,同时提供 104 个假阳性和 193 个假阴性案例,这些自我报告与客观结果存在分歧的数据是训练验证器或过程奖励模型的高价值素材。会话密集且信息丰富,中位数为 87 条消息、22.5k 个令牌和 41 次工具调用,工具调用以 bash(65%)为主,其次为 read_file(18%)。数据来源涵盖 swe-gym(1,203 条)、swe-bench-verified(426 条)和 swe-bench-lite(77 条),并附有 resolved、gold_verified、self_repro_resolved 等丰富标签。
使用方法
用户可通过读取 jsonl 文件并解析首行标签来筛选数据,例如仅加载经黄金验证且源为 swe-gym 的已解决会话用于监督微调,此部分共 290 条。将每条消息中的 message 字段提取为列表,即可输入至 SFT 或 LoRA 管线。特别建议利用假阳性与假阴性样本训练评估模型,以提升代理对任务完成状态的判断准确度。需注意,swe-bench-lite 和 swe-bench-verified 为公开测试基准,在其上训练将污染后续在这些基准上的得分报告。
背景与挑战
背景概述
OptiQ Code Traces数据集于2024年由MLX OptiQ团队创建,旨在为本地运行的小型量化模型提供高质量、经过真实测试验证的智能体软件工程轨迹数据。其核心研究问题在于如何通过监督微调,使本地模型具备出色的工具调用与代码修复能力。该数据集包含了1,706次完整的智能体会话,采用了标准化的HuggingFace Session-Traces格式,每个轨迹均对应一个真实仓库中的软件缺陷,并且所有“已解决”标签均通过执行黄金测试(FAIL_TO_PASS与PASS_TO_PASS)来验证,而非依赖智能体的自我报告。作为首个大规模、经过黄金验证的智能体代码修复轨迹集合,OptiQ Code Traces为模型训练与评估提供了可靠基准,对提升本地部署环境下模型的自主编程能力具有重要推动作用。
当前挑战
该数据集直面两大挑战。在领域问题层面,解决了智能体在复杂软件工程任务中验证结果可靠性的难题:传统智能体自我报告常出现与实际测试结果不一致的情况(数据集中包含104次假阳性与193次假阴性),这凸显了缺乏客观验证手段对模型能力发展的制约。在构建过程中,面临了数据采集与筛选的困难:轨迹生成需依赖强大模型(如deepseek/deepseek-v4-pro)在高计算开销下运行完整的工具调用流程,且每次修复必须经过强隔离的测试环境进行严格验证,确保黄金标签的精确性。此外,如何平衡不同来源(SWE-bench与SWE-Gym)的数据分布、避免训练集对测试集造成污染,以及处理会话中平均超过22,500个token的长序列数据,均构成了数据集构建中的重大技术挑战。
常用场景
经典使用场景
OptiQ Code Traces 数据集的核心价值在于它为代码智能体(Code Agent)的微调与行为模仿学习提供了经过黄金验证(gold-verified)的完整工具调用轨迹。这些轨迹记录了智能体在真实代码仓库的缺陷修复任务中,从理解问题、调用多种工具(如 bash 命令、文件读取、代码编辑、测试执行)到最终生成补丁并验证的完整过程。尤为关键的是,只有通过实际执行官方测试用例(FAIL_TO_PASS 和 PASS_TO_PASS)确认修复成功的会话才被标记为“resolved”,摒弃了智能体自报告的主观偏差。因此,该数据集最适合用于训练能够自主完成复杂软件工程任务的本地部署代码智能体,提升其在有限资源环境下的工具规划与执行能力。
衍生相关工作
OptiQ Code Traces 的发布直接催生并支撑了多项重要的相关研究工作。最直接的应用是使用其黄金验证轨迹通过监督式微调(SFT)或低秩适配(LoRA)训练代码智能体的基座模型,如开发者指南中展示的 290 个 swe-gym 黄金正例的微调方案。更进一步,数据集中智能体自评与实际验证结果不一致的样本(共 297 例)被专门提炼用于训练独立的正确性验证器,从而衍生出“信任但验证”(Trust but Verify)范式的智能体系统。此外,该数据集的广泛覆盖性和标准化的 Session-Traces 格式使其成为评估不同模型策略(如多种生成运行模式)在真实软件工程任务上表现优劣的基准测试集,从而为工具调用的长链推理、多轮交互决策等方向的学术探索提供了坚实的数据基石。
数据集最近研究
最新研究方向
当前,智能体驱动的软件工程自动化正成为前沿热点,而高质量、可验证的智能体轨迹数据是推动该领域发展的关键瓶颈。OptiQ Code Traces数据集应运而生,它首次提供了经由实际测试执行严格验证的软件工程智能体交互轨迹,共计1706条会话,其中包含389条由黄金测试确认的已解决bug修复轨迹。该数据集的核心亮点在于其'金标准'验证机制——所有'resolved'标签均通过执行FAIL_TO_PASS和PASS_TO_PASS测试后获得,而非依赖智能体的自我报告,这有效解决了当前智能体轨迹数据中普遍存在的自我报告偏差问题。数据集特别区分了104条假阳性与193条假阴性案例,为训练过程奖励模型和验证器提供了关键训练信号,有望显著提升本地小模型在终端编码代理中的任务完成准确率。其采用的HuggingFace Session-Traces标准化格式,使得研究者能够无缝整合自有数据与训练流程,为开源社区在软件工程智能体微调领域竖立了新的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务