inferredbugs-sandboxes-verifier-qwen3.5-122b-131k-opencode-sft-serveparity
收藏数据链接:
官方服务:
资源简介:
该数据集是一个用于训练或评估能够处理工具调用(函数调用)的对话模型或代理的数据集。数据集包含5633个多轮对话样本,总大小约为338.8 MB。每个样本的结构化数据包含以下核心字段:1) messages:一个消息列表,记录对话的每一轮交互。每条消息包含role(角色,如用户或助手)、content(文本内容)和tool_calls(工具调用记录)。2) tool_calls:详细描述了工具调用,包括调用type和function信息,其中function进一步指定了被调用函数的name(名称)和arguments(参数)。3) 其他元数据字段:tools(可能描述可用工具集)、task(任务类型或描述)、num_turns(对话轮数)和num_tool_calls(工具调用次数)。数据集适用于研究或开发涉及工具使用、函数执行或API调用的智能对话系统,其结构明确支持对复杂、工具增强型对话交互的建模。
提供机构:
LAION eV创建时间:
2026-07-21
搜集汇总
数据集介绍

构建方式
该数据集来源于对大规模代码仓库中潜在缺陷的自动化推断与验证流程,通过结合Qwen3.5-122B模型的强大生成能力与OpenCode SFT框架的指令微调策略,构建了包含131k条高质量对话样本的监督微调数据集。每条样本均模拟了工具调用场景下多轮交互的完整对话历史,并附带对应的工具定义与任务标识,确保数据具备真实代码修复场景的复杂性与多样性。
特点
数据集以多轮对话为核心结构,每条样本包含角色、内容及工具调用记录,覆盖了从缺陷发现到沙箱验证的完整逻辑链条。其显著特点在于工具调用字段的精细设计,不仅记录了调用类型与函数名称,还完整保留了参数结构,使得模型能够学习在真实开发环境中调用外部工具解决编程问题的能力。此外,数据集按轮次与工具调用次数进行统计,便于研究者分析模型在多步推理场景下的表现。
使用方法
该数据集可直接用于训练面向代码修复与工具调用的对话模型,使用HuggingFace datasets库加载后,需将messages字段作为输入序列,tools字段作为可调用函数的上下文描述。训练时建议采用因果语言建模目标,重点关注工具调用与参数生成的正确性。由于数据集已按OpenCode的SFT格式组织,可直接适配标准微调流程,同时可结合任务字段进行下游任务的细粒度评估。
背景与挑战
背景概述
该数据集由InferredBugs团队创建,聚焦于代码安全验证与智能修复领域,核心研究问题在于利用大语言模型(如Qwen3.5-122B)实现自动化代码漏洞检测与沙盒环境中的工具调用生成。数据集包含约5633条训练样本,每个样本结构复杂,涵盖多轮对话、工具调用及函数参数等维度,专为监督微调(SFT)设计,服务于服务端奇偶性验证任务。其发布推动了代码智能领域从静态分析向动态沙盒验证的范式转变,对提升软件安全自动化水平具有显著影响力。
当前挑战
领域挑战在于代码沙盒验证中多工具协同与异常处理的复杂建模,例如动态环境中工具调用的参数合规性、错误恢复机制及长序列上下文依赖问题。构建过程中面临数据稀疏性难题:仅5633条样本难以覆盖真实世界多样的漏洞模式与工具交互场景;同时需平衡工具调用链的语法正确性与语义合理性,避免过拟合至特定沙盒环境。此外,多轮对话中的工具幻觉与角色一致性维持也是关键技术瓶颈。
常用场景
经典使用场景
该数据集专为多轮对话与工具调用场景下的智能体(Agent)微调与评估而设计,尤其聚焦于代码执行沙箱环境的验证任务。其经典使用方式是以Qwen3.5-122B为基础模型,结合OpenCode格式的监督微调(SFT)数据,训练模型能够根据用户指令生成调用外部工具(如沙箱、编译器)的请求,并基于返回结果进行后续推理与回复。数据集包含5633条训练样本,每条均标注了角色、工具调用结构及多轮交互轮次,适用于构建遵循指令、具备工具使用能力的大语言模型,是当前代码生成与自动化调试领域的典型benchmark数据。
实际应用
实际应用中,该数据集直接服务于智能编程助手与自动化测试平台的开发。例如,在GitHub CI/CD流程中,训练后的模型可自动接收错误报告,调用沙箱环境复现并修复Bug;在在线编程教学场景中,模型能根据学生代码的运行结果提供精准的诊断反馈。数据集强调的“验证-修复”闭环能力,使其特别适用于低代码开发平台、自动化Unit Test生成以及代码审查系统,有效降低了开发者在调试阶段重复耗时的问题,显著提升了软件工程中的自动化水平。
衍生相关工作
该数据集作为开源工具调用微调方案的重要基础,已衍生出多项代表性工作。其中,采用相同对话结构构建的OpenCode系列数据集被用于训练CodeLlama、DeepSeek-Coder等代码模型的指令遵循能力。此外,基于该数据集的“验证器+生成器”协同框架启发了ReAct与Toolformer等推理策略的改进版本,而近期针对多轮工具调用中长上下文处理的优化研究(如131K超长上下文扩展)亦引用了其数据格式作为评测标准。这些衍生工作共同推动了代码智能体从单步调用向复杂多步决策的范式演进。
以上内容由遇见数据集搜集并总结生成



