遇见数据集

exp_rpt_stack-pytest-v2-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个结构化的对话数据集,专注于记录多轮交互过程中对工具(或函数)的调用。每个数据样本包含以下核心字段:一个消息列表(`messages`),其中每条消息包含角色(`role`)、内容(`content`)以及可选的工具调用信息(`tool_calls`,包含调用类型和具体的函数名称与参数);一个描述所用工具的字符串字段(`tools`);一个指明对话任务的字符串字段(`task`);以及两个统计字段:对话轮数(`num_turns`)和工具调用次数(`num_tool_calls`)。数据集目前仅包含训练集(`train` split),共472个样本。数据以结构化格式存储,适用于训练或评估能够理解和执行工具调用的对话系统或智能体。

This is a structured dialogue dataset focused on recording tool (or function) calls during multi-turn interactions. Each data sample includes the following core fields: a list of messages (`messages`), where each message contains a role (`role`), content (`content`), and optional tool call information (`tool_calls`, which includes the call type, specific function name and parameters); a string field (`tools`) that describes the tools used; a string field (`task`) that specifies the dialogue task; plus two statistical fields: the number of dialogue turns (`num_turns`) and the number of tool calls (`num_tool_calls`). The dataset currently only includes the training split (`train`), with a total of 472 samples. The data is stored in a structured format and is suitable for training or evaluating dialogue systems or AI Agents that can understand and execute tool calls.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
exp_rpt_stack-pytest-v2-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集基于Qwen3.5-122B大语言模型在OpenCode SFT框架下的ServeParity推理服务构建而成,聚焦于软件测试领域的pytest堆栈解析任务。数据通过自动生成与人工校验相结合的方式,模拟多轮对话中工具调用场景,每个样本包含完整的消息序列、角色标注、工具函数定义及参数信息,最终形成472条高质量训练实例。
特点
数据集以结构化Json格式存储,每条记录包含有序的消息列表、工具定义、任务标签及交互轮次统计,支持角色分离与工具调用追踪。其核心特色在于保留了真实的函数调用链与参数传递细节,覆盖多种pytest测试场景,且99%的样本包含工具调用记录,为评估大模型在代码执行与工具协作方面的能力提供标准化基准。
使用方法
适用于对话式代码生成与工具调用场景的模型微调或评估。使用时需按messages字段中role与tool_call的层级结构还原交互历史,并结合tools字段中的函数定义进行上下文理解。建议将数据划分为训练集后,通过HuggingFace Datasets库直接加载,利用features中的多轮对话与工具调用标识来构建监督学习或强化学习任务的输入输出格式。
背景与挑战
背景概述
该数据集由Qwen团队基于Qwen3.5-122B模型在OpenCode框架下生成,旨在通过工具调用(tool-calling)能力增强大语言模型在复杂软件工程任务中的表现。研究聚焦于使用pytest测试框架进行堆栈错误复现,以探索大模型在代码调试与测试生成中的潜力。数据集创建于近期,包含472条多轮对话样本,每条记录均包含角色、工具调用及功能参数等结构化信息,为工具增强型对话系统提供了精细化的训练资源。其发布有助于推动大模型在自动化软件测试、错误诊断等领域的应用,对提升代码智能体的鲁棒性与实用价值具有显著影响力。
当前挑战
该数据集所面临的领域挑战在于,当前大语言模型在多轮、多步工具调用场景下仍难以精准匹配错误堆栈与修复策略,尤其是在复杂依赖关系和动态执行环境中,模型对工具使用的有序性及上下文记忆能力不足。构建过程中,挑战体现为高质量的对话序列需通过人工或半自动方式确保每个工具调用的语义正确性与逻辑连贯性,同时样本数量有限(仅472例),可能限制了模型对稀有错误模式的泛化能力。此外,工具定义(tools字段)的标准化和跨任务一致性维护也是数据构建中的实践难点。
常用场景
经典使用场景
在软件工程与代码智能的交叉领域中,exp_rpt_stack-pytest-v2-qwen3.5-122b-131k-opencode-sft-serveparity 数据集为大规模语言模型在自动化测试场景下的指令微调提供了高质量的训练语料。其经典使用场景聚焦于代码生成与测试修复:研究者利用该数据集训练模型理解pytest测试框架的语法规范与执行逻辑,通过多轮对话格式的messages字段(包含角色、工具调用等内容)模拟开发者与测试框架间的交互,使模型掌握从错误堆栈中解析失败原因、调用上下文工具并生成修复性测试代码的能力。配合tools字段定义的函数调用接口,该数据集可有效赋能模型在软件持续集成流水线中自主执行测试用例的“感知-推理-行动”闭环,尤其适用于回归测试自动补全与测试断言修正等高频任务。
解决学术问题
该数据集直面软件测试自动化领域的核心学术难题——测试脚本的脆弱性与维护成本高昂。传统测试用例对代码变更敏感,修改后常导致大量误报或遗漏,而人工修复测试套件耗时巨大。通过构造包含多轮工具调用与函数参数的对话样本,数据集系统性地探索了基于大语言模型的测试自愈范式(Test Self-Healing),即模型需根据运行时堆栈信息、函数签名变化及工具调用结果,动态调整测试逻辑与断言策略。这一思路突破了静态分析仅依赖语法匹配的局限,推动了“测试即代码”与“测试即交互”的融合。数据集提供的结构化工具调用数据(如function.name与arguments字段)为研究测试上下文感知生成、错误定位中的因果推理、以及工具增强型语言模型的泛化边界提供了可控实验平台,显著降低了测试维护的人工干预成本。
衍生相关工作
围绕该数据集的设计理念,已催生出一系列具有影响力的研究方向与系统。一方面,部分工作借鉴其messages层中tool_calls的结构化设计,构建了统一测试工具调用基准(如TestA2Bench、SWE-bench-lite),进一步评估语言模型在复杂测试场景下的多步推理与错误恢复能力。另一方面,研究者基于该数据集的“错误堆栈-工具调用-修复输出”范式,提出了面向动态分析的自适应学习框架,通过强化学习与人类反馈(RLHF)优化模型在不可见测试框架上的zero-shot表现。此外,数据集启发了若干端到端测试维修系统(如Fixie、TestPilot),它们将对话式工具调用与检索增强生成(RAG)结合,引入外部文档与代码库知识来提升修复方案的上下文准确性。这些衍生工作共同推进了代码智能从“静态生成”向“动态交互”的范式转移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务