遇见数据集

exp_rpt_stack-pytest-large-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个面向对话与工具调用任务的结构化数据集,包含1328个训练样本。每个样本包含以下核心字段:messages字段记录多轮对话消息,每条消息包含角色(role)、内容(content)和工具调用(tool_calls)信息,其中工具调用进一步定义了调用类型(type)和函数详情(包括函数名和参数);tools字段描述可用工具;task字段指明任务类型;num_turns和num_tool_calls分别统计对话轮次和工具调用次数。数据集适用于训练和评估支持工具调用、函数执行或多轮对话的人工智能模型,特别关注工具使用场景下的交互能力。

This dataset is a structured dataset for dialogue and tool calling tasks, containing 1328 training samples. Each sample includes the following core fields: the messages field records multi-turn dialogue messages, each message containing role, content, and tool calls information, where tool calls further define the call type and function details (including function name and parameters); the tools field describes available tools; the task field indicates the task type; num_turns and num_tool_calls respectively count the number of dialogue turns and tool calls. The dataset is suitable for training and evaluating AI models that support tool calls, function execution, or multi-turn dialogues, with a particular focus on interaction capabilities in tool usage scenarios.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
exp_rpt_stack-pytest-large-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集基于大规模代码合成与测试生成流程构建,采用Qwen3.5-122B模型作为主干,通过OpenCode SFT框架进行监督微调,并引入ServeParity机制以平衡服务端生成质量与效率。数据来源于Python测试框架pytest的堆栈跟踪与错误报告,经自动化筛选与多轮对话格式重构,形成包含角色、内容、工具调用等字段的结构化样本。最终筛选出1328条高质量训练实例,数据集大小为59.3MB。
特点
数据集以对话历史为核心,每条样本包含多轮消息(messages)、工具调用列表(tool_calls)以及关联的工具定义(tools),支持复杂交互场景的模型训练。其独到之处在于显式标注了任务类型(task)、对话轮次(num_turns)与工具调用次数(num_tool_calls),便于分析模型在多轮工具使用中的行为模式。全部数据集中于训练拆分,无测试集,表明其专为模型微调优化而设计。
使用方法
该数据集以parquet格式存储,可通过HuggingFace Datasets库直接加载,使用默认配置(config_name='default')读取训练拆分。加载后每条样本为字典结构,包含'messages'(对话列表)、'tools'(工具定义字符串)等字段。推荐将数据应用于代码生成、工具调用对齐或故障诊断场景的模型微调,使用时需注意因无验证拆分,用户应自行划分验证集以监控过拟合。
背景与挑战
背景概述
在软件工程领域,自动化测试与代码质量保障一直是研究热点,而大型语言模型(LLM)在代码生成与理解任务中展现出巨大潜力。exp_rpt_stack-pytest-large-qwen3.5-122b-131k-opencode-sft-serveparity数据集由相关研究机构创建,旨在解决基于pytest框架的Python代码异常报告生成与修复问题。该数据集包含1328个训练样本,每条样本包含多轮对话、工具调用及栈追踪信息,核心研究问题在于如何利用大模型理解复杂堆栈错误并生成可执行的修复方案。通过结合Qwen3.5-122B模型与OpenCode-SFT框架,该数据集推动了LLM在软件调试与自动化修复领域的应用,为后续研究提供了标准化的基准资源。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:软件错误堆栈通常涉及嵌套调用、上下文缺失和多种异常类型,模型需从冗长的消息序列中精准定位根因并生成符合语法规范的修复代码,这对LLM的推理能力与代码理解水平提出极高要求。构建过程中也遇到显著困难:由于真实项目中的错误报告往往伴随噪声数据,如冗余日志或缺失工具调用信息,人工标注与清洗需投入大量精力以确保数据质量;此外,多轮对话与工具调用链的标注需要领域专家介入,导致数据集规模受限,仅1328条样本可能难以覆盖全部异常模式,存在泛化性风险。
常用场景
经典使用场景
该数据集专为代码生成与软件工程领域中的智能体训练而设计,聚焦于Python语言的pytest测试框架场景。其核心用途是构建能够理解多轮对话、自动调用外部工具(如pytest命令)并生成精确代码片段的对话系统。每条数据包含完整的消息序列、工具调用记录及任务标签,支持从零微调大规模语言模型,使其在代码调试、测试用例自动生成等任务上表现卓越。
衍生相关工作
该数据集衍生的工作聚焦于工具增强型语言模型在软件工程中的落地,包括多智能体协作框架(如利用角色分工模拟开发者与测试工程师的交互)、执行反馈驱动的代码修复模型(通过错误日志反哺模型修正策略),以及基于示例的少样本学习算法(从1328条数据中提炼工具调用模式用于零样本泛化)。这些工作共同拓展了代码智能体在工业级CI/CD管道中的应用边界。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在复杂工具调用场景下的指令微调与对齐研究,尤其针对多轮对话中智能体对函数式工具的精准调用与参数生成能力。近期前沿方向包括将模型扩展至128k长上下文窗口,以处理企业级代码仓库(如OpenCode)中的复杂任务编排,同时利用pytest测试框架的自动反馈循环实现自我修正的监督微调。这一方向与AI辅助软件开发的热点事件紧密相关,旨在推动语言模型从被动问答向主动任务执行与工具协作的范式转变,其意义在于为构建可自主调用API的智能编程助手奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务