遇见数据集

llm-verifier-freelancer-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个专注于工具调用(Tool Calling)或函数调用(Function Calling)任务的多轮对话数据集。每个数据样本代表一个完整的对话会话,其中包含一系列消息(messages),每条消息具有角色(如用户或助手)、文本内容以及可选的工具调用信息。工具调用(tool_calls)详细记录了助手在对话中调用外部工具或函数的行为,包括工具类型(type)和具体的函数调用详情(函数名称和参数字符串)。此外,每个样本还提供了该对话会话中涉及的工具定义列表(tools)、对话所对应的任务描述(task)、对话的总轮数(num_turns)以及会话中发生的工具调用总次数(num_tool_calls)。数据集包含510个训练样本,适用于训练或评估AI模型在对话场景下理解用户意图、规划并执行工具调用的能力。

This dataset is a multi-turn dialogue dataset focused on tool calling or function calling tasks. Each data sample represents a complete conversation session, containing a series of messages, each with a role (e.g., user or assistant), text content, and optional tool calling information. Tool calls (tool_calls) detail the assistants behavior in invoking external tools or functions during the conversation, including the tool type and specific function call details (function name and parameter strings). Additionally, each sample provides a list of tool definitions involved in the conversation session (tools), the task description corresponding to the dialogue (task), the total number of turns in the conversation (num_turns), and the total number of tool calls that occurred in the session (num_tool_calls). The dataset contains 510 training samples and is suitable for training or evaluating AI models ability to understand user intent, plan, and execute tool calls in dialogue scenarios.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
llm-verifier-freelancer-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
本数据集名为llm-verifier-freelancer-qwen3.5-122b-131k-opencode-sft-serveparity,旨在为大型语言模型的函数调用能力提供高质量的监督微调数据。其构建基于OpenCode平台上的真实自由职业者任务场景,通过精心设计的指令模板与工具调用示例,模拟了多轮对话中模型需根据用户意图调用外部函数的过程。每条数据均包含完整的消息序列、工具定义及任务类型标注,确保覆盖多种复杂的函数调用模式。数据集共包含510条训练样本,存储于Parquet格式文件中,便于高效加载与处理。
特点
该数据集的核心特色在于其结构化的多轮对话设计与丰富的工具调用标注。每条样本均记录了角色(role)、内容(content)及工具调用(tool_calls)信息,其中工具调用细分为类型(type)、函数名(name)与参数(arguments),完美适配Qwen等模型的函数调用训练需求。此外,数据集还提供了工具定义(tools)与任务类型(task)字段,便于研究者在不同场景下评估模型的泛化能力。对话轮次(num_turns)与工具调用次数(num_tool_calls)的统计信息,为分析对话复杂度与工具使用频率提供了量化依据。
使用方法
使用该数据集时,建议将其加载为标准的对话格式,每条样本的messages字段可直接用作模型的输入输出序列。研究者可基于tools字段提供的外部函数定义,结合模型生成的tool_calls进行对比评估。数据集默认仅包含训练集分割,适用于监督微调(SFT)场景。通过在HuggingFace Datasets库中指定配置名default,即可通过data/train-*路径加载全部510条样本。建议在微调过程中,将数据与Qwen3.5等支持函数调用的模型配合使用,以最大化数据集的工具调用学习效果。
背景与挑战
背景概述
该数据集名为llm-verifier-freelancer-qwen3.5-122b-131k-opencode-sft-serveparity,由Qwen团队基于Qwen3.5-122B模型构建,旨在评估和优化大语言模型在开放代码领域的指令遵循与工具调用一致性。数据集包含510条训练样本,每条样本涵盖多轮对话、工具调用及任务标签,核心研究问题聚焦于提升LLM在复杂服务场景下的验证能力。该数据集填补了模型在工具调用对齐与长上下文服务均衡性方面的评估空白,对推动LLM在编程辅助与自动化服务中的可信部署具有显著影响。
当前挑战
当前面临的核心挑战包括:1) 领域问题层面,大语言模型在处理多轮工具调用时易出现指令偏离或工具选择错误,尤其在长上下文场景下服务公平性难以保障;2) 构建过程中,数据集仅包含510条样本且均为单一训练分割,稀缺的标注数据难以覆盖多样化的工具调用模式与对话复杂度,同时缺乏跨任务泛化性的测试集验证,导致模型过拟合风险与评估偏差问题突出。
常用场景
经典使用场景
在多轮对话与工具调用并存的智能交互场景中,该数据集扮演着衔接大语言模型与外部功能的桥梁角色。其独特的`messages`结构嵌入了`role`、`content`及嵌套的`tool_calls`字段,精准刻画了模型在对话中动态调用外部工具(如API、数据库查询)的复杂交互过程。经典用途聚焦于训练和评估模型在工具辅助下的多步推理能力,例如要求模型根据用户需求自主决定何时调用`function`并填充`arguments`,随后将工具返回的结果融入对话上下文,从而完成诸如实时信息检索、任务自动化执行等需要知行合一的操作。这为构建能够主动利用外部资源、超越纯文本生成的智能代理系统提供了标准化的训练框架。
实际应用
在产业落地层面,该数据集天然适配于构建企业级智能助手和生产效率工具。实际应用涵盖客户服务中的动态查询解析(如根据用户历史订单自动调用库存系统)、软件开发中的代码库接口调用(如生成符合特定API规范的函数参数),以及办公自动化中的跨应用联动(如从邮件指令中提取日程并调用日历服务)。通过微调基于此数据的模型,开发者能打造出不仅会说话、更能办事的虚拟员工,显著减少人工介入,提升流程响应速度。例如,在金融领域,模型可依据用户语音指令即时调用风控接口并生成合规报告,将传统需多步人工操作的任务浓缩为单一对话入口。
衍生相关工作
该数据集催生了一批聚焦工具增强型语言模型的开创性研究。典型衍生工作包括基于其结构化消息格式开发的工具调用规划算法,如将`tool_calls`序列视为行动组件进行强化学习优化的方法;还有专门针对工具参数抽取设计的解码策略,提升`arguments`字段填充的精确性。此外,研究者以此为基础拓展出面向异构工具集的多功能代理框架,通过引入工具描述嵌入和注意力机制,使模型能动态选择最合适的`function`。这些工作不仅验证了结构化对话数据在提升模型工具利用效率上的优势,还推动了如自动化提示词优化和少样本工具调用泛化等前沿课题的进展,反向丰富了开源社区的训练资源生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务