遇见数据集

exp_rpt_unitsyn-python-large-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个用于工具增强对话或指令遵循任务的结构化数据集。其核心内容包含多轮对话消息(messages),每条消息具有角色(如用户或助手)、文本内容(content)以及可选的工具调用(tool_calls)信息,工具调用进一步定义了类型(type)和函数细节(包括函数名和参数)。此外,每条数据样本还关联了工具定义(tools)、任务类型标识(task)、对话轮次数(num_turns)和工具调用次数(num_tool_calls)。数据集规模为2195个训练样本,数据以分片文件形式存储。该数据集适用于训练或评估能够理解和执行工具调用的对话模型。

This dataset is a structured dataset for tool-augmented dialogue or instruction-following tasks. Its core content includes multi-turn dialogue messages, where each message has a role (e.g., user or assistant), text content, and optional tool call information, with tool calls further defining the type and function details (including function name and parameters). Additionally, each data sample is associated with tool definitions, task type identifiers, the number of dialogue turns, and the number of tool calls. The dataset consists of 2195 training samples stored in sharded files. It is suitable for training or evaluating dialogue models capable of understanding and executing tool calls.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
exp_rpt_unitsyn-python-large-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集基于大规模合成数据生成技术构建,旨在提升代码大语言模型在复杂工具调用任务中的对齐能力。其构建过程依托强大的基座模型(如Qwen3.5-122B),通过将OpenCode与结构化工具描述(如Python函数接口)进行深度语义融合,生成多轮交互场景下的指令-工具调用对。每条样本均包含完整的对话历史(messages)、外部工具定义(tools)、任务类型(task)及交互轮次(num_turns),并严格校验工具调用格式(tool_calls),确保输出与实际API调用规范一致。最终产出的2195条训练样本覆盖广泛的任务场景,数据规模约80MB,兼顾多样性、真实性与格式严谨性。
特点
本数据集的核心特色在于其极高的“工具调用丰度”与任务泛化能力。平均每条样本包含多次工具调用(num_tool_calls),且对话轮次分布广泛,能充分检验模型在长上下文条件下执行多步工具编排的连贯性。数据集中每个工具定义均以结构化JSON形式独立存储(tools字段),支持动态适配不同API环境。此外,任务标签(task)的差异化标注使得该数据集可被灵活拆解,适用于分场景微调或零样本泛化评估,尤其适合需要复杂推理与外部工具协同的智能代理(Agent)训练任务。
使用方法
本数据集兼容HuggingFace Datasets标准接口,用户可通过load_dataset('exp_rpt_unitsyn-python-large-qwen3.5-122b-131k-opencode-sft-serveparity')直接加载训练集(split='train')。建议在微调开源代码生成模型(如CodeLlama、StarCoder)或构建Agent专用模型时,将数据中的messages字段作为对话输入,利用tools字段构建内部工具注册表,并基于tool_calls字段设计反馈损失函数。为达到最优效果,需确保模型支持多轮对话格式,且具备函数调用(Function Calling)的输出能力。推荐混合其他平行语料进行联合训练以增强鲁棒性,训练批次大小建议设为16-32。
背景与挑战
背景概述
在大型语言模型(LLM)与工具调用(Tool Calling)相结合的领域,如何构建高质量、多样化的工具使用对话数据已成为提升模型函数调用能力的关键瓶颈。该数据集由Qwen团队于2024年创建,旨在为Python代码生成场景下的工具调用提供标准化的监督微调(SFT)训练样本。数据集包含2195条多轮对话实例,每条记录内嵌了系统定义的工具函数(tools字段)及工具调用历史(tool_calls字段),覆盖从简单参数传递到复杂工具链编排的多元任务。作为OpenCode系列的一部分,该数据集通过单元级同步(UnitSyn)策略确保了工具定义与调用范例的一致性,为后续研究LLM在代码执行环境中自主决策与工具交互提供了宝贵的基石。
当前挑战
该数据集所解决的核心领域挑战在于提升LLM对结构化工具接口的精准理解与调用能力,尤其是在Python代码生成中处理嵌套参数、类型约束及跨工具依赖等复杂场景。构建过程中面临的技术难点包括:1)如何生成高质量的多轮工具交互轨迹,使模型学会在对话中动态引用和调用函数;2)确保659个训练样例中工具定义的语法正确性与逻辑自洽性,避免因工具描述不一致导致模型学习偏差;3)在有限的2195条样本规模下,平衡工具调用频次(num_tool_calls字段)与对话轮次(num_turns字段)的分布,以覆盖长尾工具使用模式。
常用场景
经典使用场景
该数据集专为多轮对话中工具调用(Tool Calling)与函数执行(Function Calling)场景设计,聚焦于编程语言Python的代码生成与单元测试同步。其经典应用在于训练大语言模型理解用户指令、调用外部工具(如API或代码库)并返回结构化结果,特别适用于需要多步推理和状态管理的复杂任务,如自动化代码修复、单元测试编写与执行一致性校验。
实际应用
在实际应用中,该数据集可支撑自动化编程助手、智能测试平台及低代码开发工具的构建。例如,赋能开发者通过自然语言描述即可触发代码补全、单元测试生成及回归验证流程,显著提升软件开发效率。在金融、医疗等对代码可靠性要求严苛的领域,它还能辅助构建合规性校验与自动化审计系统,减少人工检查成本与人为失误。
衍生相关工作
与该数据集相关的工作包括基于工具调用范式的指令微调方法(如Toolformer、Gorilla)、多轮对话中的状态追踪技术以及结构化输出约束的生成模型优化。此外,它推动了代码专用基准测试(如MBPP、HumanEval)向函数级交互场景的扩展,衍生出如ToolTalk、APIBench等评估框架,并启发了将单元测试覆盖率作为生成质量度量指标的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务