遇见数据集

grug-think

收藏
Hugging Face2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

grug-think是一个用于训练语言模型进行高效工具调用和智能体推理的合成数据集。其核心目标是解决大型模型在工具调用前进行冗长思考(约400个token)的问题,通过训练模型使用极简短(中位数仅11个单词)但有效的内部推理,从而显著降低计算成本(token即金钱)。数据集包含100,891个完整的智能体对话示例,每个示例遵循统一格式:系统提示、用户查询、助手回复和工具消息。助手回复采用特定结构:首先在`<think>`和`</think>`标签内包含简短的“grug风格”推理(仅内部思考部分被重写为直接、无填充的短句),然后是面向人类的原始标准英语回复,最后是完整的工具调用(JSON格式保持不变且经过严格验证)。数据来源于多个公开数据集,包括glaive-function-calling-v2、hermes-function-calling-v1、ToolACE以及SWE-smith和nebius的智能体编码轨迹,涵盖约45%的代码修复任务(如查找bug、文件编辑、测试)和约55%的API工具调用任务。部分示例故意不包含工具调用,以训练模型判断何时无需调用工具。数据集通过将原始对话轨迹归一化后,使用DeepSeek-V4-Pro模型为每个助手回合生成简短的grug推理,并严格过滤和去重而构建。关键统计显示,共有542,799个带思考轨迹的助手回合,思考长度中位数为11词,说话部分平均31.1词,且所有工具调用JSON均完整无误。该数据集适用于微调模型以执行bash命令、文件操作、API调用和多轮对话等智能体任务,同时保持人类对话的自然性。局限性包括仅支持英语、推理为事后合成生成,以及包含部分弱智能体的“挣扎”轨迹用于训练恢复能力。数据基于开源许可证(Apache/MIT),建议用户核查上游许可。

grug-think is a synthetic dataset for training language models in efficient tool usage and agent reasoning. Its core goal is to address the issue of large models engaging in lengthy thinking (around 400 tokens) before tool calls, by training models to use extremely short (median of only 11 words) yet effective internal reasoning, thereby significantly reducing computational costs (tokens are money). The dataset contains 100,891 complete agent dialogue examples, each following a uniform format: system prompt, user query, assistant response, and tool messages. The assistant response adopts a specific structure: first, it includes brief grug-style reasoning within `<think>` and `</think>` tags (only the internal thinking part is rewritten as direct, filler-free short sentences), followed by the original standard English response for humans, and finally the complete tool call (JSON format remains unchanged and strictly validated). Data sources include multiple public datasets, such as glaive-function-calling-v2, hermes-function-calling-v1, ToolACE, and agent coding trajectories from SWE-smith and nebius, covering approximately 45% code repair tasks (e.g., finding bugs, file editing, testing) and about 55% API tool usage tasks. Some examples intentionally omit tool calls to train models in judging when not to use tools. The dataset is constructed by normalizing original dialogue trajectories, using the DeepSeek-V4-Pro model to generate short grug reasoning for each assistant turn, and strictly filtering and deduplicating. Key statistics show 542,799 assistant turns with thought trajectories, a median thought length of 11 words, an average speaking part of 31.1 words, and all tool call JSONs are complete and error-free. This dataset is suitable for fine-tuning models to perform agent tasks such as bash commands, file operations, API calls, and multi-turn dialogues, while maintaining natural human conversation. Limitations include English-only support, reasoning being post-hoc synthesized, and inclusion of some weak agent struggle trajectories for training recovery capabilities. The data is under open-source licenses (Apache/MIT), and users are advised to check upstream licenses.

创建时间:
2026-07-03
原始信息汇总

数据集概述:grug-think

grug-think 是一个用于文本生成的英文数据集,旨在训练模型在进行工具调用前进行简洁、高效的推理,模仿“grug”式的思考模式——短、直接、无冗余。

  • 许可证: Apache-2.0
  • 语言: 英语
  • 任务: 文本生成
  • 标签: 函数调用、工具使用、智能体、推理、合成数据
  • 数据集大小: 100,000 < 1,000,000 条样本
  • 配置: 默认配置包含一个训练集,数据文件为 data/train.jsonl

结构与格式

数据集包含 100,891 个示例,每个示例都是一个完整的智能体对话,包括系统消息、用户消息、助手消息和工具消息。

消息格式遵循 OpenAI API 格式,并嵌入了 Hermes 风格的 <think> 标签。

  • 助手回复结构:
    1. <think>grug reasoning</think>: 首先进行简短、实时的推理(grug 思考)。
    2. 普通英语文本 (say-words): 然后输出面向用户的正常英语。
    3. 工具调用 (tool_calls): 最后进行工具调用,其 JSON 格式保持完全不变。

关键点: 只有 <think> 标签内的内容是“grug风格”的短思考。外部与人交流的文本保持原始英语。工具调用的 JSON 被视为神圣不可修改的内容。

思考样本 (从数据集中提取)

<think>Tuple field likely in fields.py. View file to find implementation.</think> <think>Need exact line numbers for Tuple class. Use grep.</think> <think>Understand how _bind_to_schema works in base Field class. Tuple likely missing override that binds inner fields.</think> <think>Check how List field handles inner field binding - likely has pattern to follow for Tuple.</think>

这些样本展示了真实的假设链,无冗余填充词。

数据来源

数据集中的对话并非凭空创造,而是从其他大型开放数据集的真实智能体轨迹中提取,并重写了其中的“思考”部分。“说话”部分和“工具调用”则完全保持原样。

来源 数量 说明
glaive-function-calling-v2 ~40.8k 简单的 API 工具调用对话
hermes-function-calling-v1 ~6.2k 多轮工具使用
ToolACE ~8.9k 多工具 API 调用
SWE-smith trajectories (tool) ~15k 实时代码错误修复 (原生工具调用)
SWE-smith trajectories (ticks) ~15k 实时代码错误修复 (bash风格)
nebius SWE-agent trajectories ~15k 更多代理修复代码
  • 45% 的数据为编码工作:查找错误、读写文件、编辑、测试、提交。
  • 55% 的数据为 API 类工具调用。
  • 部分示例故意不包含工具调用,旨在教会模型何时不应使用工具。

数据构建流程

  1. 格式化: 将所有来源数据统一为一种 schema。
  2. 生成思考: 使用大型模型 (DeepSeek-V4-Pro) 为每个助手回复生成简短的 <think> 思考内容。
    • 规则: 最多约 70 个单词,内容必须涉及真实的工具调用推理,无填充词。
  3. 还原对话: 面向用户的“说话”部分恢复为原始文本。只有 <think> 标签内是 grug 风格。
  4. 过滤: 丢弃缺失思考、思考过长、思考中包含“Lets”等大模型常用词的数据(约丢弃 0.4%)。
  5. 去重: 按 ID 移除重复示例。

关键统计数据

  • 总助手思考轮次: 542,799
  • 思考长度:
    • 中位数: 11 个单词
    • 90% 分位数: 20 个单词
    • 平均数: 12.6 个单词
  • 说话文本长度: 平均 31.1 个单词 (英语,来自原始数据)
  • 工具调用 JSON 完整性: 100% 无损坏。

预期用途

该数据集用于微调模型,使其具备以下能力:

  • 在每次工具调用前进行低成本推理
  • 对人类输出正常的英语(grug 思考仅存于内部)。
  • 执行智能体工作:使用 bash、文件编辑、API 调用、多轮对话。

已知局限

  • 语言: 仅限英语,不支持多语言。
  • 推理性质: 思考过程是合成的,并且是事后生成的(模型在看到正确行为后写下的“后见之明”)。
  • 数据质量: 部分 SWE 轨迹可能来自较弱的智能体,包含了无效的尝试过程,但这也教会了模型如何从失误中恢复。
搜集汇总
数据集介绍
构建方式
该数据集名为grug-think,旨在引导模型采用极简的推理风格。其构建流程严谨而高效:首先将来自glaive-function-calling-v2、hermes-function-calling-v1、ToolACE以及SWE-smith轨迹等多个开源数据源的智能体轨迹统一为标准化模式。随后,利用大型语言模型(如DeepSeek-V4-Pro)为每条轨迹中的每一处助手轮次生成不超过70个单词的极简思考内容,保留原始的指令、工具调用及观测结果。生成后的数据经过严格过滤,剔除思考缺失、冗长或带有冗词(如'Let's')的劣质样本,最后通过去重确保每条示例的唯一性。
特点
grug-think数据集包含超过10万条完整的智能体对话,涵盖系统、用户、助手及工具消息,尤其关键的是,所有助手回复中都嵌入了以<think>标签包裹的极短思考内容。这些思考中位数仅11个单词,精简至极,却蕴含真实的推理链。数据集融合了约45%的代码智能体任务(如调试、文件编辑)与55%的API调用任务,部分示例甚至故意不含工具调用,以训练模型判断何时不需操作。所有工具调用的JSON格式均经过严格验证,确保零错误。
使用方法
该数据集兼容主流微调框架,如Axolotl、LLaMA-Factory及Unsloth,用户可直接用于有监督微调,以赋予模型在工具调用前进行低成本推理的能力。训练时,模型的思考部分嵌入在<think>标签内,对外与人类交流时仍输出正常英语。典型应用包括微调模型以完成智能体任务(如命令行操作、文件编辑、多轮API调用),从而在保持性能的同时显著节省推理阶段的token消耗,降低使用成本。
背景与挑战
背景概述
在大型语言模型(LLM)驱动的智能体应用中,工具调用(tool calling)与多步推理的融合已成为提升任务自主性的核心范式。然而,主流模型往往在每次工具调用前生成冗长的内省式思考(如超过400个token),导致计算开销剧增,限制了实际部署的经济性与效率。grug-think数据集于2025年由开源社区联合构建,基于Glaive、Hermes、ToolACE及SWE-smith等公开轨迹数据,聚焦于解决智能体推理中的“思维精简”问题。其核心研究问题在于:能否在保持任务成功率的前提下,将推理过程压缩至极短的、类似“grug”式的高密度语言,从而大幅降低推理成本。该数据集通过重写现有工具调用轨迹中的推理部分,创造了逾10万条结构化对话样例,为训练轻量化、高效率的工具使用智能体提供了关键资源,在推动低成本、高吞吐的Agent部署方面具有显著影响力。
当前挑战
该数据集所应对的领域核心挑战在于:传统智能体在每次工具调用前需进行漫长的显式推理,造成了严重的token浪费与计算延迟,如何实现“节俭推理”(cheap reasoning)而不牺牲决策质量成为瓶颈。构建过程中面临多重技术难关:一是需要将不同来源的轨迹(涵盖简单API调用、复杂多轮编码任务等)统一为标准化格式,特别是确保SWE-smith等长轨迹被恰当切分以保留上下文连贯性;二是利用大模型为每轮助手回复生成极短的grug式思维(中位数仅11词),同时需避免产出“事后诸葛亮”式的无效推理,并通过严格过滤(0.4%不良样本被剔除)保障思维的真实性与任务相关性;三是确保所有输出的JSON式工具调用格式绝对完整,且人类语言部分维持原样,最终形成混合训练数据以同时学习工具调用时机与简洁推理模式。
常用场景
经典使用场景
在智能体与工具调用模型的研究领域中,grug-think数据集以其独特的’极简思维’范式开辟了全新的训练路径。该数据集包含超过10万条完整的智能体对话轨迹,每条轨迹均在助手回复前嵌入一段以<think>标签包裹的简短推理过程——这些推理平均仅11个单词,却精准捕捉了工具调用前的核心思考脉络。经典使用场景聚焦于微调大语言模型,使其能够在调用工具前进行高效、低成本的推理,同时保持对人类用户输出的正常英语表达能力。研究者在训练中通过让模型模仿grug式的思考风格,实现了‘内省简洁、外联自然’的双重目标,从而在保持任务完成质量的前提下显著减少推理阶段的token消耗。这一范式尤其适用于需要频繁调用工具的多轮交互场景,如代码缺陷修复、API链式调用和动态任务规划,为构建经济高效的智能体系统提供了可复现的基础训练素材。
衍生相关工作
grug-think数据集的发布催生了一系列富有启发性的后续工作。研究者基于其‘紧凑推理’理念,进一步探索了将推理压缩至不同语言形态中的可能性,如引入代码式推理(<code>标签)视觉符号推理(<emoji>标签)等变体,以适配多模态智能体场景。另一条衍生路径聚焦于数据蒸馏方法的优化:原始grug-think采用DeepSeek-V4-Pro后验生成思考轨迹,后续工作尝试利用弱监督信号或对抗训练框架,让模型在没有教师指导的场景下自主学习grug式的高效推理模式。同时,该数据集启发了对‘思考成本与任务难度’关系的定量建模,催生了自适应推理策略的研究——即模型根据任务复杂度动态调整思考深度,在简单任务上实现近乎零token的grug式推估。
数据集最近研究
最新研究方向
grug-think数据集的最新研究方向聚焦于提升大语言模型在智能体任务中的推理效率,通过引入极简主义思维方式(grug reasoning)来优化工具调用和代码修复场景下的思考过程。该数据集涵盖超过10万条真实智能体轨迹,包括函数调用、SWE-smith代码调试等前沿研究方向,其核心创新在于将传统模型动辄数百token的冗长推理压缩至平均仅12.6词,实现在保持工具调用准确率的前提下大幅降低计算成本。当前,这一研究方向与开源社区对推理廉价化的迫切需求高度契合,通过Hermes风格的<think>标签训练范式,已在Llama-Factory等主流框架中得到广泛验证,为构建token高效型智能体提供了关键路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务