遇见数据集

agent-think-tool_use

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Agent Think Tool Use 是一个用于多步代理会话的数据集,旨在通过监督微调(SFT)提升模型在代码编写、工具使用和工程任务上的能力。每条记录是一个完整的代理会话轨迹,包含用户需求、代理的思考过程、决策摘要、工具调用、执行结果、错误处理以及最终验证。数据集采用JSONL格式,包含消息、推理、函数调用、自定义工具调用、函数调用输出和会话上下文等记录类型。由三个子集组成,共450个shard文件,总计55,726条记录,约150.44 MB。工具调用共有10,928对,其中8,514个普通function_call和2,414个custom_tool_call,10,421个结果成功退出,507个包含诊断错误并带有恢复场景。代理可使用的工具包括shell.exec、patch.apply、web.search_query、web.open、web.find。覆盖多种编程语言、基础设施、数据库、流处理和队列以及专业主题。适用于监督微调、工具调用训练、多步工程对话、故障分析等任务。采用Apache-2.0许可证。

Agent Think Tool Use is a dataset for multi-step agent conversations, designed to enhance model capabilities in code writing, tool use, and engineering tasks through supervised fine-tuning (SFT). Each record is a complete agent conversation trajectory, including user requests, agent thinking processes, decision summaries, tool calls, execution results, error handling, and final verification. The dataset is in JSONL format and contains record types such as message, reasoning, function_call, custom_tool_call, function_call_output, and turn_context. It consists of three subsets with a total of 450 shard files, 55,726 records, and approximately 150.44 MB in size. There are 10,928 tool call-result pairs, including 8,514 regular function_calls and 2,414 custom_tool_calls; 10,421 results have successful exit codes (exit_code=0), and 507 have diagnostic errors (exit_code=1) with recovery scenarios. The available tools include shell.exec, patch.apply, web.search_query, web.open, and web.find. The dataset covers a wide range of application domains, including various programming languages, infrastructure tools, databases, stream processing and queue systems, and specialized topics. It is suitable for supervised fine-tuning, tool call and function call training, multi-step engineering conversations, code and project file manipulation, failure analysis and recovery, reasoning summarization and decision tracking, and can also be used for RLHF/DPO (with additional preference annotations). The dataset is licensed under Apache-2.0.

创建时间:
2026-09-04
原始信息汇总

Agent Think Tool Use 数据集概述

基本信息

  • 数据集名称: Agent Think Tool Use
  • 语言: 俄语 (ru)、英语 (en)
  • 许可证: Apache-2.0
  • 任务类型: 文本生成、问答
  • 创建方式: 机器生成
  • 数据规模: 100 < n < 1K
  • 数据格式: JSONL、traces

数据集内容

这是一个用于模型微调的多步代理会话数据集,涵盖代码操作、工具调用和工程任务。每条记录包含用户需求、代理工作期间的评论、决策摘要、工具调用、运行结果、错误处理及最终验证。每个 shard 代表一条独立的完整会话,而非独立的问答对。数据覆盖任务探索、文档查阅、设计、文件修改、测试、诊断、恢复及结果交付等环节。

数据统计

  • 总记录数:55,726 条(基于 450 个 shard 文件)
  • 总大小:150,440,831 字节
记录类型 记录数 占比
message 23,596 42.34%
function_call_output 10,928 19.61%
reasoning 9,824 17.63%
function_call 8,514 15.28%
custom_tool_call 2,414 4.33%
turn_context 450 0.81%

数据拆分

数据集 Shards 记录数 大小(字节)
agent-date-p1 150 28,308 95,463,626
agent-date-p2 150 11,965 25,223,199
agent-date-p3 150 15,453 29,754,006

记录类型说明

  • message: 系统、用户、助手评论或最终消息
  • reasoning: 包含决策理由和限制的决策摘要
  • function_call: 工具调用
  • custom_tool_call: 扩展工具调用
  • function_call_output: 工具可观察结果
  • turn_context: 会话上下文、状态机、质量与工件

代理工具

  • shell.exec — 执行命令和测试
  • patch.apply — 精细修改文件
  • web.search_query — 搜索技术文档
  • web.open — 打开搜索到的源
  • web.find — 在页面中查找特定规则或片段

主题覆盖

  • 编程语言: Python、Rust、Go、TypeScript、Java、C++、C#、Kotlin、Swift 等 20 余种语言
  • 基础设施: Kubernetes、Terraform、Helm、Ansible、Vault、CI/CD 及容器化
  • 数据库: PostgreSQL、MongoDB、Cassandra、Redis、ClickHouse 等
  • 流处理与队列: Kafka、RabbitMQ、NATS、Pulsar、Flink、Spark 等
  • 专题领域: CUDA、WebAssembly、WebRTC、网络安全、可观测性、GraphQL、gRPC 等

适用场景

任务 支持
监督微调 (SFT)
工具使用与函数调用
多步工程对话
代码与项目文件操作
错误分析与恢复
推理摘要与决策追踪
RLHF / DPO 需额外偏好标注

使用示例

python from datasets import load_dataset

dataset = load_dataset("ru-dataset/agent-think-tool_use") print(dataset)

搜集汇总
数据集介绍
agent-think-tool_use 数据集图片
构建方式
该数据集由机器生成的多步骤智能体会话轨迹构成,其构建遵循统一的会话状态机与工具调用协议。每一分片代表一个独立的工程任务会话,包含用户需求、智能体注释、决策摘要、工具调用与结果、错误处理及最终验证等环节。数据采集覆盖从任务探究、文档查阅、设计、文件修改、测试、诊断、恢复到结果交付的完整工作流。通过清理循环轨迹并保留诊断性非零退出码场景,确保了轨迹的真实性与多样性。最终产出450个分片文件,合计55,726条记录,涵盖多种编程语言与基础设施技术栈。
使用方法
加载数据集可通过Hugging Face datasets库直接调用,或按本地JSONL文件路径进行加载。训练时,可将记录按类型解析为消息、推理、函数调用等结构,用于监督微调、工具使用与函数调用能力训练。对于多步骤工程对话与代码任务,可利用会话状态与工具输出构建训练样本,同时保留诊断与恢复场景以增强模型鲁棒性。若用于RLHF或DPO,需额外标注偏好信息。数据集遵循Apache-2.0许可证,允许灵活使用与修改。
背景与挑战
背景概述
面向代码生成与工具调用的智能体研究长期受限于缺乏真实多步工程交互数据。agent-think-tool_use数据集于2026年前后发布,由俄语社区ru-dataset构建,聚焦多步骤智能体会话,记录用户需求、推理摘要、工具调用、执行输出与故障恢复,覆盖Python、Rust、Go等语言及Kubernetes、PostgreSQL等基础设施。语料含55726条记录、450个分片,为监督微调、函数调用与工程对话提供细粒度轨迹,弥补了既有数据集多限于单轮问答或简单工具调用的不足。
当前挑战
该数据集所应对的领域难题在于:传统代码生成基准仅考核单轮函数补全或问答,无法评估多步工具编排、失败诊断与恢复等真实工程任务。构建中的挑战包括:筛选并清洗循环轨迹,保留有效错误信号与非零退出码的恢复过程;确保推理摘要与决策证据一致;平衡多语言与多工具分布;标注成本高昂且缺少偏好对,限制RLHF/DPO直接应用,同时需避免将成功本地运行误判为生产级验证。
常用场景
经典使用场景
在智能体与工具增强语言模型的研究脉络中,agent-think-tool_use数据集凭借其完整的多步工程会话轨迹而成为监督微调与工具调用能力训练的典型资源。该数据集以代码代理在真实软件任务中的交互流程为核心,涵盖从需求澄清、文档检索、方案设计、文件修改到测试验证、错误诊断与修复的全链路记录。研究者通常利用其训练模型掌握shell执行、补丁应用与网络检索三类工具的调用时机与组合策略,并借助其中的推理摘要与决策记录提升模型在多步任务中的规划与自我监控能力。
解决学术问题
长期以来,学术研究在训练具备工程执行能力的语言模型时,面临高质量多步轨迹匮乏与工具调用标注不足的双重困境。agent-think-tool_use通过提供带状态机、退出码与恢复场景的细粒度结构化记录,有效缓解了模型在失败分析与自我纠错方面缺乏监督信号的问题。该数据集以可验证的工具执行结果为锚点,为推理链研究、决策可解释性以及错误恢复策略的实证分析提供了坚实语料,推动了代理式语言模型从单轮问答向可审计多步工程协作的范式迁移。
实际应用
在工业级软件开发与运维自动化场景中,该数据集可用于构建能够自主完成代码修改、环境配置与故障排查的编程助手。其涵盖的Python、Rust、TypeScript等多语言项目轨迹,以及Kubernetes、Terraform、PostgreSQL等基础设施主题,使模型能够适配多样的技术栈需求。通过微调,模型可在持续集成流程中承担测试诊断与修复建议生成任务,或在交互式开发环境中提供带有工具证据支撑的技术方案,从而提升工程效率并降低人为失误风险。
数据集最近研究
最新研究方向
随着大模型智能体在软件工程领域的纵深推进,面向多步工具调用与工程化推理的轨迹级监督已成为前沿热点。agent-think-tool_use数据集以450个会话分片、逾5.5万条结构化记录构建出涵盖需求澄清、文档检索、代码补丁、测试诊断与故障恢复的完整闭环工作流,其细粒度标注了决策摘要、函数调用输出与恢复证据,为监督微调与失败分析提供了高保真语料。该数据集不仅服务于工具使用与函数调用的能力强化,更推动了智能体在真实工程语境下推理可追溯性与执行鲁棒性的研究范式,对构建可信赖的自主编码代理具有重要的基准价值与实证意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务