遇见数据集

tool-use

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

该数据集名为tool-use,包含工具增强的rollout数据,记录了Qwen3 8B和14B模型在多个编程基准测试上的表现,具体涉及DS-1000、LiveCodeBench(时间窗口2305-2409)以及多语言LiveCodeBench的OCaml子集(共436个问题)。模型配备了一个名为run_code的工具,该工具能够在公开示例(对于LCB和mLCB)或基础环境(对于DS-1000,包含提示脚手架和代码片段)上编译并运行模型生成的代码,并捕获标准输出或错误追踪。私有评估测试数据始终不对该工具开放。数据以Parquet格式存储,路径结构为rollouts/domain=<d>/model=<tag>/temp=0.6/data.parquet,其模式在标准rollout模式基础上,扩展了工具调用轮次、失败调用次数、工具交互记录(JSON格式)、上下文令牌数和中断原因等字段。评估指标(metrics/)使用了与无工具基线模型相同的、规范的私有测试评分器。该数据集的实验计划和详细规范可在genlm rollouts代码仓库的experiments/tool_use/PLAN.md文件中找到。目前,该仓库已创建,但数据集本身尚处于待生成状态。

创建时间:
2026-07-02
原始信息汇总

数据集概述:tool-use

数据集地址:https://huggingface.co/datasets/samuki-hf/tool-use

许可协议:MIT

数据集内容:该数据集包含使用工具增强的模型推演(rollouts)数据。模型为 Qwen3 8B 和 14B,在 采样温度 t=0.6 下运行,覆盖以下评测场景:

  • DS-1000
  • LiveCodeBench(时间窗口:2305-2409)
  • 多语言 LCB(OCaml)(共 436 个问题)

工具使用:模型拥有一个名为 run_code 的工具,用于编译/运行代码。该工具在以下场景中可访问:

  • 公开示例(LCB、mLCB)
  • DS-1000(包含提示骨架 + 代码片段,输出为标准输出/回溯信息)

私有评测集:模型工具 无法访问 私有评测测试集。

数据文件格式:数据以 Parquet 格式存储,路径为 rollouts/domain=<d>/model=<tag>/temp=0.6/data.parquet。每条记录包含标准推演模式(rollout schema)以及以下附加字段:

  • tool_rounds
  • n_bad_calls
  • tool_transcript(JSON 格式)
  • n_ctx_tokens
  • aborted_reason

评测指标:评测使用与无工具基线数据集(samuki-hf/thinking-rollouts、samuki-hf/temperature-sweep-data)相同的规范私有测试评分器。

规划与状态:该数据集基于实验计划文件 experiments/tool_use/PLAN.md(位于 genlm rollouts 仓库)。当前状态:仓库已创建,但尚无数据(pilot 阶段前)。

搜集汇总
数据集介绍
tool-use 数据集图片
构建方式
该数据集通过工具增强的rollout方式构建,选取Qwen3 8B与14B模型,在温度参数t=0.6的设置下,分别运行于DS-1000、LiveCodeBench以及多语言LCB OCaml共436个编程问题的场景中。模型仅配置单一工具`run_code`,用于在公开的示例数据上编译并执行代码,私有的评估测试数据始终不可被工具访问。rollout数据按领域、模型标签和温度参数组织为Parquet格式文件,并附有工具调用轮次、错误调用次数及上下文令牌数等元信息。
特点
该数据集的核心特色在于将代码生成与工具调用深度耦合,通过限制模型仅能使用`run_code`工具在公开样例上执行,模拟了真实编程场景中模型与执行环境的交互行为。每条rollout记录不仅包含标准输出,还囊括了工具交互的全过程转录以及终止原因,为研究模型在受限工具环境下的代码生成策略提供了精细化的分析维度。评估指标沿用无工具基线的私有测试评分体系,确保了与既往研究结果的可比性。
使用方法
使用时,可从各领域对应路径下的Parquet文件中加载rollout数据,利用`tool_transcript`字段的JSON内容还原模型与`run_code`工具的完整交互对话。数据集的度量部分采用与无工具基线相同的私有测试评分器,便于直接进行性能对比分析。建议结合`n_bad_calls`与`aborted_reason`等字段,筛选出工具调用失败的案例进行针对性研究,或基于`tool_rounds`统计模型自主判断执行次数的分布规律。
背景与挑战
背景概述
在大语言模型(LLM)与代码生成任务深度融合的背景下,如何评估模型在真实编程场景中调用外部工具的能力成为关键议题。2024年,研究团队基于Qwen3系列模型(8B/14B)构建了tool-use数据集,旨在系统性地考察模型在DS-1000、LiveCodeBench及多语言LCB(OCaml)等基准上的工具增强式推理表现。该数据集由具有工具调用接口的模型生成,其中`run_code`工具负责编译和执行公开样本代码,而私有评估集始终不可见,以此确保测试的公正性。其发布为理解LLM在动态执行环境中的工具利用策略提供了重要资源,推动了代码智能与工具学习交叉领域的研究进展。
当前挑战
tool-use数据集面临的核心挑战在于多维度问题的耦合。首先,在领域问题上,现有LLM在代码生成时缺乏对执行环境反馈的实时适应能力,难以有效利用工具输出修正自身推理路径,导致在复杂编程任务中表现不稳定。其次,构建过程中的挑战尤为突出:数据生成涉及对模型工具调用行为的精细记录,包括工具轮次、错误调用次数及终止原因,而不同模型(如8B与14B)在思想链与无思想链模式下的行为差异增加了数据标注与评分的难度。此外,如何确保工具仅接触公开样本而避免隐私泄露,并对大规模多语言代码(如OCaml)进行可靠评估,也是技术实现上的显著瓶颈。
常用场景
经典使用场景
tool-use数据集聚焦于代码生成与执行场景,专门设计用于评估和增强大语言模型在编程任务中的工具调用能力。通过集成单一的`run_code`工具,模型可以编译并执行生成的代码片段,从而在DS-1000、LiveCodeBench及多语言LCB(含OCaml)等基准测试中验证其实际运行结果。该数据集的经典使用方式是以滚动(rollout)形式记录模型的完整交互轨迹,包括工具调用回合、失败调用次数、工具转录文本及上下文token数等结构化信息,为端到端的代码生成与执行评估提供标准化平台。
实际应用
tool-use数据集直接服务于智能编程助手的实际部署场景。在自动化代码补全、bug修复与单元测试生成等工业应用中,模型需要调用执行环境验证输出正确性。该数据集提供的标准化工具调用轨迹可训练模型在沙箱中安全运行代码,处理编译错误与运行时异常。此外,其在多语言LCB(如OCaml)上的覆盖,支持了异构编程环境下的工具适配研究,为开发具备跨语言代码执行能力的智能体提供了真实任务模拟与性能基准。
衍生相关工作
tool-use数据集衍生了一系列关于语言模型工具增强的关键工作,包括与无工具基线(如samuki-hf/thinking-rollouts和temperature-sweep-data)的对比分析,揭示了温度参数、思考机制与工具调用效率之间的交互规律。相关研究还基于该数据集提出的滚动架构,扩展了多工具协作与层级工具编排的实验范式。此外,通过分析工具转录中的失败调用模式,催生了针对性错误预防策略与自适应工具选择算法,推动了从单一工具调用向复杂工具生态系统的理论演化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务