tool-use
收藏资源简介:
该数据集名为tool-use,包含工具增强的rollout数据,记录了Qwen3 8B和14B模型在多个编程基准测试上的表现,具体涉及DS-1000、LiveCodeBench(时间窗口2305-2409)以及多语言LiveCodeBench的OCaml子集(共436个问题)。模型配备了一个名为run_code的工具,该工具能够在公开示例(对于LCB和mLCB)或基础环境(对于DS-1000,包含提示脚手架和代码片段)上编译并运行模型生成的代码,并捕获标准输出或错误追踪。私有评估测试数据始终不对该工具开放。数据以Parquet格式存储,路径结构为rollouts/domain=<d>/model=<tag>/temp=0.6/data.parquet,其模式在标准rollout模式基础上,扩展了工具调用轮次、失败调用次数、工具交互记录(JSON格式)、上下文令牌数和中断原因等字段。评估指标(metrics/)使用了与无工具基线模型相同的、规范的私有测试评分器。该数据集的实验计划和详细规范可在genlm rollouts代码仓库的experiments/tool_use/PLAN.md文件中找到。目前,该仓库已创建,但数据集本身尚处于待生成状态。
数据集概述:tool-use
数据集地址:https://huggingface.co/datasets/samuki-hf/tool-use
许可协议:MIT
数据集内容:该数据集包含使用工具增强的模型推演(rollouts)数据。模型为 Qwen3 8B 和 14B,在 采样温度 t=0.6 下运行,覆盖以下评测场景:
- DS-1000
- LiveCodeBench(时间窗口:2305-2409)
- 多语言 LCB(OCaml)(共 436 个问题)
工具使用:模型拥有一个名为 run_code 的工具,用于编译/运行代码。该工具在以下场景中可访问:
- 公开示例(LCB、mLCB)
- DS-1000(包含提示骨架 + 代码片段,输出为标准输出/回溯信息)
私有评测集:模型工具 无法访问 私有评测测试集。
数据文件格式:数据以 Parquet 格式存储,路径为 rollouts/domain=<d>/model=<tag>/temp=0.6/data.parquet。每条记录包含标准推演模式(rollout schema)以及以下附加字段:
tool_roundsn_bad_callstool_transcript(JSON 格式)n_ctx_tokensaborted_reason
评测指标:评测使用与无工具基线数据集(samuki-hf/thinking-rollouts、samuki-hf/temperature-sweep-data)相同的规范私有测试评分器。
规划与状态:该数据集基于实验计划文件 experiments/tool_use/PLAN.md(位于 genlm rollouts 仓库)。当前状态:仓库已创建,但尚无数据(pilot 阶段前)。




