ToolWeave-BFCL-Rollout-Case-Study
收藏资源简介:
该数据集是 ToolWeave 项目在形式化训练更新2(formal-training update 2)中产生的完整原始轨迹工件。数据集包含 512 条 JSONL 格式的轨迹,每条轨迹记录了一次 BFCL(伯克利函数调用排行榜)多轮对话的完整交互过程,包括运行时消息、解析器/溯源元数据、奖励记录、问题、真实标签和策略响应。数据来源于 BFCL 和 EnvTuning 基础设施,并参考了 MatchTIR 的局部信用分配方法。数据集还提供了一个特定样本(multi_turn_base_156)的详细案例研究,包含其完整轨迹,以及 K=16 确定性同伴组分析,用于运行时交互信用分配,并附有多个 JSON/CSV 格式的分析文件。该数据集旨在发布原始强化学习轨迹,用于研究工具调用场景中的强化学习、奖励设计和信用分配,而非作为 SFT 数据或基准测试结果。
This dataset is the complete raw trajectory artifact produced by the ToolWeave project in the formal-training update 2. It contains 512 trajectories in JSONL format, each recording the full interaction process of a BFCL (Berkeley Function Calling Leaderboard) multi-turn dialogue, including runtime messages, parser/provenance metadata, reward records, questions, ground truth labels, and policy responses. The data originates from the BFCL and EnvTuning infrastructure, referencing the local credit assignment method of MatchTIR. The dataset also provides a detailed case study of a specific sample (multi_turn_base_156), including its complete trajectory, along with a K=16 deterministic peer-group analysis for runtime interaction credit assignment, accompanied by multiple analysis files in JSON/CSV format. This dataset is intended to release raw reinforcement learning trajectories for studying reinforcement learning, reward design, and credit assignment in tool-calling scenarios, rather than as SFT data or benchmark results.
🧵 ToolWeave BFCL Formal-Training Rollout Case Study 数据集总结
数据集概览
| 属性 | 详情 |
|---|---|
| 名称 | ToolWeave BFCL Formal-Training Rollout Case Study |
| 语言 | 英语 |
| 规模 | 小于 1K 条记录 |
| 类型 | 强化学习原始轨迹数据(非 SFT 数据,非基准测试结果) |
| 关联项目 | Muradil-mamat-211/ToolWeave |
核心数据集内容
1. 正式训练更新 2 原始轨迹
- 文件:
data/raw_trajectories_update_2_512.jsonl - 记录数: 512 条轨迹
- 提示组: 32 组 × 16 次生成
- 格式: JSONL,每行一条完整轨迹
- 内容: 包含运行时消息、解析器/来源元数据、奖励记录、问题、真实答案及策略输出
2. 案例研究样本
- 来源: BFCL 样本
multi_turn_base_156,源 JSONL 第 10 行,轨迹索引 9 - 时间点: 全局步骤 2 / 批次 1 / 轮次 0
- 轨迹特点: 包含协议失败与自我纠错过程,展示了真实的强化学习轨迹
轨迹结构详情
完整的五轮用户交互
数据集包含五个有状态的 BFCL 用户轮次,每轮对应的真实工具调用如下:
| 用户轮次 | 真实工具调用 |
|---|---|
| 0 | get_flight_cost, book_flight |
| 1 | retrieve_invoice |
| 2 | contact_customer_support |
| 3 | ticket_login, create_ticket |
| 4 | edit_ticket |
真实调用数量结构为 [2, 1, 1, 2, 1]。
运行时交互恢复(用户轮次 3 示例)
在用户轮次 3 中,所选轨迹包含 6 次非答案运行时交互:
- j=0 至 j=4: 均为
parse_error,奖励为 0 - j=5: 成功解析一个有效工具调用,包含
ticket_login和create_ticket,调用奖励均为 1.0
正式信用分配语义
活跃模式: runtime_interaction_final
- 同一 BFCL 用户轮次中成功解析的调用保持多重性拼接,并只匹配一次
- 调用奖励按来源运行时交互回传
- 未解析交互保持
P_j=[]且r_j=0,但仍计入时间线 - 折扣基于真实非答案运行时深度
j,gamma=0.9 - 局部peer共享
(group_uid, user_turn_id, runtime_interaction_index) - 使用无偏样本标准差进行 ragged 归一化
- 融合公式:
A_TW = A_RODS + A_local
特殊轨迹数值结果
text 即时奖励: [0, 0, 0, 0, 0, 1] 折现回报: [0.59049, 0.65610, 0.72900, 0.81000, 0.90000, 1.00000] peer支持数: [16, 16, 1, 1, 1, 1]
- 固定分母进展奖励:
R_P=0.8 - 全局归一化优势:
A_RODS=-0.4966976345
文件清单
| 文件 | 内容 |
|---|---|
data/raw_trajectories_update_2_512.jsonl |
完整 512 条轨迹原始产物 |
data/multi_turn_base_156_rollout_offset_9.json |
完整原始轨迹(含全部五轮 BFCL 用户交互) |
analysis/user_turn3_k16_credit_summary.json |
K=16 全精度匹配、回报、归一化、融合及状态审计 |
analysis/user_turn3_k16_credit_summary.csv |
每轨迹压缩摘要 |
analysis/user_turn3_k16_full_interaction_advantage.json |
用户轮次 3 每个非答案运行时交互的结构化数据 |
analysis/user_turn3_k16_full_interaction_advantage.csv |
精确的生产复现导出表 |
实现与求解器来源
- 数值由当前冻结的 ToolWeave Stage-3 正式训练实现复现
- 完整 pytest 套件、K=16 回归、解析错误令牌广播检查及确定性 CPU 训练器张量契约检查均已通过
- 匹配求解使用 SciPy 的
linear_sum_assignment(..., maximize=True),而非 MatchTIR 的辅助函数 - ToolWeave 是 MatchTIR 的改编实现,并非逐字复刻
安全性说明
- 数据集中的凭据类字符串为 BFCL 合成基准测试固定装置,非真实生产凭据
- 不包含任何 Hugging Face 令牌、GitHub 令牌、SSH 私钥、云访问密钥或本地服务器路径
上游背景
任务数据与执行环境源自公开的 AWorld-RL 基础设施和 Berkeley Function-Calling Leaderboard。MatchTIR 提供了局部信用分配的结构骨架,ToolWeave 的运行时深度与 BFCL 用户轮次适配为项目特有扩展。





