遇见数据集

ToolWeave-BFCL-Rollout-Case-Study

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是 ToolWeave 项目在形式化训练更新2(formal-training update 2)中产生的完整原始轨迹工件。数据集包含 512 条 JSONL 格式的轨迹,每条轨迹记录了一次 BFCL(伯克利函数调用排行榜)多轮对话的完整交互过程,包括运行时消息、解析器/溯源元数据、奖励记录、问题、真实标签和策略响应。数据来源于 BFCL 和 EnvTuning 基础设施,并参考了 MatchTIR 的局部信用分配方法。数据集还提供了一个特定样本(multi_turn_base_156)的详细案例研究,包含其完整轨迹,以及 K=16 确定性同伴组分析,用于运行时交互信用分配,并附有多个 JSON/CSV 格式的分析文件。该数据集旨在发布原始强化学习轨迹,用于研究工具调用场景中的强化学习、奖励设计和信用分配,而非作为 SFT 数据或基准测试结果。

This dataset is the complete raw trajectory artifact produced by the ToolWeave project in the formal-training update 2. It contains 512 trajectories in JSONL format, each recording the full interaction process of a BFCL (Berkeley Function Calling Leaderboard) multi-turn dialogue, including runtime messages, parser/provenance metadata, reward records, questions, ground truth labels, and policy responses. The data originates from the BFCL and EnvTuning infrastructure, referencing the local credit assignment method of MatchTIR. The dataset also provides a detailed case study of a specific sample (multi_turn_base_156), including its complete trajectory, along with a K=16 deterministic peer-group analysis for runtime interaction credit assignment, accompanied by multiple analysis files in JSON/CSV format. This dataset is intended to release raw reinforcement learning trajectories for studying reinforcement learning, reward design, and credit assignment in tool-calling scenarios, rather than as SFT data or benchmark results.

创建时间:
2026-08-21
原始信息汇总

🧵 ToolWeave BFCL Formal-Training Rollout Case Study 数据集总结

数据集概览

属性 详情
名称 ToolWeave BFCL Formal-Training Rollout Case Study
语言 英语
规模 小于 1K 条记录
类型 强化学习原始轨迹数据(非 SFT 数据,非基准测试结果)
关联项目 Muradil-mamat-211/ToolWeave

核心数据集内容

1. 正式训练更新 2 原始轨迹

  • 文件: data/raw_trajectories_update_2_512.jsonl
  • 记录数: 512 条轨迹
  • 提示组: 32 组 × 16 次生成
  • 格式: JSONL,每行一条完整轨迹
  • 内容: 包含运行时消息、解析器/来源元数据、奖励记录、问题、真实答案及策略输出

2. 案例研究样本

  • 来源: BFCL 样本 multi_turn_base_156,源 JSONL 第 10 行,轨迹索引 9
  • 时间点: 全局步骤 2 / 批次 1 / 轮次 0
  • 轨迹特点: 包含协议失败与自我纠错过程,展示了真实的强化学习轨迹

轨迹结构详情

完整的五轮用户交互

数据集包含五个有状态的 BFCL 用户轮次,每轮对应的真实工具调用如下:

用户轮次 真实工具调用
0 get_flight_cost, book_flight
1 retrieve_invoice
2 contact_customer_support
3 ticket_login, create_ticket
4 edit_ticket

真实调用数量结构为 [2, 1, 1, 2, 1]

运行时交互恢复(用户轮次 3 示例)

在用户轮次 3 中,所选轨迹包含 6 次非答案运行时交互:

  • j=0 至 j=4: 均为 parse_error,奖励为 0
  • j=5: 成功解析一个有效工具调用,包含 ticket_logincreate_ticket,调用奖励均为 1.0

正式信用分配语义

活跃模式: runtime_interaction_final

  • 同一 BFCL 用户轮次中成功解析的调用保持多重性拼接,并只匹配一次
  • 调用奖励按来源运行时交互回传
  • 未解析交互保持 P_j=[]r_j=0,但仍计入时间线
  • 折扣基于真实非答案运行时深度 jgamma=0.9
  • 局部peer共享 (group_uid, user_turn_id, runtime_interaction_index)
  • 使用无偏样本标准差进行 ragged 归一化
  • 融合公式: A_TW = A_RODS + A_local

特殊轨迹数值结果

text 即时奖励: [0, 0, 0, 0, 0, 1] 折现回报: [0.59049, 0.65610, 0.72900, 0.81000, 0.90000, 1.00000] peer支持数: [16, 16, 1, 1, 1, 1]

  • 固定分母进展奖励: R_P=0.8
  • 全局归一化优势: A_RODS=-0.4966976345

文件清单

文件 内容
data/raw_trajectories_update_2_512.jsonl 完整 512 条轨迹原始产物
data/multi_turn_base_156_rollout_offset_9.json 完整原始轨迹(含全部五轮 BFCL 用户交互)
analysis/user_turn3_k16_credit_summary.json K=16 全精度匹配、回报、归一化、融合及状态审计
analysis/user_turn3_k16_credit_summary.csv 每轨迹压缩摘要
analysis/user_turn3_k16_full_interaction_advantage.json 用户轮次 3 每个非答案运行时交互的结构化数据
analysis/user_turn3_k16_full_interaction_advantage.csv 精确的生产复现导出表

实现与求解器来源

  • 数值由当前冻结的 ToolWeave Stage-3 正式训练实现复现
  • 完整 pytest 套件、K=16 回归、解析错误令牌广播检查及确定性 CPU 训练器张量契约检查均已通过
  • 匹配求解使用 SciPy 的 linear_sum_assignment(..., maximize=True),而非 MatchTIR 的辅助函数
  • ToolWeave 是 MatchTIR 的改编实现,并非逐字复刻

安全性说明

  • 数据集中的凭据类字符串为 BFCL 合成基准测试固定装置,非真实生产凭据
  • 不包含任何 Hugging Face 令牌、GitHub 令牌、SSH 私钥、云访问密钥或本地服务器路径

上游背景

任务数据与执行环境源自公开的 AWorld-RL 基础设施和 Berkeley Function-Calling Leaderboard。MatchTIR 提供了局部信用分配的结构骨架,ToolWeave 的运行时深度与 BFCL 用户轮次适配为项目特有扩展。

搜集汇总
数据集介绍
ToolWeave-BFCL-Rollout-Case-Study 数据集图片
构建方式
该数据集源自ToolWeave项目在形式化训练更新2阶段产生的完整原始策略回滚工件,共计512条轨迹,由32个提示组各16次回滚构成。每条记录保留了运行时的消息序列、解析器与来源元数据、奖励记录、问题、真实标签及策略响应,确保了对训练过程的完整可追溯性。特别地,数据集选取了源自BFCL样本multi_turn_base_156的特定回滚,并附带其完整的五轮状态ful用户交互记录。构建过程中,严格遵循冻结的Stage-3形式化信用分配语义,采用运行时交互级别的时序轴,将解析失败与成功调用均纳入折扣计算,并通过确定性重放验证数值一致性。
使用方法
使用该数据集时,研究者可加载原始JSONL轨迹文件以训练或评估强化学习代理,或利用附带的分析文件深入理解特定回滚的信用分配细节。重点在于遵循冻结的语义规范,将运行时交互序列作为时序轴,解析失败步骤视为零奖励时间步,成功调用则按真实调用匹配并散射奖励。K=16分析文件可用于验证局部优势与全局优势的计算,或作为测试集检验其他算法的一致性。数据集不适合直接作为监督微调数据,而应作为策略学习与信用分配研究的原始资源,其合成凭证信息仅作为基准测试固定装置,需注意安全边界。
背景与挑战
背景概述
ToolWeave-BFCL-Rollout-Case-Study数据集由Muradil-mamat-211团队于2023年创建,源自ToolWeave项目的形式化训练更新2,旨在探索基于强化学习的工具调用智能体在真实交互环境中的信用分配机制。该数据集包含512条完整原始轨迹,每条轨迹保留运行时消息、解析器元数据及奖励记录,为多轮工具调用场景提供了细致的梯度学习信号。其核心研究问题聚焦于'运行时交互深度'对信用分配的影响,以及如何在存在解析失败和自纠正的噪声数据中提取稳定、可复现的训练目标。该数据集在工具调用强化学习领域具有方法创新意义,为后续研究提供了可复现的基准和对比框架。
当前挑战
该数据集面临的挑战主要来自两方面:一是多轮工具调用任务中,轨迹常包含解析错误、无效调用和状态错位,导致奖励稀疏且非平稳,信用分配需在时序深度上精准定位有效动作,同时避免因早期失误引发累积效应;二是构建过程中,需保持原始环境的高保真度,需在奖励计算中排除人为规则干扰,并通过确定性审计确保生产实现与学术方法(如MatchTIR)一致,这在处理长尾复杂交互时尤为艰巨。此外,数据规模较小(512条轨迹)限制了统计功效,而raw trajectory的噪声属性也要求研究者具备精细化的数据清洗和信号提取能力。
常用场景
经典使用场景
ToolWeave-BFCL-Rollout-Case-Study数据集作为强化学习训练原始轨迹的精品案例,在工具调用与智能体对齐研究领域具有标杆价值。其核心使用场景聚焦于对策略网络在函数调用基准上的在线学习过程进行细粒度解构,尤其针对多轮交互中解析失败、自纠错等复杂动态。研究者可借此剖析同轨策略下十六次并行采样如何通过运行时深度折扣与归一化实现信用分配,进而验证奖励塑形算法在稀疏反馈环境中的有效性。该数据集为评估工具调用智能体的鲁棒性、探索能力及时间一致性提供了不可多得的真实原始素材。
解决学术问题
该数据集深刻回应了工具增强语言模型在强化学习框架下面临的时序信用分配与稀疏奖励归因难题。传统方法多依赖最终任务成功率作为整体反馈,难以准确溯源多轮对话中每个中间动作的贡献。此数据集通过记录完整运行时交互、解析错误及成功调用的逐步回报,使得细粒度临时差分分析成为可能。它支撑了关于状态追踪、局部优势估计以及群体对比归一化等核心问题的实证研究,推动了基于过程监督的强化学习算法在函数调用场景下的理论完善,为破解环境交互延迟与策略更新偏差提供了关键实验依据。
实际应用
在实际工业应用中,该数据集为构建可靠的企业级智能体系统提供了不可多得的调试与优化参考。开发者可依据其记录的轨迹特征,识别模型在复杂多步API调用中常见的解析故障模式,从而针对性提升工具调用的容错机制。数据集中包含的交通预订、客户支持等模拟场景,为电商、旅游服务平台的自动化客服与流程编排技术研发提供仿真环境。此外,其确定的K=16组对照分析和冻结的正式训练框架,可直接用于CI/CD流程中强化学习策略回归测试,保障智能体在版本迭代中的行为稳定性和安全性。
数据集最近研究
最新研究方向
ToolWeave-BFCL-Rollout-Case-Study数据集聚焦于强化学习在工具调用智能体训练中的前沿探索,特别是通过原始在线策略轨迹的发布,深入剖析运行时交互的信用分配机制。该数据集以BFCL多轮基准为背景,揭示了在正式训练更新中,智能体如何经历解析失败与自我纠错的过程,并创新性地引入基于真实运行时深度的折扣回报计算与K=16的确定性同行优势归一化方法,旨在优化复杂工具调用场景下的学习信号。这一研究对于推动具身智能体在动态环境中的自适应决策、增强对状态可变任务的鲁棒性具有关键意义,并为可复现的智能体强化学习研究提供了宝贵数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务