遇见数据集

FlowBench-GPT55-Traces

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

FlowBench GPT-5.5 Agentic Traces 是一个专为FlowBench设计的训练和分析配套数据集,核心内容是在重新生成的FlowBench风格任务上,由`gpt-5.5`模型产生的正确、真实的多轮REPL-submit交互轨迹。该数据集不作为FlowBench的评估基准、排行榜分割或新的轨迹基准声明,而是旨在支持智能体工具使用能力的训练与调试。数据集包含1032条完整轨迹,共计5606个轮次级别的监督微调(SFT)示例,所有轨迹均被验证为最终答案正确。数据构建使用了与FlowBench公开测试集不相交的加盐合成工具数据和参数窗口,并排除了诊断性的`currency_lookup`家族,以确保不污染正式的FlowBench评估流程。任务复杂度较高,专注于深度为4到6的复杂多轮交互,涵盖六个不同的财务计算任务家族(如breached_ticket_revenue、delay_sla_burden等),所有任务均属于高复杂度带。数据集提供多种结构化视图,包括原始的多轮REPL-submit片段记录(含任务指令、完整交互轮次序列、最终答案和标准答案)、专为训练“下一个动作”策略而提取的轮次级别SFT示例(含输入文本、目标动作代码等),以及符合ShareGPT格式的对话数据,便于轨迹模仿或分析。数据文件明确区分了训练集(`train`,916条)和重新生成的验证集(`regenerated_validation`,116条)。该数据集主要用于对语言模型或智能体进行监督微调,以学习在复杂、多步骤的工具调用环境中进行推理和行动,也可用于分析多轮交互轨迹的格式或调试REPL风格的工具使用行为。使用者需严格遵守数据使用边界,不得将数据集中的任何信息(尤其是再生的标准答案)用于构建FlowBench的评估提示或参与其公开排行榜。

FlowBench GPT-5.5 Agentic Traces is a training and analysis companion dataset specifically designed for FlowBench. Its core content consists of correct and authentic multi-turn REPL-submit interaction traces generated by the `gpt-5.5` model on regenerated FlowBench-style tasks. This dataset is explicitly not intended as an evaluation benchmark, leaderboard split, or new trace benchmark declaration for FlowBench, but rather aims to support the training and debugging of agent tool usage capabilities. The dataset contains 1032 complete traces, totaling 5606 turn-level supervised fine-tuning (SFT) examples, all verified as having correct final answers. The data is meticulously constructed using salted synthetic tool data and parameter windows disjoint from the FlowBench public test set, and excludes diagnostic `currency_lookup` families to ensure it does not contaminate the formal FlowBench evaluation process. Task complexity is high, focusing on complex multi-turn interactions with depths of 4 to 6, covering six different financial calculation task families (e.g., breached_ticket_revenue, delay_sla_burden, etc.), all of which belong to the high complexity band. The dataset provides multiple structured views to accommodate different uses: raw multi-turn REPL-submit fragment records (including task instructions, complete interaction turn sequences, final answers, and standard answers); turn-level SFT examples extracted for training the next action strategy (including input text, target action code, etc.); and conversation data in ShareGPT format for trace imitation or analysis. The data files clearly distinguish between the training set (`train`, 916 traces) and the regenerated validation set (`regenerated_validation`, 116 traces). This dataset is primarily used for supervised fine-tuning of language models or agents to learn reasoning and action in complex, multi-step tool-calling environments, and can also be used for analyzing multi-turn interaction trace formats or debugging REPL-style tool usage behaviors. Users must strictly adhere to data usage boundaries and must not use any information from the dataset (especially regenerated standard answers) to construct FlowBench evaluation prompts or participate in its public leaderboard.

创建时间:
2026-07-03
原始信息汇总

数据集概述

数据集名称: FlowBench GPT-5.5 Agentic Traces
数据集ID: jwu323/FlowBench-GPT55-Traces
许可证: MIT
语言: 英语
任务类别: 问答、强化学习
标签: agents, tool-use, traces, synthetic-data, flowbench
数据集规模: 1,000 < 行数 < 10,000

数据集用途

该数据集是FlowBench的训练与分析配套资源。包含由gpt-5.5模型生成的正确、多轮REPL-submit轨迹数据,用于监督微调、轨迹格式分析或调试REPL风格的工具使用。注意

  • 不是FlowBench评估基准、排行榜拆分或新的轨迹基准。
  • 不是官方FlowBench公开测试集。
  • 不应用于FlowBench评估提示、公开测试评分或排行榜。

数据污染边界

  • 任务使用加盐的合成工具数据和参数窗口,与FlowBench公开的300个任务拆分不重叠。
  • 发布版本包含trainregenerated_validation两个拆分,两者参数窗口也不重叠。
  • 记录中包含重新生成的黄金答案和模型最终答案,因此不得混入FlowBench评估提示或评估标签来源。
  • 排除了currency_lookup系列任务。
  • 工具模块函数名和签名与FlowBench一致,但使用不同的合成数据。
  • 聚焦深度4-6的任务,因为复杂的多轮轨迹对工具使用训练更有价值。

数据内容

  • 总行数: 1032
  • 回合级SFT示例数: 5606
  • 正确模型轨迹: 1032/1032
  • 源尝试次数: 收集1070次,发布前过滤掉38次(35次最终答案错误,3次因其他过滤条件失败)
  • 模型: gpt-5.5
  • 轨迹数据盐值: flowbench-agentic-traces-gpt55-20260702
  • 轨迹形态: 真正的多轮REPL-submit片段。每条记录包含多个Action轮次、轮次间的观测、持久变量以及最终的submit(value)轮次。

数据拆分

  • regenerated_validation: 116条
  • train: 916条

任务系列(Families)

系列名称 数量
breached_ticket_revenue 176
delay_sla_burden 152
delayed_net_revenue 171
local_net_revenue 179
margin_after_refunds 178
reorder_shortfall 176

深度分布(Depths)

深度 数量
depth 4 357
depth 5 347
depth 6 328

复杂度带

  • 所有记录均属于high复杂度带(1032条)。

工具调用复杂度(Tool-call complexity)

  • depth 4: 均值27.9,中位数21.0,最大值177
  • depth 5: 均值8.6,中位数5.0,最大值45
  • depth 6: 均值13.6,中位数12.0,最大值51
  • 工具调用最多的任务系列:
    • margin_after_refunds: 均值35.4,最大值177
    • local_net_revenue: 均值20.5,最大值66
    • breached_ticket_revenue: 均值15.4,最大值51
    • delayed_net_revenue: 均值13.1,最大值45
    • delay_sla_burden: 均值11.4,最大值22

文件列表

文件 说明
data/train.jsonl 重新生成训练任务的模型轨迹
data/regenerated_validation.jsonl 重新生成验证任务的模型轨迹
data/turns_train.jsonl 从训练片段中提取的回合级下一动作SFT示例
data/turns_regenerated_validation.jsonl 从验证片段中提取的回合级下一动作SFT示例
data/sharegpt_episodes_train.jsonl ShareGPT格式的完整多轮回合对话(训练)
data/sharegpt_episodes_regenerated_validation.jsonl ShareGPT格式的完整验证回合对话
data/sharegpt_turns_train.jsonl ShareGPT格式的回合级SFT对话(训练,含所有轮次)
data/sharegpt_turns_regenerated_validation.jsonl ShareGPT格式的回合级SFT对话(验证)
data/sharegpt_turns_clean_train.jsonl 去除错误目标及错误上下文轮次后的默认ShareGPT SFT行(推荐用于微调)
data/sharegpt_turns_recovery_train.jsonl 用于恢复训练的ShareGPT行(提示紧接前一次REPL错误,目标是后续恢复动作)
tools/flowbench_tools.py 加盐的确定性工具实现
metadata/schema.json 记录模式定义
metadata/tool_catalog.json 工具签名和描述
metadata/task_manifest.json 重新生成的参数窗口和拆分计数
metadata/quality_report.json 发布计数、轮次/工具调用统计及泄漏边界总结
examples/load_turn_sft.py 本地加载器示例(默认打印清洁的ShareGPT下一动作记录)

记录结构

每条JSONL记录包含以下字段:

  • task: 重新生成的任务指令和参数
  • turns: 捕获的REPL-submit片段。每个轮次存储:档案助手消息、解析后的action_code、观测、是否已提交、执行过的工具调用
  • trace_protocol: 固定为multiturn
  • final_answer, gold_answer, is_correct: 回合后标签(用于过滤和分析)
  • tool_call_count, unique_tool_count, complexity_band: 派生元数据
  • runtime_error_turn_count, has_runtime_error: 恢复标记
  • usage: 提供商令牌计数(如有)

监督训练推荐用法

  • 默认微调: 优先使用data/sharegpt_turns_clean_train.jsonl
  • 恢复训练: 使用data/sharegpt_turns_recovery_train.jsonl
  • 轨迹模仿与分析: 使用完整的ShareGPT回合文件(data/sharegpt_episodes_*.jsonl
  • 选择更难样本: 可按系列、tool_call_countunique_tool_count或运行时错误标记进行过滤
  • 注意事项:
    • 训练时不应将gold_answerfinal_answeris_correct放入模型提示中
    • 完整的ShareGPT回合对话中,历史人类观测消息可能包含中间计算结果,使得最终submit(...)目标变得简单,因此不应用其训练最终答案预测
    • 所有发布的记录均为深度4-6的高复杂度行
搜集汇总
数据集介绍
FlowBench-GPT55-Traces 数据集图片
构建方式
FlowBench-GPT55-Traces数据集源自FlowBench框架,旨在为工具使用场景下的多轮交互代理提供训练与分析数据。其构建过程基于gpt-5.5模型,在FlowBench风格的重构任务上进行了1070次尝试,经过严格筛选,最终保留1032条正确轨迹。这些轨迹采用加盐的合成工具数据,并通过参数窗口与公开的FlowBench评估集隔离,确保无数据泄漏。数据集包含916条训练样本和116条验证样本,覆盖六大任务族,深度范围为4至6,所有样本均标记为高复杂度。每条轨迹以多轮REPL提交形式呈现,记录完整的行动、观察、持久变量和最终提交操作。
使用方法
使用该数据集时,推荐优先采用data/sharegpt_turns_clean_train.jsonl文件进行常规监督微调,该文件移除了产生错误的操作和目标,适用于标准的工具使用策略学习。对于需要训练错误恢复能力的场景,可选用data/sharegpt_turns_recovery_train.jsonl,其输入紧接上一个REPL错误,目标是后续的正确恢复动作。在构建训练数据时,应避免将黄金答案、最终答案或正确性标签纳入模型提示中,除非旨在训练仅输出答案的模型。用户还可以通过筛选任务族、工具调用次数、唯一工具数或运行时错误标记,进一步定制训练样本的难度与特性。
背景与挑战
背景概述
FlowBench-GPT55-Traces数据集由研究团队于2024年构建,旨在为多轮工具调用智能体的监督微调与轨迹分析提供高质量训练资源。该数据集基于FlowBench框架,利用GPT-5.5模型在合成的、经过盐值处理的工具环境中生成真实的REPL提交轨迹,涵盖深度4至6的复杂多轮交互任务。数据集包含1032条正确轨迹,并划分为训练集(916条)与再生验证集(116条),聚焦于高复杂度场景以增强工具使用策略的泛化能力。其发布为智能体轨迹学习领域提供了标准化且可复现的数据基础,推动了对话式人工智能中工具调用行为的系统研究。
当前挑战
该数据集面临的挑战体现在两个层面:在领域问题层面,它聚焦于解决智能体在复杂多轮交互中准确选择与调用工具的难题,特别是在高复杂度任务(如财务指标计算)中避免因信息不对称或推理错误导致的失败轨迹。在构建过程中,团队需应对合成数据污染的防范问题,通过盐值参数窗口确保与公开的FlowBench评估集完全隔离;同时,需处理轨迹收集中的过滤机制,从1070次尝试中剔除35条错误答案及3条不符合释放标准的数据,以保证训练样本的正确性。此外,工具调用复杂度分布不均(如margin_after_refunds家族平均调用35.4次),增加了平衡训练难度与覆盖度的挑战。
常用场景
经典使用场景
在多轮交互式工具使用与智能体轨迹学习领域,FlowBench-GPT55-Traces数据集以其高质量的GPT-5.5轨迹数据,为研究者提供了宝贵的训练与分析资源。该数据集收录了超过1000条完整的、经过正确性验证的多轮REPL-提交式交互轨迹,每条轨迹均包含动作序列、环境观测、持久化变量以及最终提交操作。这些轨迹被精心组织为逐轮动作预测的监督微调样本,使得在复杂的工具调用场景中训练语言模型的策略成为可能。特别地,该数据集聚焦于深度4至6的高复杂度任务,这些任务需要模型在多个回合中交替调用工具、解析观测结果并制定下一步行动策略,从而模拟了真实世界中智能体面对的富有挑战性的决策环境。
解决学术问题
该数据集的核心学术贡献在于为工具使用智能体的学习与评估提供了严格的污染边界与透明的数据管理方案。研究者在训练工具使用策略时,常常面临训练数据与评估基准之间潜在的泄露风险,导致模型性能被高估。FlowBench-GPT55-Traces通过使用加盐的合成数据与独立于公开测试集的参数窗口,确保了训练分裂与验证分裂之间的严格隔离,从而解决了跨数据集污染这一困扰该领域的难题。此外,该数据集提供的逐轮样本明确区分了输入上下文与目标动作,避免了传统完整轨迹训练中因前期观测信息泄露导致最终答案预测任务退化为简单映射的问题,推动了更为严谨、可复现的智能体学习评价体系的发展。
实际应用
在实际应用中,FlowBench-GPT55-Traces为构建和优化能够执行复杂多步任务的自动化智能体提供了高质量的训练素材。例如,在金融领域的收入分析场景中,智能体需要接连调用数据查询、计算汇总等工具来解决“基于阈值检测的收入异常”或“动态库存缺货评估”等业务问题。该数据集中的“breached_ticket_revenue”、“delay_sla_burden”等六类任务家族恰好覆盖了这些典型场景。开发者可以利用其中丰富的逐轮交互样本,训练模型从错误中恢复、在多工具间灵活切换以及高效规划行动序列。特别是在“margin_after_refunds”这类高工具调用密度的任务中,模型学习到的长序列决策能力可直接迁移至处理大规模数据管道或复杂业务流程自动化等实践任务。
数据集最近研究
最新研究方向
FlowBench-GPT55-Traces数据集聚焦于大语言模型在复杂多轮工具调用场景下的监督微调与轨迹分析,其研究前沿紧密围绕智能体(agent)在REPL(读取-求值-打印-循环)环境中的真实交互轨迹建模。该数据集通过gpt-5.5生成的高质量深度4-6层多轮轨迹(共1032条正确轨迹),为研究工具使用策略、错误恢复机制以及参数化任务泛化提供了关键训练资源。近年来,随着智能体系统在实际应用中的爆发式增长,诸如自动驾驶、金融交易和软件开发等领域的复杂决策需求,使得多步工具调用与动态环境适应的能力成为热点。FlowBench-GPT55-Traces通过盐化(salted)合成数据和严格污染边界设计,确保了训练集与评估基准的隔离,从而推动了模型在避免数据泄露前提下实现更鲁棒的泛化。该数据集的发布不仅提升了工具使用监督微调(SFT)的可复现性,还为分析多轮交互中的错误传播与恢复行为提供了标准化基准,对智能体安全性和可靠性研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务