遇见数据集

FlowBench

收藏
Hugging Face2026-07-01 更新2026-07-02 收录
官方服务:

资源简介:

FlowBench是一个用于评估智能代理在组合使用Python工具解决商业运营问题方面能力的基准测试数据集。数据内容围绕模拟的商业实体生成,包括客户、产品、订单、退货、库存、支持工单、外汇汇率和服务等级协议(SLA)政策。数据集包含300个无标准答案的任务规范,分为6个深度级别(从1到6级,每个级别50个任务),涵盖从单步查询到多步复杂工作流的多种场景。任务进一步归属于12个不同的任务族,每个族有25个任务。数据以JSONL格式提供,每条记录包含任务ID、深度、所属族、指令、答案格式及相关参数,但不包含黄金标准答案。底层数据通过确定性代码在内存中生成,确保跨机器运行的一致性。该数据集适用于研究和评估不同代理接口在表达相同工具能力时的表现,主要用于任务检查、代理集成和可复现的冒烟测试。

FlowBench is a benchmark dataset designed to evaluate the ability of intelligent agents to combine Python tools for solving business operation problems. The data content is generated around simulated business entities, including customers, products, orders, returns, inventory, support tickets, foreign exchange rates, and service level agreement (SLA) policies. The dataset contains 300 task specifications without standard answers, divided into 6 depth levels (from level 1 to 6, with 50 tasks per level), covering various scenarios from single-step queries to multi-step complex workflows. Tasks are further categorized into 12 different task families, each with 25 tasks. The data is provided in JSONL format, with each record containing task ID, depth, family, instruction, answer format, and related parameters, but explicitly excluding gold standard answers. The underlying data is generated in memory via deterministic code to ensure consistency across machines. This dataset is suitable for researching and evaluating the performance of different agent interfaces when expressing the same tool capabilities, primarily used for task inspection, agent integration, and reproducible smoke testing.

创建时间:
2026-07-01
原始信息汇总

FlowBench 数据集概述

FlowBench 是一个面向确定性业务流程的工具使用基准测试(tool-use benchmark),其数据集 ID 为 jwu323/FlowBench。每个任务要求智能体(agent)基于合成数据(客户、产品、订单、退货、库存、支持工单、外汇汇率和 SLA 政策)组合调用 Python 工具来完成。

数据集属性

  • 许可证:MIT
  • 任务类型:问答、文本生成
  • 语言:英语
  • 数据集大小:小于 1K 样本
  • 标签:agents, tool-use, benchmark

数据划分

公开版本仅包含 test 划分,共 300 个任务,按任务深度分为 6 个层级:

深度 任务数 描述
1 50 单步查询(如区域货币、畅销产品 ID)
2 50 过滤后的订单和客户计数
3 50 收入和退款率聚合
4 50 本地货币转换及退款后利润计算
5 50 补货短缺和延迟订单收入工作流
6 50 延迟履行及 SLA 违规风险收入

所有任务按 12 个任务家族分布,每个家族 25 个任务。

数据文件

  • data/test.jsonl:无答案的任务记录,每条记录包含 task_iddepthfamilyregioncategorymonth_startmonth_endinstructionanswer_format
  • tools/flowbench_tools.py:确定性工具实现,智能体可直接调用。
  • harbor/:Harbor 兼容的公共任务包,包含形状验证器(非正式评分)。
  • RUN.md:将数据连接到 LLM 智能体并生成预测文件的说明。

数据生成方式

无外部数据源。数据由 tools/flowbench_tools.py 在导入时通过 SHA-256 确定性生成内存表(72 个客户、48 个产品、720 个订单、180 个退货、260 个支持工单等)。相同文件在不同机器上生成相同数据。

任务家族(共 12 个)

  • currency_lookup
  • top_product_lookup
  • order_count
  • unique_customer_count
  • net_revenue_usd
  • refund_share_bp
  • local_net_revenue
  • margin_after_refunds
  • reorder_shortfall
  • delayed_net_revenue
  • delay_sla_burden
  • breached_ticket_revenue

使用说明

  • 智能体运行:为智能体提供一条任务记录(来自 data/test.jsonl),仅暴露 tools/flowbench_tools.py 中的函数,要求智能体按照 answer_format 返回最终答案。
  • 推荐预测格式{"task_id": "...", "answer": "...", "model": "..."}
  • Harbor 烟雾测试:运行 harbor run -p harbor -a <agent> -l 1,仅检查输出形状而非正确性。

评分说明

公开版本不包含标准答案或严格验证器。正式评分需使用私有评估器或生成新的留出测试集。

搜集汇总
数据集介绍
FlowBench 数据集图片
构建方式
FlowBench是一个专为评估确定性业务操作工作流中工具使用能力而设计的基准测试数据集。其构建方式独具匠心:数据并非来源于独立的CSV文件、数据库或网络服务,而是通过SHA-256密钥生成器在工具模块——即`tools/flowbench_tools.py`——内部以确定性的方式构建而成。当该模块被导入时,会自动在内存中生成涵盖72位客户、48件商品、720份订单、180笔退货、260张支持工单以及汇率、库存和服务等级协议策略等在内的综合表格。无论是通过标准运行时还是Harbor容器环境,相同的任务与工具文件均会在任何机器上生成完全一致的数据,确保了测试的可复现性与公平性。
特点
该数据集的特点在于其精巧的结构与层次化的难度设计。`test`子集包含300个公开任务说明,按照深度(depth)从1到6分为六个层级,涵盖从简单的单步查询(如区域货币查找)到复杂的多步工作流(如延迟履约结合SLA违规风险评估的收益计算)等12个任务家族。每个任务家族有25个任务,任务记录包含了明确的指令与答案格式要求,但刻意不包含黄金答案。这种设计使得FlowBench成为一个闭世界且确定性的基准,特别适合用于比较不同智能体界面(如函数调用式、命令式、代码/REPL式)表达相同工具能力的差异。
使用方法
使用FlowBench时,研究者需将任务记录中的指令与参数提供给智能体,并仅暴露工具模块中列出的函数作为API。智能体通过调用这些内置工具来解决问题,最终输出必须严格遵循`answer_format`指定的格式,例如`{"task_id":"...","answer":"USD","model":"..."}`。公开子集不包含正确答案,因此官方评估应使用私有评分器或生成带有隐藏答案的保留子集。此外,该数据集兼容Harbor流程编排工具,可通过`harbor run`命令运行烟雾测试包,该包仅验证输出的形状是否符合预期,确保在没有泄露答案的前提下进行集成测试与复现性验证。
背景与挑战
背景概述
在人工智能与软件工程交叉领域,工具调用能力是衡量大语言模型(LLM)执行复杂业务操作的关键维度。由研究人员Jwu等人于2024年创建的FlowBench数据集,专为评估和比较LLM代理在确定性业务运营工作流中的工具编排能力而设计。该数据集依托Harbor平台,通过SHA-256确定性生成器构建包含72个客户、48种产品、720个订单等合成业务实体,形成12个任务族共300个测试样本,覆盖从单步查找到六步延迟履约与SLA违约计算的递进式复杂度场景。其核心研究问题在于:不同代理接口范式(函数调用、命令式、代码REPL样式)如何在调用相同工具集时表现差异,为工具使用基准测试树立了全新标准。FlowBench的出现填补了业务操作自动化基准中缺乏可复现、闭世界确定性工具的空白,对LLM代理系统的能力评估与接口设计具有重要推动作用。
当前挑战
FlowBench所面临的挑战首先源于其解决的领域问题:如何精准衡量LLM代理在构成现实业务流程的确定性工具编排中的表现。不同于开放式问答,此类任务要求代理理解多步依赖关系(如货币换算后计算退款利润率),且工具输出必须严格符合业务逻辑与格式规范,对代理的规划准确性与执行合规性构成极高要求。其次,数据集构建本身面临显著挑战:为确保基准的封闭性与公平性,设计者必须将所有业务表(订单、客户、汇率等)完全嵌入工具文件中,并通过SHA-256生成器保证跨平台确定性,这要求数据生成逻辑既能覆盖边界案例(如延迟订单的分阶段收入)又不引入噪声。此外,避免答案泄露与支持私密评估的矛盾迫使测试集舍弃黄金标签,转而依赖私有评估器或隐藏答案的保留集,对社区复现与横向比较增加了门槛。
常用场景
经典使用场景
在智能体(Agent)与工具调用(Tool-use)研究领域,FlowBench被设计为一个面向确定性业务流程的标准基准测试。其核心使用场景是评估大语言模型驱动的智能体在复杂业务操作工作流中,基于Python工具函数完成多步推理与决策的能力。任务涵盖从单步查询到涉及货币换算、退款率计算、库存补货与SLA违约损失分析等多步骤聚合操作,深度从1至6逐步递增,全面衡量智能体在真实业务逻辑环境下的工具编排与问题解决水平。
衍生相关工作
FlowBench的发布已催生了一系列衍生研究工作,包括但不限于:基于其确定性数据生成框架构建的强化学习微调环境,用于训练智能体在多步工作流中的工具选择与排序策略;不同提示工程范式(如Chain-of-Thought与ReAct框架)在FlowBench任务上的系统性对比分析;以及针对延迟敏感型业务流程的智能体鲁棒性测试方案。此外,数据集的Harbor兼容性设计也促进了可控实验平台与私有评分协议的发展,为后续跨智能体系统比较基准的统一奠定了基础。
数据集最近研究
最新研究方向
FlowBench聚焦于评估智能体在确定性业务流程中编排工具的能力,代表了工具学习与智能体评估领域的前沿方向。该基准通过模拟涵盖货币查询、产品检索、订单统计、收入计算及SLA违约风险等12个任务族、6层深度的业务流程,为研究多步骤工具调用、数据编排与确定性推理提供了标准化测试平台。其基于SHA-256密钥生成的确定性数据与公开无答案设计,不仅确保了评估的公正性与可重复性,更推动了智能体在函数调用、命令执行与代码生成等不同接口范式下的对比研究。当前,随着大语言模型在自动化运维、企业流程优化等热点场景中广泛应用,FlowBench为衡量智能体处理复杂业务编排任务的能力树立了标杆,对探索智能体在工业级系统中的应用潜力具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务