遇见数据集

ThinkingBox-Bench

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

ThinkingBox-Bench 是一个可执行的基准测试,用于评估使用工具的 LLM 智能体是否能够可靠地完成有状态的业务流程。版本 1.0 包含 507 个工具-智能体-用户任务,涵盖零售与电子商务、旅游与酒店、汽车保险、数字银行支持以及咨询 IT/HR 支持领域。该数据集仓库提供了基准测试的可浏览表示形式,而可执行基准测试、工具服务器和支持组件则托管在 GitHub 的 `microsoft/thinkingbox-data` 仓库中。数据集包含三个子集:`tasks`(507 行,包含用户目标、初始状态补丁、预期工具交互和评分标准)、`scenarios`(5 行,包含共享世界状态和可用工具,通过 `scenario_id` 关联)和 `agents`(1 行,包含智能体指令和内置工具)。每个任务字段包括 `task_ref`(规范标识符)、`domain`(领域)、`scenario_id`(场景链接键)、`query`(模拟用户的初始请求)、`user_context`(模拟用户的指令和事实)、`initial_state_patch_json`(初始状态补丁)、`expected_tool_interactions_json`(黄金工具调用序列)、`rubrics_json`(额外响应要求)、`source_url`(GitHub 源链接)和 `release_tag`(发布版本标签)。评估时,通过场景的 MCP 服务器创建数据库,应用初始状态补丁,重放预期工具交互来生成黄金状态,并与智能体修改后的数据库哈希进行比较。该基准测试专用于评估,禁止将其内容用于提示优化、微调、强化学习、奖励模型训练或其他模型优化。数据集采用 Community Data License Agreement - Permissive - Version 2.0 许可证。

ThinkingBox-Bench is an executable benchmark for evaluating whether LLM agents using tools can reliably complete stateful business processes. Version 1.0 contains 507 tool-agent-user tasks covering domains such as retail and e-commerce, travel and hospitality, auto insurance, digital banking support, and consulting IT/HR support. The dataset includes three subsets: tasks (507 rows with user goals, initial state patches, expected tool interactions, and rubrics), scenarios (5 rows with shared world state and available tools), and agents (1 row with agent instructions and built-in tools). Each task has fields including task_ref, domain, scenario_id, query, user_context, initial_state_patch_json, expected_tool_interactions_json, rubrics_json, source_url, and release_tag. Evaluation involves creating a database via the scenarios MCP server, applying initial state patches, replaying expected tool interactions to generate a golden state, and comparing with the agents modified database hash. The benchmark is intended solely for evaluation and is prohibited from being used for model optimization. It is licensed under the Community Data License Agreement - Permissive - Version 2.0.

提供机构:
Microsoft
创建时间:
2026-08-25
原始信息汇总

ThinkingBox-Bench 数据集概述

基本信息

  • 数据集名称: ThinkingBox-Bench
  • 语言: 英语
  • 许可证: CDLA-Permissive-2.0
  • 任务类别: 强化学习(Reinforcement Learning)
  • 标签: agent、tool-use、benchmark、evaluation

数据集简介

ThinkingBox-Bench 是一个可执行的基准测试集,用于评估使用工具的 LLM 代理能否可靠地完成有状态的业务流程。版本 1.0 包含 507 个工具-代理-用户任务,涵盖以下领域:

  • 零售与电子商务
  • 旅游与酒店业
  • 汽车保险
  • 新型银行支持
  • 咨询 IT/人力资源支持

数据集结构

数据集包含三个子集:

子集 行数 内容
tasks 507 用户目标、初始状态补丁、预期工具交互和评分规则
scenarios 5 共享世界状态和可用工具,通过 scenario_id 关联
agents 1 代理指令和内置工具

每个任务通过 scenario_id 引用其共享场景。任务状态和预期交互被序列化为 JSON 字符串以便于浏览和传播。

任务字段说明

字段 描述
task_ref 来自发布测试列表的标准 file.py:function_name 标识符
domain 可读的基准测试领域
scenario_id 连接任务与 scenarios 子集中共享行的键
query 模拟用户发送的初始请求
user_context 提供给模拟用户的指令和事实
initial_state_patch_json 任务开始前应用于场景基础世界状态的 JSON 对象
expected_tool_interactions_json 定义预期状态变化的有序黄金工具调用
rubrics_json 适用于特定任务的附加响应要求
source_url 包含可执行测试定义的带标签 GitHub 源代码
release_tag 用于生成该行的不可变 thinkingbox-data 发布版本

评估机制

数据集不存储预计算的预期最终状态。在评估过程中:

  1. 场景的 MCP 服务器创建一个新的数据库
  2. 应用 initial_state_patch_json
  3. 重放 expected_tool_interactions_json 以生成 golden_db_state(黄金数据库状态)
  4. 将该状态的稳定哈希值与代理修改后的数据库哈希值进行比较

这一运行时过程确保了预期状态使用与代理尝试相同的工具实现和数据库语义。

预期用途

ThinkingBox-Bench v1.0 仅用于评估禁止将任务内容、预期结果、黄金状态或工具轨迹用于提示优化、微调、强化学习、奖励模型训练或其他模型优化。

运行方式

Parquet 表仅用于浏览和分析,并非可执行运行时。如需运行全部 507 个任务,请按照 ThinkingBox-Bench v1.0 指令 安装 ThinkingBox,启动所需服务并运行任务。

可执行基准测试、工具服务器和支持文件维护在 microsoft/thinkingbox-data GitHub 仓库中。为确保可复现性,请使用 thinkingbox-bench-v1.0 发布版本。

搜集汇总
数据集介绍
ThinkingBox-Bench 数据集图片
构建方式
面向工具调用型智能体在状态化业务工作流中可靠性评估的迫切需求,ThinkingBox-Bench的构建遵循可执行基准的范式,将任务定义与运行时环境解耦。其数据体系由三个子集构成:tasks子集涵盖507项工具—智能体—用户交互任务,横跨零售与电商、旅行与酒店、汽车保险、数字银行支持及咨询IT/HR支持五大领域;scenarios子集提供五项共享世界状态与可用工具定义,经由scenario_id与任务关联;agents子集则收录智能体指令及其内置工具。每项任务以JSON字符串形式序列化初始状态补丁、期望工具交互序列及评分细则,并关联至可执行测试定义与不可变发布标签,从而确保数据可溯源、可复现。
特点
该基准的核心特质在于其运行时验证机制所赋予的可靠性与一致性。数据集并不存储预计算的期望终态,而是由场景对应的MCP服务器在评估时动态创建全新数据库,先应用initial_state_patch_json,再重放expected_tool_interactions_json以物化golden_db_state,最终将评估智能体所修改数据库的稳定哈希与该基准状态哈希进行比对。这一设计保证了期望状态与智能体尝试使用同一套工具实现和数据库语义,规避了静态快照可能引入的偏差。数据集以Parquet格式提供可浏览表示,嵌套状态与交互信息以JSON字符串承载,兼顾可读性与可移植性。
使用方法
ThinkingBox-Bench v1.0专供评估用途,严禁将其任务内容、期望结果、黄金状态或工具轨迹用于提示优化、微调、强化学习、奖励模型训练或其他模型优化目的。Parquet表仅用于浏览和分析,并非可执行运行时;使用者需依据ThinkingBox-Bench v1.0说明安装ThinkingBox、启动所需服务并运行全部507项任务。为确保可复现性,应使用thinkingbox-bench-v1.0发布版本,并通过scenario_id将任务与共享场景关联,在模拟用户与工具服务器的交互中完整执行状态化工作流。
背景与挑战
背景概述
大语言模型智能体从静态知识问答迈向动态环境交互,其工具调用能力在真实业务场景中的可靠性成为关键瓶颈。既有评测多聚焦单步任务或孤立工具调用,难以刻画跨多轮、多工具协同的有状态工作流。为此,微软研究团队于2026年推出ThinkingBox-Bench v1.0,涵盖零售电商、旅行酒店、汽车保险、数字银行及咨询IT/HR五大领域,包含507个工具-智能体-用户三元任务,通过可执行沙箱重放黄金工具轨迹并比对数据库状态哈希,为有状态业务流程中的智能体可靠性评测提供了新范式。
当前挑战
该数据集所应对的核心挑战在于有状态业务工作流中智能体可靠性的评估,此类任务需在多轮交互中保持全局状态一致,任何中间步骤的工具调用偏差都可能引发状态漂移,导致最终结果与预期背离。构建过程中,研究团队需为每个任务设计初始状态补丁与有序黄金工具交互序列,并确保场景数据库语义与工具实现严格对齐;同时,跨五大领域的任务需兼顾领域多样性与现实复杂性,而禁止将任务内容用于模型微调或强化学习优化,则对评测的公平性与泛化性提出了更高要求。
常用场景
经典使用场景
在工具增强型语言模型智能体的评测研究中,ThinkingBox-Bench构筑了一个可执行的有状态业务工作流沙箱,其经典使用场景在于考察智能体能否在多轮人机交互中稳定调用外部工具、维护数据库状态并达成用户目标。该基准覆盖零售与电商、旅行与酒店、汽车保险、数字银行支持以及咨询IT与人力资源支持五大领域,共含507项工具—智能体—用户协同任务。每项任务均以模拟用户初始请求为起点,智能体需在共享世界状态中依序执行预期工具调用,最终以数据库状态哈希比对判定任务成败,从而为智能体可靠性评估提供了标准化、可复现的实验范式。
衍生相关工作
ThinkingBox-Bench的发布催生了一系列围绕有状态智能体评测的后续研究。其配套论文《One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows》系统阐述了可靠性度量框架,成为该领域的重要参考文献。基于该基准,研究者进一步探索了多轮工具调用中的错误传播机制、状态一致性约束下的规划算法以及面向业务工作流的智能体鲁棒性提升策略。同时,基准所提供的可执行沙箱与金标准工具轨迹也为奖励建模、过程监督与智能体微调等方向提供了可复用的实验基础设施,推动了工具增强型智能体研究从孤立任务向端到端业务流程的纵深发展。
数据集最近研究
最新研究方向
在工具增强型大语言模型智能体加速渗透企业级自动化流程的当下,对其实施可靠性的严格评估已成为强化学习与智能体研究领域的核心关切。ThinkingBox-Bench立足有状态商业工作流这一复杂场景,覆盖零售电商、旅行酒店、汽车保险、数字银行及咨询IT/HR支持五大领域,通过507项工具—智能体—用户交互任务,构建起可执行评估框架。该数据集的前沿研究聚焦于智能体能否在动态数据库状态、多轮工具调用与用户意图协同中保持稳定表现,而非仅追求单次任务成功率,由此揭示可靠性与泛化能力之间的张力。这一基准的发布直接回应了工业界对智能体在真实业务流程中部署可信度的迫切需求,为强化学习策略优化、工具使用轨迹分析及多智能体协作评估提供了可复现的基准平台,对推动智能体从实验室演示走向生产级应用具有关键的规范与导向意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务