ThinkingBox-Bench
收藏资源简介:
ThinkingBox-Bench 是一个可执行的基准测试,用于评估使用工具的 LLM 智能体是否能够可靠地完成有状态的业务流程。版本 1.0 包含 507 个工具-智能体-用户任务,涵盖零售与电子商务、旅游与酒店、汽车保险、数字银行支持以及咨询 IT/HR 支持领域。该数据集仓库提供了基准测试的可浏览表示形式,而可执行基准测试、工具服务器和支持组件则托管在 GitHub 的 `microsoft/thinkingbox-data` 仓库中。数据集包含三个子集:`tasks`(507 行,包含用户目标、初始状态补丁、预期工具交互和评分标准)、`scenarios`(5 行,包含共享世界状态和可用工具,通过 `scenario_id` 关联)和 `agents`(1 行,包含智能体指令和内置工具)。每个任务字段包括 `task_ref`(规范标识符)、`domain`(领域)、`scenario_id`(场景链接键)、`query`(模拟用户的初始请求)、`user_context`(模拟用户的指令和事实)、`initial_state_patch_json`(初始状态补丁)、`expected_tool_interactions_json`(黄金工具调用序列)、`rubrics_json`(额外响应要求)、`source_url`(GitHub 源链接)和 `release_tag`(发布版本标签)。评估时,通过场景的 MCP 服务器创建数据库,应用初始状态补丁,重放预期工具交互来生成黄金状态,并与智能体修改后的数据库哈希进行比较。该基准测试专用于评估,禁止将其内容用于提示优化、微调、强化学习、奖励模型训练或其他模型优化。数据集采用 Community Data License Agreement - Permissive - Version 2.0 许可证。
ThinkingBox-Bench is an executable benchmark for evaluating whether LLM agents using tools can reliably complete stateful business processes. Version 1.0 contains 507 tool-agent-user tasks covering domains such as retail and e-commerce, travel and hospitality, auto insurance, digital banking support, and consulting IT/HR support. The dataset includes three subsets: tasks (507 rows with user goals, initial state patches, expected tool interactions, and rubrics), scenarios (5 rows with shared world state and available tools), and agents (1 row with agent instructions and built-in tools). Each task has fields including task_ref, domain, scenario_id, query, user_context, initial_state_patch_json, expected_tool_interactions_json, rubrics_json, source_url, and release_tag. Evaluation involves creating a database via the scenarios MCP server, applying initial state patches, replaying expected tool interactions to generate a golden state, and comparing with the agents modified database hash. The benchmark is intended solely for evaluation and is prohibited from being used for model optimization. It is licensed under the Community Data License Agreement - Permissive - Version 2.0.
ThinkingBox-Bench 数据集概述
基本信息
- 数据集名称: ThinkingBox-Bench
- 语言: 英语
- 许可证: CDLA-Permissive-2.0
- 任务类别: 强化学习(Reinforcement Learning)
- 标签: agent、tool-use、benchmark、evaluation
数据集简介
ThinkingBox-Bench 是一个可执行的基准测试集,用于评估使用工具的 LLM 代理能否可靠地完成有状态的业务流程。版本 1.0 包含 507 个工具-代理-用户任务,涵盖以下领域:
- 零售与电子商务
- 旅游与酒店业
- 汽车保险
- 新型银行支持
- 咨询 IT/人力资源支持
数据集结构
数据集包含三个子集:
| 子集 | 行数 | 内容 |
|---|---|---|
tasks |
507 | 用户目标、初始状态补丁、预期工具交互和评分规则 |
scenarios |
5 | 共享世界状态和可用工具,通过 scenario_id 关联 |
agents |
1 | 代理指令和内置工具 |
每个任务通过 scenario_id 引用其共享场景。任务状态和预期交互被序列化为 JSON 字符串以便于浏览和传播。
任务字段说明
| 字段 | 描述 |
|---|---|
task_ref |
来自发布测试列表的标准 file.py:function_name 标识符 |
domain |
可读的基准测试领域 |
scenario_id |
连接任务与 scenarios 子集中共享行的键 |
query |
模拟用户发送的初始请求 |
user_context |
提供给模拟用户的指令和事实 |
initial_state_patch_json |
任务开始前应用于场景基础世界状态的 JSON 对象 |
expected_tool_interactions_json |
定义预期状态变化的有序黄金工具调用 |
rubrics_json |
适用于特定任务的附加响应要求 |
source_url |
包含可执行测试定义的带标签 GitHub 源代码 |
release_tag |
用于生成该行的不可变 thinkingbox-data 发布版本 |
评估机制
数据集不存储预计算的预期最终状态。在评估过程中:
- 场景的 MCP 服务器创建一个新的数据库
- 应用
initial_state_patch_json - 重放
expected_tool_interactions_json以生成golden_db_state(黄金数据库状态) - 将该状态的稳定哈希值与代理修改后的数据库哈希值进行比较
这一运行时过程确保了预期状态使用与代理尝试相同的工具实现和数据库语义。
预期用途
ThinkingBox-Bench v1.0 仅用于评估。禁止将任务内容、预期结果、黄金状态或工具轨迹用于提示优化、微调、强化学习、奖励模型训练或其他模型优化。
运行方式
Parquet 表仅用于浏览和分析,并非可执行运行时。如需运行全部 507 个任务,请按照 ThinkingBox-Bench v1.0 指令 安装 ThinkingBox,启动所需服务并运行任务。
可执行基准测试、工具服务器和支持文件维护在 microsoft/thinkingbox-data GitHub 仓库中。为确保可复现性,请使用 thinkingbox-bench-v1.0 发布版本。




