BTS-AgentBench
收藏资源简介:
BTS-AgentBench是一个从只读遥测日志构建的确定性、可重现的智能体基准数据集,由Jeong-Yoon Kim提出。该数据集包含532条多轮任务,覆盖点解析、时间聚合、对比、排序、质控报告等9个任务族,数据源自BTS建筑时间序列数据集和XAI4HEAT区域供热数据集。创建过程通过规范化遥测元数据、构建只读工具存储、编译静态任务并转换为带阶段约束的交互式episode,确保完全可重现。该基准旨在评估大语言模型在工业设施中执行上下文感知、工具使用及多轮交互的智能体能力,解决设备识别、数据查询与异常分析等实际问题。
BTS-AgentBench is a deterministic, reproducible agent benchmark dataset constructed from read-only telemetry logs, proposed by Jeong-Yoon Kim. This dataset contains 532 multi-turn tasks spanning 9 task families including point parsing, temporal aggregation, comparison, sorting, quality control reporting and others. The data is sourced from the BTS building time series dataset and the XAI4HEAT district heating dataset. Its creation process normalizes telemetry metadata, constructs a read-only tool store, compiles static tasks and converts them into interactive episodes with phase constraints, ensuring full reproducibility. This benchmark aims to evaluate the agent capabilities of large language models (LLMs) in performing context-aware, tool-use and multi-turn interaction tasks in industrial facilities, addressing practical issues such as equipment identification, data query and anomaly analysis.
BTS-AgentBench 数据集详情
数据集概述
BTS-AgentBench 是一个基于建筑遥测数据(Building Telemetry System)构建的多轮智能体(Agent)评测基准数据集。该数据集通过确定性的方式,将只读的建筑遥测数据转化为可执行的任务,并进一步组合成受限的多轮智能体交互回合。其核心特点是:整个构建过程不调用任何大语言模型(LLM),所有遥测值、工具输出、用户追问、阶段目标、最终决策和证据标识均由固定代码生成,并通过类型化合约进行校验。
数据规模与结构
| 数据集 | 训练集 | 验证集 | 测试集 | 总计 |
|---|---|---|---|---|
| BTS-AgentBench | 356 | 87 | 89 | 532(涵盖9个任务家族) |
| XAI4HEAT-AgentBench(迁移语料) | 132 | 31 | 41 | 204(涵盖5个适用家族) |
构建流程
text BTS元数据 + 原始时间戳/数值归档 → 归一化流/实体目录 → 只读DuckDB工具存储与聚合表 → 532个可执行静态任务 → 确定性交互组合与类型化修复 → 532个带评分的多轮回合 → 合约预检、控制器审计与保留模型轨迹
数据集内容与发布物
主要工件(Artifacts)
- BTS数据集工件:356/87/89 的训练/验证/测试回合,涵盖9个任务家族
- BTS静态任务:532个基于遥测数据的任务(在交互组合之前)
- XAI4HEAT数据集工件:132/31/41 的回合,涵盖5个适用家族
- 模型运行报告:267条BTS轨迹和41条XAI4HEAT轨迹及其运行配置
- 重放报告:两次构建的重放报告及行级控制器验证
- 溯源信息:固定的BTS行选择、原始流血缘及完整工作轨迹
- 源数据:BTS元数据及带校验和的归一化目录
数据特性
- 每个环节均包含澄清、目标修正、时间戳策略、质量感知报告和证据归属等机制
- 每个回合包含完整的序列化JSONL记录,涵盖措辞、轮次、工具调用、阶段目标、最终动作、证据、验证器、构建历史、行顺序及序列化方式
- 支持从原始遥测归档中完全确定性重建全部数据
数据获取与验证
快速启动
bash git clone https://github.com/kjy7567/BTS-AgentBench.git cd BTS-AgentBench python -m venv .venv source .venv/bin/activate pip install -r requirements.lock pip install -e . --no-deps
验证发布包(无需下载原始数据)
bash python scripts/verify_packaged_release.py
完全重放(需下载约19GB原始归档)
bash make replay RAW_DIR=/absolute/path/to/BTS_RAW_ARCHIVES
或使用展开命令:
bash python scripts/replay_release.py --raw-dir /absolute/path/to/BTS_RAW_ARCHIVES --work-dir ./data/local-build/release-replay --raw-runs 2 --controller-audit
重放过程执行9项校验,包括:归档哈希验证、双份独立工具存储构建、静态任务重建、交互合约组合、合约预检、双构建逻辑工具存储导出比对、静态/最终分割文件比对、重建分割哈希与发布清单比对、可选的构建排除控制器审计。
任务构建机制
程序化交互构建特点
- 不生成开放式对话,而是从可执行的任务出发应用声明式规则
- 缺失的站点或时间段仅在静态任务包含可恢复值时才可被扣留
- 模拟器在智能体询问时返回精确值
- 家族规则可添加相邻时间窗口、备选点、精确最近回退或质量检查
- 所有遥测操作均在同一只读运行时中执行
- 表面模板从类型化字段渲染设备标签、点位类别、日期和策略措辞
示例
原始观测值 12.9457(时间戳 2022-02-03T07:03:23.640Z)可转化为精确时间戳任务:初始扣留时间戳 → 通过澄清提供 → 询问 07:03 最近的观测 → 检查周围一周的质量 → 请求报告或弃权决策 → 最后请求流ID。
外部输入与固定输入
| 输入 | 是否用户提供 | 位置或作用 |
|---|---|---|
| 三个BTS原始ZIP归档 | 是 | 通过 --raw-dir 传入目录 |
| 源BTS/Brick元数据 | 否 | data/source/bts-meta/ |
| 带校验和的归一化目录 | 否 | data/source/bts-processed-catalog/ |
| 固定的532行选择合约 | 否 | provenance/release_static_selection.jsonl |
| 期望发布哈希 | 否 | release/release_manifest.json |
| DuckDB工具存储及中间产物 | 生成 | 默认位于 data/local-build/release-replay/ |
模型评测
支持的模型运行器
bash bash runners/gpt55_bts.sh bash runners/gemini31pro_bts_openrouter.sh bash runners/opus47_bts_openrouter.sh bash runners/gpt55_xai4heat.sh
每个运行器调用 scripts/run_bts_e2e_openai_eval.py,其 run_config.json 记录端点模式、提示配置、输出上限、种子处理、轮次预算、超时和调用次数。API密钥仅在新调用模型提供方时需要,不用于发布验证或轨迹检查。
结果记录
- XAI4HEAT 测试集(41行):构建排除控制器 0/41,GPT-5.5 为 41/41
- 保留的模型轨迹可进行确定性重新评分
确定性边界说明
- 确定性范围内:固定输入和固定环境下的构建与评分完全确定
- 发布行仅当完整序列化JSONL与记录的SHA-256匹配时才算复现成功,覆盖措辞、轮次、工具调用等全部要素
- 确定性范围外:新建的托管模型生成结果不在范围内,因提供方服务可能变化,保留轨迹可用于确定性重新评分
XAI4HEAT 可移植性
- 通过特定语料SCADA适配器,将面向行的区域供热SCADA表映射为归一的站点/流/点位/设备/时间戳/数值表示
- 复用相同的静态构建器、交互、阶段、修复、审计、运行器和评分器代码
- 可移植性边界定义在这两个遥测语料之间,不适用于无关事件日志结构
公共ZIP包
bash python scripts/build_public_bundles.py --output-dir dist python scripts/verify_packaged_release.py --dist-dir dist --require-bundles
dist/source.zip:构建、重放、审计、评分和运行器源代码及固定元数据合约和文档dist/dataset.zip:532个BTS回合、204个XAI4HEAT回合、静态任务、控制器验证、全部4个保留模型运行和全部4个运行器dist/SHA256SUMS:两个包的哈希记录- 两个归档在
telemetry-episode-replay/目录下解压,总大小需低于200 MiB
许可与归属
- 仓库代码根据
LICENSE分发 - BTS源数据遵循其上游CC BY 4.0条款,不在本仓库重新分发
- XAI4HEAT用户必须遵守其上游条款
- 分发前需查阅
DATA_SOURCES.md中的详细归属信息





