遇见数据集

BTS-AgentBench

收藏
arXiv2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

BTS-AgentBench是一个从只读遥测日志构建的确定性、可重现的智能体基准数据集,由Jeong-Yoon Kim提出。该数据集包含532条多轮任务,覆盖点解析、时间聚合、对比、排序、质控报告等9个任务族,数据源自BTS建筑时间序列数据集和XAI4HEAT区域供热数据集。创建过程通过规范化遥测元数据、构建只读工具存储、编译静态任务并转换为带阶段约束的交互式episode,确保完全可重现。该基准旨在评估大语言模型在工业设施中执行上下文感知、工具使用及多轮交互的智能体能力,解决设备识别、数据查询与异常分析等实际问题。

BTS-AgentBench is a deterministic, reproducible agent benchmark dataset constructed from read-only telemetry logs, proposed by Jeong-Yoon Kim. This dataset contains 532 multi-turn tasks spanning 9 task families including point parsing, temporal aggregation, comparison, sorting, quality control reporting and others. The data is sourced from the BTS building time series dataset and the XAI4HEAT district heating dataset. Its creation process normalizes telemetry metadata, constructs a read-only tool store, compiles static tasks and converts them into interactive episodes with phase constraints, ensuring full reproducibility. This benchmark aims to evaluate the agent capabilities of large language models (LLMs) in performing context-aware, tool-use and multi-turn interaction tasks in industrial facilities, addressing practical issues such as equipment identification, data query and anomaly analysis.

创建时间:
2026-08-28
原始信息汇总

BTS-AgentBench 数据集详情

数据集概述

BTS-AgentBench 是一个基于建筑遥测数据(Building Telemetry System)构建的多轮智能体(Agent)评测基准数据集。该数据集通过确定性的方式,将只读的建筑遥测数据转化为可执行的任务,并进一步组合成受限的多轮智能体交互回合。其核心特点是:整个构建过程不调用任何大语言模型(LLM),所有遥测值、工具输出、用户追问、阶段目标、最终决策和证据标识均由固定代码生成,并通过类型化合约进行校验。

数据规模与结构

数据集 训练集 验证集 测试集 总计
BTS-AgentBench 356 87 89 532(涵盖9个任务家族)
XAI4HEAT-AgentBench(迁移语料) 132 31 41 204(涵盖5个适用家族)

构建流程

text BTS元数据 + 原始时间戳/数值归档 → 归一化流/实体目录 → 只读DuckDB工具存储与聚合表 → 532个可执行静态任务 → 确定性交互组合与类型化修复 → 532个带评分的多轮回合 → 合约预检、控制器审计与保留模型轨迹

数据集内容与发布物

主要工件(Artifacts)

  • BTS数据集工件:356/87/89 的训练/验证/测试回合,涵盖9个任务家族
  • BTS静态任务:532个基于遥测数据的任务(在交互组合之前)
  • XAI4HEAT数据集工件:132/31/41 的回合,涵盖5个适用家族
  • 模型运行报告:267条BTS轨迹和41条XAI4HEAT轨迹及其运行配置
  • 重放报告:两次构建的重放报告及行级控制器验证
  • 溯源信息:固定的BTS行选择、原始流血缘及完整工作轨迹
  • 源数据:BTS元数据及带校验和的归一化目录

数据特性

  • 每个环节均包含澄清、目标修正、时间戳策略、质量感知报告和证据归属等机制
  • 每个回合包含完整的序列化JSONL记录,涵盖措辞、轮次、工具调用、阶段目标、最终动作、证据、验证器、构建历史、行顺序及序列化方式
  • 支持从原始遥测归档中完全确定性重建全部数据

数据获取与验证

快速启动

bash git clone https://github.com/kjy7567/BTS-AgentBench.git cd BTS-AgentBench python -m venv .venv source .venv/bin/activate pip install -r requirements.lock pip install -e . --no-deps

验证发布包(无需下载原始数据)

bash python scripts/verify_packaged_release.py

完全重放(需下载约19GB原始归档)

bash make replay RAW_DIR=/absolute/path/to/BTS_RAW_ARCHIVES

或使用展开命令:

bash python scripts/replay_release.py --raw-dir /absolute/path/to/BTS_RAW_ARCHIVES --work-dir ./data/local-build/release-replay --raw-runs 2 --controller-audit

重放过程执行9项校验,包括:归档哈希验证、双份独立工具存储构建、静态任务重建、交互合约组合、合约预检、双构建逻辑工具存储导出比对、静态/最终分割文件比对、重建分割哈希与发布清单比对、可选的构建排除控制器审计。

任务构建机制

程序化交互构建特点

  • 不生成开放式对话,而是从可执行的任务出发应用声明式规则
  • 缺失的站点或时间段仅在静态任务包含可恢复值时才可被扣留
  • 模拟器在智能体询问时返回精确值
  • 家族规则可添加相邻时间窗口、备选点、精确最近回退或质量检查
  • 所有遥测操作均在同一只读运行时中执行
  • 表面模板从类型化字段渲染设备标签、点位类别、日期和策略措辞

示例

原始观测值 12.9457(时间戳 2022-02-03T07:03:23.640Z)可转化为精确时间戳任务:初始扣留时间戳 → 通过澄清提供 → 询问 07:03 最近的观测 → 检查周围一周的质量 → 请求报告或弃权决策 → 最后请求流ID。

外部输入与固定输入

输入 是否用户提供 位置或作用
三个BTS原始ZIP归档 通过 --raw-dir 传入目录
源BTS/Brick元数据 data/source/bts-meta/
带校验和的归一化目录 data/source/bts-processed-catalog/
固定的532行选择合约 provenance/release_static_selection.jsonl
期望发布哈希 release/release_manifest.json
DuckDB工具存储及中间产物 生成 默认位于 data/local-build/release-replay/

模型评测

支持的模型运行器

bash bash runners/gpt55_bts.sh bash runners/gemini31pro_bts_openrouter.sh bash runners/opus47_bts_openrouter.sh bash runners/gpt55_xai4heat.sh

每个运行器调用 scripts/run_bts_e2e_openai_eval.py,其 run_config.json 记录端点模式、提示配置、输出上限、种子处理、轮次预算、超时和调用次数。API密钥仅在新调用模型提供方时需要,不用于发布验证或轨迹检查。

结果记录

  • XAI4HEAT 测试集(41行):构建排除控制器 0/41,GPT-5.5 为 41/41
  • 保留的模型轨迹可进行确定性重新评分

确定性边界说明

  • 确定性范围内:固定输入和固定环境下的构建与评分完全确定
  • 发布行仅当完整序列化JSONL与记录的SHA-256匹配时才算复现成功,覆盖措辞、轮次、工具调用等全部要素
  • 确定性范围外:新建的托管模型生成结果不在范围内,因提供方服务可能变化,保留轨迹可用于确定性重新评分

XAI4HEAT 可移植性

  • 通过特定语料SCADA适配器,将面向行的区域供热SCADA表映射为归一的站点/流/点位/设备/时间戳/数值表示
  • 复用相同的静态构建器、交互、阶段、修复、审计、运行器和评分器代码
  • 可移植性边界定义在这两个遥测语料之间,不适用于无关事件日志结构

公共ZIP包

bash python scripts/build_public_bundles.py --output-dir dist python scripts/verify_packaged_release.py --dist-dir dist --require-bundles

  • dist/source.zip:构建、重放、审计、评分和运行器源代码及固定元数据合约和文档
  • dist/dataset.zip:532个BTS回合、204个XAI4HEAT回合、静态任务、控制器验证、全部4个保留模型运行和全部4个运行器
  • dist/SHA256SUMS:两个包的哈希记录
  • 两个归档在 telemetry-episode-replay/ 目录下解压,总大小需低于200 MiB

许可与归属

  • 仓库代码根据 LICENSE 分发
  • BTS源数据遵循其上游CC BY 4.0条款,不在本仓库重新分发
  • XAI4HEAT用户必须遵守其上游条款
  • 分发前需查阅 DATA_SOURCES.md 中的详细归属信息
搜集汇总
数据集介绍
BTS-AgentBench 数据集图片
构建方式
BTS-AgentBench的构建始于对原始遥测日志与标准化元数据的深度整合。该流程首先对楼宇时间序列数据及其元数据进行规范化处理,仅保留能与原始历史记录匹配的点位,进而构建基于DuckDB的只读工具库。在此基础上,通过九种任务生成器依据固定资格谓词枚举静态可执行任务,涵盖点位消解、时间聚合、比较排序及时间戳查询等范畴。每个任务经确定性编译流程转化为多轮智能体交互场景,引入澄清、目标修订、时间戳策略及质量承诺等类型化交互义务,同时保留源计算逻辑与程序化评分机制。最终经过精确复现验证与控制器感知的排除性审计,形成包含532条数据、划分为356/87/89的训练/开发/测试集成品。
特点
该数据集的核心特色在于其完全确定性与可复现性。从原始遥测数据到最终基准产物的整个构建管线无需任何语言模型介入,所有任务、交互契约及评估目标均由确定性规则驱动生成。数据集包含九种任务族,每个任务不仅评估最终答案,还严格校验澄清、状态传递、修订、时间戳策略、质量决策及证据归因等多阶段交互义务。通过双重独立构建流程实现逐字节精确配比,并配备规则化控制器作为构建期强化信号,确保零脆弱行存在。此外,数据集的移植性已在XAI4HEAT语料上得到验证,成功生成204条异构数据场景。
使用方法
使用者可直接加载已发布的JSONL格式基准文件,每条数据包含完整的多轮对话轨迹、工具调用契约、阶段金标、证据关联及验证器配置。通过提供的只读工具运行时与确定性评估器,可对智能体轨迹进行细粒度评分,涵盖最终答案、阶段完成度、证据覆盖度及协议完整性等维度。数据集支持多种前沿语言模型的公平评估,并允许通过公开的单一命令重建工具实现从头至尾的精确复现,便于模型微调、跨语料迁移实验及可控的轨迹诊断分析。
背景与挑战
背景概述
BTS-AgentBench由Jeong-Yoon Kim于2026年提出,旨在将建筑与工业设施中大量只读遥测日志转化为可执行的多轮智能体基准。该数据集基于BTS(覆盖三栋建筑三年数据)与XAI4HEAT(覆盖五个区域供热站五年数据),通过规范化元数据与原始历史记录,构建只读工具库,并编译出包含澄清、目标修订、时间戳策略、质量门控与证据归因等约束的532条任务,划分训练/开发/测试集。其核心贡献在于提供了一种确定性的、可重放的构建流程,使现有遥测数据可用于开发与评估能解析本地设备、请求缺失上下文、跨修订目标保持状态并引用证据的AI助手,推动了工业领域任务特定模型适配与受控评估的落地。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,遥测数据规模庞大且存在组合爆炸(如BTS诱发约219万日窗口与599万成对候选),且需处理点消歧、时间聚合、比较、排序、时间戳查询与质量感知报告等多类任务,对智能体的状态携带、时间戳策略、质量决策与证据链闭合提出高要求。构建层面,需确保从原始日志到工具存储、静态任务、交互契约再到最终回合的完全确定性精确重放,所有生成内容必须源于工具执行与固定规则,避免模型干预;同时需设计审计套件识别并排除控制器可完成的脆弱行,并保证跨语料可移植性(如XAI4HEAT),在保留源计算与分割的同时,实现可执行合约的严格验证与零容错。
常用场景
经典使用场景
BTS-AgentBench作为一项开创性的基准构建方法,其核心应用在于将工业楼宇的只读遥测日志系统性地编译为可供智能体执行的多轮交互任务。该数据集为评估大型语言模型在真实建筑设备与传感器数据上的工具调用能力提供了标准化的测试平台,覆盖点解析、时间聚合、比较排序、时间戳查询及质量感知报告等九类任务族。研究者可利用其固定划分的训练、验证与测试集,在受控条件下复现并比较不同模型在遥测数据理解、状态跟踪及策略遵循方面的表现,从而推动智能体在特定设施语境下的可复现性评估。
实际应用
在实际应用中,BTS-AgentBench可直接用于部署楼宇自动化或工业设施管理的人工智能助手,辅助运维人员完成设备点识别、历史数据查询、能耗趋势分析及数据质量判断等日常操作。该基准的只读工具集和确定性模拟器使其成为验证智能体在真实遥测环境下可靠性的重要测试床,有助于推动智能体在建筑能源管理、设备故障预警及运行优化等场景中的落地,同时确保其交互行为符合操作规范并可追溯。
衍生相关工作
BTS-AgentBench的构建方法为从其他遥测语料生成智能体基准提供了可移植的范式,其衍生工作包括将同一管道应用于XAI4HEAT区域供热数据集,成功生成204个跨语料的智能体任务,验证了方法在不同数据模式下的泛化能力。此外,该研究启发了后续关于确定性控制器审计、契约预检及可重放性验证等工作,为构建更加透明和鲁棒的工具调用智能体评估体系奠定了坚实基础,并促进了与API-Bank、ToolSandbox等交互式工具基准的比较研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务