遇见数据集

FactoryBench

收藏
github2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

FactoryBench是一个用于评估时间序列模型和大型语言模型在工业机器人遥测数据上机器理解能力的基准。该基准包含超过70,000个问答对,组织在四个因果层级(状态、干预、反事实、决策)上,基于Pearl的因果阶梯理论。问答对源自FactoryWave、AURSAD和voraus-AD等数据集,约15,000个标准化片段,涵盖21个结构化问题模板和五种答案格式。数据集针对UR3协作机器人和KUKA KR10工业手臂的密集、多任务、多变量传感器数据,包括27种故障类型,旨在揭示当前模型与操作机器理解之间的差距。

FactoryBench is a benchmark for evaluating the machine understanding capabilities of time series models and large language models (LLMs) on industrial robot telemetry data. This benchmark contains over 70,000 question-answer pairs, organized into four causal hierarchy levels (state, intervention, counterfactual, decision-making) based on Pearl's causal hierarchy theory. The question-answer pairs are sourced from datasets including FactoryWave, AURSAD, and voraus-AD, and are built upon approximately 15,000 standardized segments covering 21 structured question templates and five answer formats. Focused on dense, multi-task, multi-variate sensor data collected from the UR3 collaborative robot and KUKA KR10 industrial robotic arm, the dataset includes 27 types of faults, and is designed to uncover the gap between current models and operational machine understanding capabilities.

创建时间:
2026-05-18
原始信息汇总

FactoryBench 数据集概述

基本信息

  • 发布机构: Forgis Labs
  • 论文: arXiv 2605.07675
  • 数据集地址: HuggingFace - FactoryBench/FactoryBench
  • 研究团队: Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu, Marcos Gomez-Bracamonte, Riccardo Maggioni, Alessandro Lombardi, Camilla Mazzoleni, Federico Martelli, Balazs Gunther, Jonas Petersen, Philipp Petersen

任务目标

评估时间序列模型和大语言模型对工业机器人遥测数据的机器理解能力,通过问-答对形式衡量模型在因果推理四个层级上的表现。

数据规模

指标 数值
问-答项总数 70,000+
标准化事件片段 ~15,000
结构化问题模板 21 种
答案格式 5 种
机器人类型 UR3 协作机器人 + KUKA KR10 工业臂
故障类型 27 种,覆盖 3 类任务

因果推理四级框架

层级 任务 示例
L1 状态 解释机器当前正在做什么 “3号关节当前电流是多少?”
L2 干预 推理当前某个操作会带来什么变化 “如果3号关节的力现在增加到X,会发生什么?”
L3 反事实 推理过去不同操作会产生什么结果 “如果力在t=20ms时增加到X,本来会发生什么?”
L4 决策 根据轨迹生成补救方案 “机器人报错C203A停止,该怎么办?”

每个层级建立在前一层级之上;若在层级N失败,则意味着在层级N+1也会失败。

答案格式

  • 多选
  • 标量
  • 张量
  • 排序
  • 自由文本(由LLM作为评委的投票协议评分)

数据来源

  • FactoryWave: 从UR3协作机器人和KUKA KR10工业臂采集的密集多任务多变量传感器数据集
  • AURSAD
  • voraus-AD

约15,000个标准化事件片段作为问答对的生成基础。

许可协议

Forgis 源代码许可协议(非商业用途)

引用

bibtex @article{merzouki2026factorybench, title = {FactoryBench: Evaluating Industrial Machine Understanding}, author = {Merzouki, Yanis and Izquierdo, Coral and Ignuta-Ciuncanu, Matei and Gomez-Bracamonte, Marcos and Maggioni, Riccardo and Lombardi, Alessandro and Mazzoleni, Camilla and Martelli, Federico and Gunther, Balazs and Petersen, Jonas and Petersen, Philipp}, journal = {arXiv preprint arXiv:2605.07675}, year = {2026} }

搜集汇总
数据集介绍
FactoryBench 数据集图片
构建方式
FactoryBench的构建依托于一套可扩展的问答生成框架,核心围绕21个结构化问题模板展开。这些问题模板被精心设计以覆盖Pearl因果阶梯的四层因果级别(状态、干预、反事实、决策),每一层都建立在前一层基础之上。数据源方面,研究团队首先采集了FactoryWave数据集,这是一个密集、多任务、多变量的传感器数据集,源自UR3协作机器人和KUKA KR10工业机械臂。在此基础上,团队额外整合了AURSAD和voraus-AD两个公开数据集,通过归一化处理提取出约1.5万个标准化片段。最终,利用结构化模板自动生成超过7万个问答对,确保了数据规模与因果逻辑的完整性。
特点
FactoryBench最显著的特点在于其分层级的因果推理设计,严格遵循Pearl因果阶梯,将机器理解能力从简单的状态感知层层递进至复杂的决策制定。在答案格式上,数据集提供了五种类型,包括多选、标量、张量、排序以及自由形式,其中前四种结构化格式可通过确定性方法自动评分,而自由形式答案则依赖大语言模型作为裁判的投票协议进行评估。此外,数据集中包含27种故障类型,覆盖三种机器人任务场景,使得评估不仅限于正常工况,还能考察模型在异常情况下的诊断与响应能力。
使用方法
FactoryBench的使用极为便捷,研究者和开发者可通过HuggingFace数据集仓库直接访问。使用Python的datasets库,仅需执行一行pip install datasets安装依赖,随后调用load_dataset函数即可加载完整数据集。加载完成后,用户能够按照四层因果级别筛选问答对,并针对不同的答案格式选择对应的评估策略。对于结构化答案,可直接依据预设规则进行评分;而对于自由形式回答,则需借助内置的大语言模型投票协议来评判。这种设计使得FactoryBench既适用于传统时间序列模型的基准测试,也兼容对大语言模型机器理解能力的全面评估。
背景与挑战
背景概述
在工业4.0与智能制造浪潮的推动下,对工业机械臂运行状态的深度理解成为提升生产效率与安全性的关键。FactoryBench由Forgis Labs团队于2026年创建,以Yanis Merzouki为核心研究者,联合来自多国的十一位学者共同开发。该基准测试旨在系统评估时序模型与大语言模型在工业机器人遥测数据上的机器理解能力,构建了涵盖状态、干预、反事实与决策四个因果层次的问答框架,严格遵循Pearl的因果阶梯理论。基于自采的FactoryWave多任务多变量传感器数据集(包含UR3协作机器人与KUKA KR10工业臂的真实运行数据),并结合AURSAD与voraus-AD等公开数据集,最终生成超过7万条标准化问答样本。该工作为工业智能诊断与因果推理研究提供了兼具规模与深度的评估平台,在时间序列分析与工业AI领域产生了显著影响。
当前挑战
FactoryBench所面临的挑战主要体现为两大维度。其一,在领域问题层面,当前顶尖大语言模型在结构化因果层次上的零样本准确率未能超过50%,在决策层级甚至低于18%,暴露出模型对工业机器运行状态的因果推理能力存在根本性欠缺,特别是反事实推理与多步决策制定能力严重不足。其二,在数据集构建过程中,挑战包括:多源异构传感器数据的标准化对齐(来自三个数据集、约1.5万个规范化片段),27种故障类型与三种操作任务的复杂标注体系设计,以及21种结构化问答模板的构建以覆盖多选、标量、张量、排序与自由格式五种答案形式。此外,自由形式的答案评估采用大语言模型作为评判的投票协议,需确保评判结果的可靠性与一致性,这构成了方法论上的又一显著难题。
常用场景
经典使用场景
在工业智能与机器人运维领域,对机器运行状态的深层理解是提升自动化系统可靠性的核心挑战。FactoryBench作为专为评估机器理解能力而设计的基准,其最经典的使用场景在于系统性地测试和对比时间序列模型与大语言模型在工业机器人遥测数据上的因果推理性能。通过构建涵盖状态识别、干预推理、反事实分析与决策生成的四级因果框架,该基准能够从多个认知层次衡量模型对工业机器人行为的理解深度,尤其擅长揭示现有模型在高阶因果推理和复杂故障决策任务中的能力边界。
解决学术问题
FactoryBench着力解决了当前工业AI研究中缺乏标准化因果推理评估体系的突出问题。传统基准多聚焦于简单的状态分类或异常检测,难以刻画模型在不同因果层次上的真实能力。该数据集通过引入Pearl的因果阶梯理论,将机器理解任务细化为四个层次,并设计了70,000余个高质量问答对以及多种评分机制,为研究者提供了可量化的评估工具。其意义在于推动工业时间序列模型从浅层模式匹配向深层因果推断的范式转变,为工业AI的理论发展与算法评价提供了坚实的数据基础与参照标准。
衍生相关工作
FactoryBench的发布催生了一系列重要的衍生研究工作。围绕其四级问答框架,研究者开发了专用的因果时间序列特征提取器与面向工业领域的轻量化LLM微调方法。部分工作探索了基于多智能体投票机制的问答增强策略,以提升自由形式答案的可靠性与一致性。此外,结合FactoryWave等高密度多传感器数据集,出现了针对工业机器人故障预测与根因分析的新型解释性模型。这些工作不仅拓宽了机器理解研究的边界,也为LLM在工业物理世界中的落地提供了现实可行的技术路径与验证手段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务