FRTR-Bench
收藏资源简介:
FRTR-Bench是一个大规模、多模态的企业电子表格推理基准,旨在评估检索增强和多模态LLM系统在真实Excel工作负载上的表现。它包含30个企业级Excel工作簿,涵盖金融、供应链、医疗、能源、政府和教育领域,强调规模、跨表格推理和多模态性三个核心挑战。
FRTR-Bench is a large-scale, multimodal enterprise spreadsheet reasoning benchmark designed to evaluate retrieval-augmented and multimodal large language model (LLM) systems on real-world Excel workloads. It contains 30 enterprise-grade Excel workbooks spanning the domains of finance, supply chain, healthcare, energy, government and education, and emphasizes three core challenges: scale, cross-table reasoning, and multimodality.
FRTR-Bench 数据集概述
数据集简介
FRTR-Bench 是一个用于企业电子表格推理的大规模多模态基准测试,旨在评估检索增强和多模态大语言系统在现实 Excel 工作负载上的性能。该基准测试区别于先前仅关注单工作表或纯文本表格的电子表格基准,它捕捉了真实世界企业工作簿的规模、结构和模态。
核心特征
- 规模:每个工作簿包含数十万行数据,总计约 400 万个单元格。
- 跨工作表推理:包含跨越多个工作表的公式和逻辑。
- 多模态:包含嵌入式图像,如图表、仪表板和扫描的收据。
数据集统计
| 指标 | 数量 |
|---|---|
| 工作簿 | 30 |
| 工作表 | 155 |
| 行数 | 656,457 |
| 单元格数 | 3,928,934 |
| 嵌入式图像 | 53 |
| 跨工作表公式 | 30 |
| 问题数量 | 157 |
工作簿结构
每个 Excel 文件通常包含:
- 元数据工作表(模式、描述)。
- 1–5 个数据工作表,包含大量表格内容。
- 嵌入式图像(PNG 图表、收据、仪表板)。
- 问题工作表,包含:
- 自然语言查询。
- 真实答案。
- 明确的来源(单元格引用、公式或图像 ID)。
问题根据工作簿大小和推理复杂性,涵盖不同难度级别(简单、中等、困难)。
评估任务
FRTR-Bench 支持对以下任务进行评估:
- 电子表格问答。
- 跨工作表数值推理。
- 公式识别与合成。
- 基于表格和图像的多模态推理。
- 检索增强的电子表格理解。
该基准测试是模型无关的,可与基于检索、基于压缩或长上下文方法一起使用。
使用方式
数据集以原始 Excel 工作簿(.xlsx)形式提供,并附带问题标注。未强制执行任何执行引擎或评估脚本,允许在模型如何检索、推理和回答方面保持灵活性。
鼓励研究人员报告以下指标:
- 答案准确性。
- 令牌使用量。
- 延迟。
- 证据/来源正确性。
相关研究
FRTR-Bench 与 FRTR(From Rows to Reasoning) 框架一同提出。该基准测试旨在补充(并超越)现有的数据集,如 SpreadsheetLLM 和 SpreadsheetBench。




