TReB
收藏资源简介:
TReB是一个可靠且全面的基准测试,用于评估大型语言模型在表格推理方面的能力。它涵盖了从基本语言理解到高级数据分析的完整能力谱,包括六个核心技能和26个子任务。
TReB is a reliable and comprehensive benchmark for evaluating the table reasoning capabilities of large language models. It encompasses the full spectrum of capabilities ranging from basic language understanding to advanced data analysis, including six core skills and 26 subtasks.
TReB 数据集概述
数据集简介
- 名称:TReB (Table Reasoning Benchmark)
- 类型:表格推理评估基准
- 许可证:Apache 2.0
- 官方论文:TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
数据集特点
-
综合性:
- 整合了清洗过的公共基准数据集、真实网页表格和专有数据
- 覆盖6大核心能力和26项任务
-
核心能力:
- 自然语言理解:基础NLP能力评估
- 表格理解:表格结构与内容解析
- 表格基础操作:自然语言到结构化数据操作的转换
- 表格计算操作:复杂计算任务执行
- 数据分析:基础统计分析与模式识别
- 高级数据分析:高复杂度多步骤分析
评估框架
-
推理模式:
- TCoT (Textual Chain-of-Thought):纯文本逐步推理
- PoT (Program-of-Thought):生成可执行代码
- ICoT (Interleaved Chain-of-Thought):文本与程序交替推理
-
评估指标:
- 自然语言指标(BLEU、ROUGE-L)
- LLM-as-a-Judge(语义相似度评估)
- 精确匹配准确率(Exact Match)
使用指南
-
数据集获取:
-
配置要求:
- Python版本:3.9 | 3.10 | 3.11 | 3.12
- 需准备JSON配置文件指定模型参数和评估设置
-
评估流程:
- 执行模型推理
- 执行答案评估
- 结果存储在
eval_output目录下的JSONL文件中
注意事项
- 仅限学术研究使用
- 代码执行器仅配置了基本安全规则
- 部分任务输出可能不包含表格内容(正常现象)
引用格式
bibtext @misc{li2025trebcomprehensivebenchmarkevaluating, title={TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models}, author={Ce Li and Xiaofan Liu and Zhiyan Song and Ce Chi and Chen Zhao and Jingjing Yang and Zhendong Wang and Kexin Yang and Boshen Shi and Xing Wang and Chao Deng and Junlan Feng}, year={2025}, eprint={2506.18421}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2506.18421}, }




