MMTU
收藏资源简介:
MMTU是一个大规模的多任务表格理解和推理基准数据集,包含超过30K个问题和25个真实世界的表格任务,旨在全面评估模型在专家级别上理解、推理和操作真实表格的能力。这些任务来源于几十年来关于表格数据的计算机科学研究,重点关注专业用户面临的复杂表格任务。MMTU需要结合表格理解、推理和编码等技能,对当前的前沿模型仍具有挑战性。
MMTU is a large-scale multi-task table understanding and reasoning benchmark dataset, containing over 30K questions and 25 real-world table tasks. It is designed to comprehensively assess models' capabilities in understanding, reasoning, and manipulating real-world tables at an expert level. These tasks are derived from decades of computer science research on table data, focusing on complex table tasks faced by professional users. MMTU requires the integration of table understanding, reasoning, and encoding skills, and remains challenging for current state-of-the-art models.
MMTU数据集概述
数据集简介
- 名称:MMTU (Massive Multi-Task Table Understanding and Reasoning Benchmark)
- 类型:表格理解与推理基准测试
- 规模:包含超过30K问题,涵盖25种真实世界表格任务
- 目标:全面评估模型在专家级表格理解、推理和操作方面的能力
核心特点
- 任务多样性:涵盖25种真实世界表格任务,包括NL-to-SQL和Table-QA等
- 专业性:聚焦专业用户面临的复杂表格任务
- 技能要求:需要表格理解、推理和编码能力的结合
数据集构成
- 来源:基于52个数据集的精心整理,来自SIGMOD/VLDB、PLDI/POPL和WWW/WSDM等社区
- 标注:由计算机科学研究人员标注
评估结果
- 当前最佳模型:o4-mini (2024-11-20),得分0.639 ± 0.01
- 其他模型表现:
- Deepseek-R1:0.596 ± 0.01
- GPT-4o (2024-11-20):0.491 ± 0.01
使用说明
- 数据下载:从OneDrive获取原始数据
- 环境配置:需Python 3.11环境
- 模型评估:支持OpenAI、Azure OpenAI和Azure AI Foundry等API提供商
相关资源
- 论文:https://arxiv.org/abs/2506.05587
- Hugging Face数据集:https://huggingface.co/datasets/MMTU-benchmark/MMTU
引用格式
bibtex @article{mmtu, title={{MMTU}: A Massive Multi-Task Table Understanding and Reasoning Benchmark}, author={Junjie Xing and Yeye He and Mengyu Zhou and Haoyu Dong and Shi Han and Lingjiao Chen and Dongmei Zhang and Surajit Chaudhuri and H. V. Jagadish}, journal={arXiv preprint arXiv:2506.05587}, year={2025} }




