遇见数据集

MBZUAI/TABVERSE

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

TABVERSE是一个受控的多模态表格理解基准数据集,旨在对齐HTML、Markdown和LaTeX三种表格表示形式与渲染的PNG图像,从而系统评估大型语言模型(LLMs)和视觉语言模型(VLMs)在跨格式和模态交互中的表现。数据集包含两个配置:qa配置用于任务预测(问答),包含700个问题-表格对(350个简单和350个困难),每个对提供自然语言问题、黄金答案、难度等级和类别,以及表格在三种格式下的完整渲染图像和源代码;suc配置用于结构化理解与理解(SUC)和格式生成(结构重建),包含629个唯一表格,每个表格提供结构探测任务的黄金答案,并支持六种格式转换方向(如HTML↔Markdown)。数据集来源于多个公开数据集(如FEVEROUS、HybridQA、SQA、TabFact、ToTTo),并经过清洗以确保表格内容在三种视图中保持一致。任务包括结构化理解、问答和格式生成,评估了17种模型(包括开源和闭源LLMs和VLMs)在三种输入模式(纯文本、图像、VLM文本)下的性能,主要使用精确匹配准确率作为评估指标。该数据集旨在推动表格理解研究,特别是在多模态和跨格式场景下的模型能力测试。

TABVERSE is a controlled multimodal table benchmark that aligns HTML, Markdown, and LaTeX table representations with rendered PNG images, enabling systematic evaluation of how format and modality interact in large language models (LLMs) and vision-language models (VLMs), with table content held fixed across all three views. The dataset includes two configurations: the qa config for task prediction (question answering) with 700 question-table pairs (350 Easy and 350 Hard), each providing a natural-language question, gold label, difficulty, category, and the full table rendered in all three formats as images and source code; and the suc config for Structured Understanding & Comprehension (SUC) and format generation (Structure Reconstruction) with 629 unique tables, each supplying ground-truth answers for structural probing tasks and supporting six conversion directions (e.g., HTML↔Markdown). It is sourced from multiple public datasets (e.g., FEVEROUS, HybridQA, SQA, TabFact, ToTTo) and cleaned to ensure consistency across views. Tasks include structured understanding, QA, and format generation, evaluating 17 models (including open-weight and closed LLMs and VLMs) in three pipeline modes (LLM text, VLM image, VLM text), with exact-match accuracy as the primary metric. The dataset aims to advance table understanding research, particularly in multimodal and cross-format scenarios.

提供机构:
MBZUAI
搜集汇总
数据集介绍
MBZUAI/TABVERSE 数据集图片
构建方式
TABVERSE是一个为系统评估大语言模型与视觉语言模型跨格式表格理解能力而设计的受控多模态基准数据集。其构建过程独具匠心:从FEVEROUS、HybridQA、SQA、TabFact和ToTTo五个公开数据集中抽取了629张独特表格,确保内容覆盖广泛且来源于已持有的验证集划分,避免了数据污染。针对每一张表格,研究团队将其精确对齐地转换为HTML、Markdown和LaTeX三种代码格式,并生成对应的PNG渲染图像,从而在本质内容完全固定的前提下,创造了格式与模态交互的系统性评估条件。最终形成了两大配置:qa配置包含700条问题-表格对,按难度和推理类型精心标注;suc配置则专注于底层结构理解,每张表格均提供了结构探测、单元格检索等多项黄金答案。
使用方法
使用TABVERSE数据集极为便捷,用户可通过HuggingFace的datasets库直接加载。对于问答任务,加载qa配置后,每条数据均包含自然语言问题、黄金标签、难度信息,以及表格在三种格式下的完整代码和渲染图像。模型可直接调用文本代码或图像进行零样本预测,评估采用精确匹配指标。对于结构理解任务,suc配置提供了丰富的结构探测字段,如size_detection和cell_value,可用于模板化评估。格式生成任务同样利用suc配置:例如,将html_code作为输入,markdown_code作为目标,即可进行HTML到Markdown的生成实验,评估采用BLEU与结构相似度。研究者可根据需要灵活选择任一配置或任务子集开展实验。
背景与挑战
背景概述
表格作为结构化信息的重要载体,在诸多自然语言处理任务中扮演着核心角色。2026年,由穆罕默德·本·扎耶德人工智能大学(MBZUAI)与新加坡科技设计大学(SUTD)联合研究团队(Momina Ahsan、Sarfraz Ahmad、Ming Shan Hee、Roy Ka-Wei Lee、Preslav Nakov)提出的TABVERSE基准数据集,旨在系统性地评估大型语言模型(LLM)与视觉语言模型(VLM)在不同表格格式下的理解能力。该数据集精心设计了HTML、Markdown与LaTeX三种代码格式及其对应的渲染PNG图像,通过控制表格内容不变、仅变换呈现格式,首次实现了对格式与模态交互作用的多维度量化分析。TABVERSE涵盖700个问答对与629个独特表格,源素材来自FEVEROUS、HybridQA、SQA、TabFact与ToTTo五个知名数据集,其结构化理解(SUC)、任务预测(QA)与格式生成(SR)三大任务体系为多模态表格理解研究树立了新的标杆。
当前挑战
TABVERSE数据集致力于攻克跨格式表格理解中的关键挑战。首先,现有模型在处理表格时普遍存在格式依赖性问题,同一表格内容以不同代码格式或图像呈现时,LLM与VLM的理解能力波动显著,且缺乏统一的评估准则。其次,构建过程中面临格式一致性与标注质量的挑战:需将来自异构源数据集的表格准确转换为三种代码格式,确保渲染图像与源代码之间语义等价,同时避免原始数据泄露对评测公正性的影响。此外,复杂推理任务(如多跳验证、比较与极值)的难度分级、表格结构探针任务(如行列检索、单元格定位)的自动化标注,以及多模态输入下模型对视觉版式与代码逻辑的协同处理能力,均为数据集设计与模型评估带来了严峻考验。
常用场景
经典使用场景
在表格理解与多模态推理的交汇地带,TABVERSE以其精密设计的对照评估框架,为研究社区提供了一座跨越格式鸿沟的桥梁。该数据集最经典的用途在于系统性评测大型语言模型与视觉语言模型对HTML、Markdown和LaTeX三种表格表示形式的理解能力,同时借助渲染后的PNG图像引入视觉模态。通过固定的表格内容与可变的呈现格式,研究者能够剥离内容本身的影响,精准度量模型在不同符号表达到视觉呈现之间转换时的鲁棒性与表征穿透力。
解决学术问题
TABVERSE直面当前表格推理研究中一个被长期忽视的症结——模型能否真正理解表格的结构性信息,抑或只是依赖于文本上的模式记忆。借助结构化理解与理解子任务和自由问答预测任务,该数据集全面检验模型对表格行列大小、单元格定位、列头检索、逆向查找等基础能力的掌握程度。这些精细化的探测任务揭示了模型在格式转换时的脆弱性,推动了学术界对文档智能中视觉与语言融合机制的深入思考。
实际应用
从办公自动化到科学文献解析,TABVERSE所覆盖的能力场景在现实世界中具有广泛辐射。企业级系统中的数据表格往往以HTML格式嵌入网页、以LaTeX格式存于学术论文、以Markdown格式出现在技术文档中,模型若能无差别地跨格式理解与重构表格,将极大提升信息抽取系统、智能问答助手与自动文档生成工具的实用性与准确率。该数据集为构建能够在异构表格环境中从容工作的智能系统提供了不可或缺的性能标尺。
数据集最近研究
最新研究方向
TABVERSE数据集聚焦于多模态表格理解的前沿探索,系统性地评估大型语言模型(LLMs)与视觉语言模型(VLMs)在HTML、Markdown、LaTeX三种文本格式及其渲染图像下的表格解析与推理能力。该研究揭示了格式与模态之间的交互效应,通过控制表格内容不变,精准衡量模型在不同表示范式中的鲁棒性。关联近期多模态大模型在文档智能、信息抽取等热点领域的发展,TABVERSE为评估模型的结构化理解与跨格式泛化提供了标准化基准,其7类推理任务(如多跳验证、聚合计数)直击现实场景中的复杂查询需求,对推动可信任AI在表格密集型应用(如科学文献分析、金融报告审核)中的落地具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务