遇见数据集

TABVERSE

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

TABVERSE是一个用于系统评估大语言模型(LLMs)和视觉语言模型(VLMs)跨格式表格理解能力的受控多模态基准数据集。其核心设计理念是将每个表格内容以三种不同的结构化格式(HTML、Markdown、LaTeX)及其对应的PNG渲染图像进行对齐表示,从而能够在保持表格内容不变的前提下,研究格式和模态之间的交互影响。数据集包含两个主要配置:1) qa(任务预测)配置,包含700个问题-表格对(350个简单问题,350个困难问题),每个样本提供了自然语言问题、黄金答案、问题难度和类别,以及表格在所有三种格式下的源代码和渲染图像。问题涵盖七种推理类别,如简单查找、条件查找、多步验证、比较与极值、聚合/计数/算术等。2) suc(结构化理解与理解/格式生成)配置,包含629个唯一的表格,专门用于表格结构解析能力的探测,提供了诸如表格尺寸检测、单元格值检索、反向查找、行列检索等任务的黄金答案。同时,该配置也支持结构重建(SR)任务,即可在任意两种格式(HTML、Markdown、LaTeX)之间进行相互转换。数据来源于多个公开的表格问答与事实验证数据集(如FEVEROUS、HybridQA、SQA、TabFact、ToTTo)的保留测试集,以避免数据污染。该数据集适用于多种任务,包括表格问答(QA)、结构化表格理解(SUC)以及跨格式表格生成(SR),旨在全面评估模型在处理不同表格表示形式时的能力。

TABVERSE is a controlled multimodal benchmark dataset designed for systematically evaluating the cross-format table understanding capabilities of large language models (LLMs) and vision-language models (VLMs). Its core design concept involves aligning each table content in three different structured formats (HTML, Markdown, LaTeX) and their corresponding PNG rendered images, enabling the study of interactions between formats and modalities while keeping the table content unchanged. The dataset includes two main configurations: 1) The qa (task prediction) configuration, which contains 700 question-table pairs (350 simple questions, 350 difficult questions). Each sample provides a natural language question, a gold answer, question difficulty and category, as well as the source code and rendered images of the table in all three formats. The questions cover seven reasoning categories, such as simple lookup, conditional lookup, multi-step verification, comparison and extremum, aggregation/counting/arithmetic, etc. 2) The suc (structured understanding and comprehension/format generation) configuration, which includes 629 unique tables specifically designed for probing table structure parsing capabilities, providing gold answers for tasks such as table size detection, cell value retrieval, reverse lookup, and row/column retrieval. This configuration also supports the structure reconstruction (SR) task, allowing mutual conversion between any two formats (HTML, Markdown, LaTeX). The data is sourced from the reserved test sets of multiple public table question answering and fact verification datasets (e.g., FEVEROUS, HybridQA, SQA, TabFact, ToTTo) to avoid data contamination. The dataset is suitable for various tasks, including table question answering (QA), structured table understanding (SUC), and cross-format table generation (SR), aiming to comprehensively evaluate model capabilities in handling different table representations.

创建时间:
2026-06-05
原始信息汇总

数据集概述

TABVERSE 是一个受控多模态表格基准数据集,用于评估大型语言模型(LLMs)和视觉语言模型(VLMs)在跨格式表格理解方面的能力。该数据集由穆罕默德·本·扎耶德人工智能大学(MBZUAI)和新加坡科技设计大学(SUTD)的研究人员构建。

核心特性

  • 多格式对齐:同一张表格以 HTML、Markdown、LaTeX 三种格式的源代码及渲染后的 PNG 图像形式呈现,确保表格内容在三种视图下完全一致。
  • 数据集规模
    • qa 配置:包含 700 个问答对(其中 350 个简单、350 个困难)。
    • suc 配置:包含 629 张独特表格。
  • 来源数据集:表格源自 FEVEROUS、HybridQA、SQA、TabFact 和 ToTTo 等数据集的独立分割,避免污染。
  • 评估模型:已评估 17 个模型,包括开源权重 VLMs、开源权重 LLMs、GPT-4o 和 Gemini。

数据集配置

1. qa — 任务预测(700 行)

每一行对应一个问答对,包含问题、正确答案、难度、类别,以及表格在三种格式下的渲染图像和源代码。

列名 类型 描述
id int 行索引
image_id string 唯一表格标识符
html_image Image HTML 表格的 PNG 渲染图像
markdown_image Image Markdown 表格的 PNG 渲染图像
latex_image Image LaTeX 表格的 PNG 渲染图像
html_code string 原始 HTML 源代码
markdown_code string 原始 Markdown 源代码
latex_code string 原始 LaTeX 源代码
table string JSON 编码的 {header, rows} 结构
query string 自然语言问题
label list[string] 黄金标准答案
question_category string 7 种推理类别之一
question_difficulty string 简单或困难
dataset string 来源数据集
score int 标注的复杂度分数

问题类别:简单查找 · 条件查找 · 多项查找 · 单步二元验证 · 多步二元验证 · 比较与极值 · 聚合/计数/算术

2. suc — 结构化理解与理解 / 格式生成(629 行)

每一行对应一张唯一表格。该配置提供用于结构探测任务的黄金答案,同时支持结构重建(SR)任务,即从一个格式生成另一个格式。

列名 类型 描述
id int 行索引
image_id string 唯一表格标识符
html_image Image HTML 表格的 PNG 渲染图像
markdown_image Image Markdown 表格的 PNG 渲染图像
latex_image Image LaTeX 表格的 PNG 渲染图像
html_code string 原始 HTML 源代码
markdown_code string 原始 Markdown 源代码
latex_code string 原始 LaTeX 源代码
table string JSON 编码的 {header, rows} 结构
dataset string 来源数据集
table_partition string 表格所属分区
size_detection string 黄金答案:`{行数}
cell_value string 黄金答案:采样单元格的值
cell_lookup string 采样单元格坐标 `{行}
reverse_lookup_indices string 反向查找的行/列索引
reverse_lookup string 黄金答案:反向查找的值
column_idx int 采样的列索引
column_retrieval string 黄金答案:该列的标题
row_idx int 采样的行索引
row_retrieval string 黄金答案:整行内容
table_first_cell string 单元格 (0, 0) 的值
table_last_cell string 最后一个单元格的值
number_of_rows int 表格行数
number_of_columns int 表格列数

任务

1. SUC — 结构化理解与理解

旨在隔离表格解析能力,所有答案仅从表格结构中推导。

子任务 输入 黄金答案列
大小检测 表格图像/代码 size_detection
单元格值检索 表格 + cell_lookup 坐标 cell_value
反向查找 表格 + reverse_lookup reverse_lookup_indices
列检索 表格 + column_idx column_retrieval
行检索 表格 + row_idx row_retrieval
首/末单元格 表格 table_first_cell, table_last_cell

2. QA — 任务预测

基于表格的自由形式自然语言问答,使用 qa 配置,评估指标为归一化后的精确匹配。

3. SR — 结构重建(格式生成)

给定一种格式的表格,生成另一种格式的表格,支持六种转换方向(HTML↔Markdown、HTML↔LaTeX、Markdown↔LaTeX),评估指标为 BLEU 和结构相似性。

评估模式

模型在三种模式下进行评估:

模式 输入 评估模型示例
LLM 纯文本(三种代码格式之一) Qwen2.5-3B/7B, SmolLM2-1.7B, GPT-4o, Gemini
VLM-Image 渲染的 PNG 图像 Qwen-VL-2.5-3B/7B, SmolVLM-1.7B, GPT-4o, Gemini
VLM-Text 代码字符串(输入给 VLM) 与 VLM-Image 相同的 VLMs 的纯文本模式

主要评估指标为每项任务和每种格式的精确匹配准确率。

许可协议

数据集采用 CC-BY-4.0 许可证。

搜集汇总
数据集介绍
TABVERSE 数据集图片
构建方式
TABVERSE通过系统化地整合来自FEVEROUS、HybridQA、SQA、TabFact和ToTTo等五个公开数据集的表格内容,构建了一个跨格式对齐的多模态表格理解基准。数据集的核心构建策略在于,对每一张表格同时提供HTML、Markdown和LaTeX三种文本格式的源代码及其对应的渲染PNG图像,确保表格内容在三种视图下保持完全一致。最终形成包含629张独特表格、700个问题-表格对的测试集,并划分为qa(问答任务预测)和suc(结构理解与格式生成)两个配置子集。
特点
该数据集最显著的特点在于其精细的跨格式与跨模态对齐设计,使得每个表格都同时具备三种文本格式和一种视觉渲染,为系统性探究格式与模态对表格理解能力的影响提供了理想的控制变量。qa配置包含了涵盖七类推理任务的问答对,并由人工标注了难度与复杂度分数;suc配置则提供了丰富的结构探测标注,包括大小检测、单元格检索、行列定位等子任务,并支持六种格式间的重构生成。此外,数据集规模精巧(不足1000条),便于高效而全面地评估模型表现。
使用方法
研究者可通过HuggingFace Datasets库便捷加载TABVERSE,使用`load_dataset('MBZUAI/TABVERSE', name='qa', split='test')`获取问答任务数据,每条记录包含自然语言问题、标签、三种格式源代码及渲染图像。加载`name='suc'`配置则可执行结构理解子任务,例如利用`size_detection`、`cell_value`等字段进行表格结构探测。该配置也支持格式生成任务,例如以HTML代码为输入、Markdown代码为生成目标进行结构重构。评估标准采用精确匹配准确率,并结合BLEU与结构相似度进行多维度评测。
背景与挑战
背景概述
表格作为一种高效组织和呈现结构化信息的载体,在众多领域中扮演着不可或缺的角色。然而,表格在现实世界中往往以HTML、Markdown、LaTeX等多种格式存在,这给大语言模型(LLM)和视觉语言模型(VLM)的跨格式理解带来了严峻挑战。为系统性地评估模型对异构表格格式的解析与推理能力,来自穆罕默德·本·扎耶德人工智能大学(MBZUAI)与新加坡科技设计大学(SUTD)的研究团队于2025年共同构建了TABVERSE基准数据集。该数据集通过精密的实验设计,将同一表格内容严格对齐至HTML、Markdown和LaTeX三种文本格式及其渲染后的PNG图像,确保了模态与格式差异的纯粹性。TABVERSE涵盖700个问答对与629张独立表格,整合了FEVEROUS、HybridQA、SQA、TabFact和ToTTo五大源数据集的验证集,首次为跨格式表格理解提供了全方位的多模态评估框架,对推动表格理解领域的标准化评测具有里程碑式的影响。
当前挑战
TABVERSE所应对的核心领域挑战在于,现有LLM与VLM对表格的理解能力高度受限于训练数据的格式分布,模型在遭遇未见过的表格表征形式时往往表现急剧退化,暴露出泛化能力的严重不足。此外,不同格式间内在的结构化信息差异(如LaTeX的排版逻辑与HTML的标签层级)要求模型具备超越表层文本的深度语义迁移能力,这对现有的编码与推理机制构成了根本性考验。在数据集构建层面,关键挑战集中体现在三方面:第一,需在保持表格内容完全一致的前提下,精准生成并校验HTML、Markdown与LaTeX三种格式的等价表示,手工转换极易引入噪声与人为偏差;第二,从五个异源数据集中筛选表格时,必须严格剔除训练集以保证评测的无污染性,这大幅压缩了可用数据量;第三,针对大语言模型与视觉语言模型各自的能力边界,设计出包括结构化理解、自由问答与格式重构在内的三类评测子任务,并确保每项子任务中的标注答案具备高度的可验证性与客观性,从而规避了主观评估的模糊性风险。
常用场景
经典使用场景
在表格理解与多模态推理的交叉领域中,TABVERSE数据集被设计为一项系统性基准测试,用于评估大语言模型与视觉语言模型对跨格式表格的语义解析能力。该数据集的核心设计哲学在于通过严格对齐HTML、Markdown、LaTeX三种代码表示与其渲染所得的PNG图像,在内容固定的前提下,精准度量格式差异与模态变化对模型性能的影响。研究者能够利用这一数据集在统一的控制条件下,对模型执行结构化理解与理解(SUC)、基于自然语言的问题回答(QA)以及表格结构重建(SR)三类任务进行验证,从而揭示不同表示格式下模型感知与推理的表征差异。
解决学术问题
TABVERSE直击当前多模态表格理解研究中的关键盲区——模型在面对异构格式的表格时是否具有一致的语义理解能力。长期以来,现有基准往往只评估单一格式下的模型表现,无法分离格式本身带来的干扰,导致对模型真实能力的评估存在偏差。TABVERSE通过构建格式可控且内容完全一致的测试样本,使得研究者首次能够系统性地解耦格式与语义,回答模型是否真正理解表格内容抑或仅仅依赖表面格式记忆。这一设计对于推进表格推理、事实核查、多跳问答等学术议题具有深远意义,为理解跨格式泛化能力提供了精确的度量工具,也在方法论上为构建更加公平和透明的大模型评估体系树立了典范。
衍生相关工作
TABVERSE的发布催生了一系列富有启发的后续研究,包括但不限于针对不同表格格式之间表示迁移的探索、视觉语言模型的跨模态对齐能力分析,以及基于可控表格样本的推理鲁棒性评估。研究者基于该数据集提出了多项改进方法,例如设计格式增强的多模态编码器、利用结构重建任务训练模型以提升格式理解一致性,以及构建面向表格的对抗样本生成策略。此外,TABVERSE的数据构建方案也为现有的表格理解基准如TabFact、WikiTQ引入了格式维度上的扩展视角,推动了跨数据集迁移评估的能力提升,在多模态推理、表格数据生成与格式感知训练范式等方向上激发了新的研究范式与评估标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务