遇见数据集

FREB-TQA

收藏
arXiv2024-04-29 更新2024-06-21 收录
官方服务:

资源简介:

FREB-TQA是一个用于表格问答系统细粒度鲁棒性评估的基准数据集,由博世人工智能中心创建。该数据集包含75,205个实例,主要用于评估表格问答系统在面对表格结构变化、相关单元格内容变化以及数值推理能力时的鲁棒性。数据集通过七种不同的扰动方法生成,并辅以人工标注,以确保评估的准确性和可靠性。FREB-TQA的应用领域主要集中在提高表格问答系统的鲁棒性,解决现有系统在面对复杂和变化环境时的不足。

FREB-TQA is a benchmark dataset for fine-grained robustness evaluation of table question answering (TQA) systems, created by the Bosch Center for Artificial Intelligence. It contains 75,205 instances, and is primarily used to evaluate the robustness of table QA systems when confronted with table structure changes, relevant cell content modifications, and numerical reasoning tasks. The dataset is generated through seven distinct perturbation methods, and is supplemented with manual annotations to ensure the accuracy and reliability of the evaluation. The main application of FREB-TQA is to enhance the robustness of table QA systems and address the shortcomings of existing systems when facing complex and dynamic environments.

创建时间:
2024-04-29
搜集汇总
数据集介绍
FREB-TQA 数据集图片
构建方式
FREB-TQA的构建基于四个广泛研究的表格问答数据集(WTQ、WikiSQL、SQA、TAT),通过启发式规则与模型分类将问题划分为提取型与推理型。针对三类鲁棒性维度,采用七种新颖的自动扰动方法(如行/列重排、目标行位移、表格转置、相关单元格移除、值修改等)生成扰动实例,并结合人工标注确保质量。最终数据集包含8,590个原始问题与75,205个扰动实例,覆盖多维度鲁棒性评估。
使用方法
使用FREB-TQA时,研究者可直接加载其公开的扰动实例与原始数据,对表格问答系统进行分维度评估。推荐采用精确匹配准确率(Em)、精确匹配差异(Emd)与变异百分比(VP)作为评价指标,以量化系统在各类扰动下的性能变化。该基准适用于端到端模型、流水线系统及大型语言模型的对比分析,其细粒度结果可为模型改进提供明确方向。
背景与挑战
背景概述
表格问答(Table Question Answering, TQA)旨在根据结构化表格数据回答自然语言问题,是连接自然语言与关系数据库、处理科学和金融等多领域信息的关键技术。然而,现有TQA系统在面对表格结构变化、数值推理偏差等问题时表现出显著的脆弱性,而先前研究未能深入剖析其鲁棒性缺陷的根源。为此,由博世人工智能中心、斯图加特传媒大学及奥格斯堡大学的研究人员于2024年共同创建了FREB-TQA基准数据集。该数据集聚焦于三大核心研究问题:系统是否能在表格结构变化下正确检索答案、是否依赖相关单元格而非捷径、是否具备稳健的数值推理能力。通过对8590个精选问题及75205个扰动实例的系统评估,FREB-TQA揭示了现有最先进TQA系统的深层缺陷,为构建更鲁棒的表格问答系统奠定了重要基础。
当前挑战
FREB-TQA所应对的核心挑战包括三个方面:首先,在表格结构变化下的检索鲁棒性方面,现有系统对行/列顺序、目标行位置及表格转置高度敏感,表现出强烈的位置偏差,即便在模型输入长度允许的范围内,性能仍随目标行下移而显著下降。其次,在注意力机制方面,许多系统倾向于利用模型内部知识或位置捷径替代对相关单元格的依赖,例如在移除相关单元格或替换为虚拟表格后,部分端到端模型仍能输出答案,暴露出对训练数据偏差的过度学习。最后,在数值聚合与比较的鲁棒性方面,系统在数值变化场景中难以正确调整答案,尤其在长表格场景下性能骤降,且对非数值型单元格的修改缺乏适应性。此外,构建过程中还面临问题类型精细分类(提取型与推理型)、高质量人工标注(如相关单元格验证与值修改)以及跨数据集迁移等挑战,需兼顾精度与效率。
常用场景
经典使用场景
在表格问答(TQA)领域,FREB-TQA 基准数据集被广泛用于评估模型在面对表格结构变化时的检索鲁棒性。研究者通过引入行/列随机打乱、目标行/列移位以及表格转置等扰动,系统性地测试模型是否能够稳定地定位并提取答案所在单元格。该场景揭示了当前主流 TQA 系统在列顺序变动或目标单元格位于表格底部时性能显著下降的现象,为深入理解模型的位置偏差提供了关键实验依据。
解决学术问题
FREB-TQA 的核心贡献在于解决了 TQA 系统鲁棒性评估中缺乏细粒度诊断的问题。以往基准难以区分错误源于单元格检索失败还是数值聚合失误,而该数据集通过将问题划分为提取型与推理型,并针对性地设计三类扰动(结构变化、相关单元格关注度、数值变化下的聚合/比较),首次实现了对模型失败根源的精准定位。这一方法论推动了鲁棒性研究从粗粒度观测向因果分析的范式转变。
实际应用
在实际应用中,FREB-TQA 为金融、科学等依赖表格数据的领域提供了可靠的模型筛选工具。例如,金融报表问答系统需同时应对表格格式差异(如行转置)与数值变动(如营收增长率计算),该基准能够识别出那些对列顺序敏感或依赖内部知识而非表格内容的模型,从而指导开发者选择或优化更适应真实数据分布的 TQA 系统,提升财务分析、科学文献信息提取等场景的决策可靠性。
数据集最近研究
最新研究方向
在表格问答(TQA)领域,最新研究聚焦于构建细粒度鲁棒性评估基准,以揭示现有模型在应对表格结构变化、关注相关单元格以及数值推理时的系统性缺陷。FREB-TQA基准通过引入七种自动扰动方法和人工标注,系统性地剖析了端到端模型、流水线模型及大语言模型在表格转置、行列重排、目标单元格移除及数值篡改等复杂场景下的脆弱性。研究发现,当前模型普遍存在位置偏置、依赖捷径推理及数值聚合能力薄弱等问题,尤其在大规模表格处理中性能显著下降。这一前沿方向不仅为开发更鲁棒的TQA系统提供了诊断工具,也推动了可解释性与符号化推理在结构化数据理解中的深度融合,对金融、科学等领域的智能化信息提取具有深远意义。
相关研究论文
  • 1
    FREB-TQA: A Fine-Grained Robustness Evaluation Benchmark for Table Question Answering博世人工智能中心 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务