遇见数据集

gbag-bench

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

GBAG-Bench(Grounded BI Answer Generation)是首个公开基准数据集,用于衡量大型语言模型(LLM)将SQL查询结果忠实、完整、有洞察力地解释为自然语言答案的能力。该数据集旨在弥补现有基准(如Spider、BIRD、WikiSQL)仅关注SQL生成正确性而忽略自然语言答案生成质量的不足。数据集包含35个精心标注的英文问题,覆盖三个公共示例数据库:Sakila(DVD租赁,约5MB)、Chinook(音乐商店,约1MB)和Northwind(批发贸易,约25MB)。每个样本以JSON对象形式存储,包括唯一标识符(id)、数据库名称(database)、自然语言问题(question)、参考SQL查询(gold_sql)、参考自然语言答案(gold_answer)、难度等级(difficulty,1-10级)、问题类别(category)和预期洞察列表(expected_insights)。核心任务是在给定自然语言问题、SQL查询结果和完整结果集的情况下,生成忠实于数据、完整且具洞察力的自然语言答案。评估采用LLM作为评判者,基于忠实性、完整性和洞察力进行综合打分(权重分别为0.50、0.30和0.20)。数据集适用于表格问答、文本生成等任务,规模较小(<1K),主要用于基准测试和模型能力评估。

GBAG-Bench (Grounded BI Answer Generation) is the first public benchmark dataset designed to measure the ability of large language models (LLMs) to faithfully, completely, and insightfully interpret SQL query results into natural language answers. It addresses the limitation of existing benchmarks (such as Spider, BIRD, and WikiSQL) that focus only on SQL generation correctness while neglecting the quality of subsequent natural language answer generation. The dataset contains 35 carefully annotated English questions covering three well-known public example databases: Sakila (DVD rental, approximately 5MB), Chinook (music store, approximately 1MB), and Northwind (wholesale trade, approximately 25MB). Each sample is stored as a JSON object with fields including unique identifier (id), database name (database), natural language question (question), reference SQL query (gold_sql), reference natural language answer (gold_answer), difficulty level (difficulty, 1-10), question category (category), and a list of expected insights (expected_insights). The core task is to generate a natural language answer that is faithful to the data, complete in covering key information, and insightful, given a natural language question, the executed SQL query (gold reference), and the full result set (rows and columns). Evaluation uses an LLM as a judge, scoring based on handcrafted gold answers and expected insight lists, with a composite score formula: GBAG score = 0.50 × faithfulness + 0.30 × completeness + 0.20 × insightfulness, where faithfulness has the highest weight, reflecting the severity of hallucinated numbers leading to incorrect real-world decisions in BI scenarios. The dataset is suitable for tasks such as table question answering, text-to-text generation, and text generation, particularly for evaluating LLMs in grounded generation, reducing hallucinations, data analysis, and business intelligence report generation. The dataset is small in scale (<1K) and primarily used for benchmarking and model capability assessment rather than drawing final conclusions.

创建时间:
2026-06-25
搜集汇总
数据集介绍
gbag-bench 数据集图片
构建方式
GBAG-Bench数据集旨在评估大语言模型在商业智能场景下,将SQL查询结果转化为自然语言回答的忠实度。其构建过程独具匠心:首先从Sakila、Chinook和Northwind三个经典SQLite样本数据库中精心挑选了35条自然语言问题,覆盖聚合、趋势、比较、排序、过滤、连接和衍生七类查询。针对每个问题,研究者手工编写了参考SQL语句、标准自然语言回答以及期望的回答必须包含的原子洞察点,并标注了1至10级的难度等级。数据集以JSONL格式存储,字段包括问题、标准SQL、标准答案、预期洞察列表等详细信息,便于研究者直接加载与使用。
特点
该数据集的核心特点在于聚焦于NL2SQL任务中被长期忽视的后半程——即SQL执行后生成自然语言回答的忠实度与完整性。与Spider、BIRD等仅衡量SQL正确性的基准不同,GBAG-Bench通过一个精心设计的评分体系来全面评估回答质量:忠实度占50%,完整性占30%,洞察力占20%,其中忠实度的最高权重体现了商业智能场景下数据准确性的极端重要性。此外,数据集规模虽小但高度精炼,35个问题涵盖多个难度级别,且每个问题均具有原子洞察点列表,为自动化评估提供了粒度化的标准。
使用方法
使用GBAG-Bench进行评估时,研究者需首先通过HuggingFace Datasets库加载数据,每个问题包含标准SQL和对应的SQLite数据库文件,可直接执行SQL获取完整结果集。随后,将问题、SQL和结果集输入待评估模型,令其生成自然语言回答。最后,利用内置的LLM裁判系统对模型输出进行打分,该系统支持双裁判协议以增加评估可靠性。完整评估流程封装在GitHub仓库的开源工具链中,包括基线运行器和打分裁判,单次评估成本约0.4美元,支持多种模型提供商接口,便于研究者快速复现榜单成绩。
背景与挑战
背景概述
GBAG-Bench (Grounded BI Answer Generation Benchmark) 于2026年由Fouad Zerga与R. Zakarya等人提出,旨在填补自然语言到SQL(NL2SQL)领域长期存在的一项关键空白。现有基准测试如Spider、BIRD和WikiSQL仅评估模型生成正确SQL的能力,忽视了商业智能(BI)产品中用户最终阅读的是基于SQL结果生成的自然语言答案这一核心环节。该数据集围绕三个经典数据库(Sakila、Chinook、Northwind)构建了35道人工标注的问题,覆盖聚合、趋势、比较、排序等七类推理任务,并首次引入“忠实度、完整性、洞察力”三维加权评分体系,为衡量大语言模型在SQL结果解释中的忠实生成能力提供了标准化评估框架。其发布标志着NL2SQL研究从“SQL生成正确性”向“端到端答案质量”的范式转变,对BI领域的人机交互质量提升具有里程碑意义。
当前挑战
GBAG-Bench所解决的领域核心挑战在于:即便模型生成了正确的SQL查询,其在将执行结果转化为自然语言答案时仍极易产生幻觉——例如捏造数字、颠倒趋势或遗漏关键洞见,这在商业决策中会直接引发错误行动。当前基准仅关注SQL生成,完全忽略了这一“后SQL”阶段的忠实性危机。在数据集构建过程中,研究者面临多重困难:首先,35道问题需在设计上精确对应不同难易等级(L1至L10),并确保每个答案对应的原子性洞见(expected_insights)具有无歧义的标注一致性;其次,LLM作为评判者的固有偏差问题显著——实验表明更换评判模型可导致同一答案产生高达13分的评分差异,这迫使GBAG引入双评判协议与Cohen's kappa系数来保障评估可靠性;此外,数据集规模较小且仅包含三个公开数据库,存在训练数据污染风险及多语言扩展需求,这些限制为v0.3版本的扩展工作指明了方向。
常用场景
经典使用场景
GBAG-Bench(Grounded BI Answer Generation Benchmark)是首个专注于评估大语言模型在商业智能场景中,基于SQL查询结果生成忠实自然语言答案能力的公开基准。其核心使用场景在于衡量模型能否将从结构化数据中提取的信息,以准确、完整且富有洞察力的方式转化为用户可读的文本回答。研究者通过向模型提供自然语言问题、标准SQL以及完整的执行结果集,要求模型生成答案,并由LLM裁判依据忠实性(50%)、完整性(30%)和洞察力(20%)三项加权指标进行自动评分。该基准特别强调忠实性在BI决策中的关键地位,因为任何幻觉数字都可能导致错误的商业决策。
解决学术问题
GBAG-Bench精准填补了现有NL2SQL基准如Spider、BIRD和WikiSQL的空白——这些基准仅评估模型生成正确SQL的能力,却忽略了从SQL结果到自然语言答案这一关键转换步骤中的失败风险。学术界长期困惑于为何正确SQL查询后仍会出现用户不满意的现象,GBAG-Bench通过隔离并量化“后SQL生成阶段”的忠实性问题,揭示了模型在解读数据趋势、聚合数值和比较结果时频繁出现幻觉得分的根本机制。该基准的提出推动了从单纯关注SQL正确性转向关注端到端答案质量的范式转变,为研究大模型在结构化任务中的忠实性退化、上下文工程对抗幻觉等核心学术问题提供了标准化评估工具。
衍生相关工作
GBAG-Bench的发布催生了一系列围绕结构化数据忠实生成的相关研究工作。最显著的成果是DeskInsight上下文工程管线,该工作证明了通过数据字典注入、预聚合上下文注入和领域自适应提示等轻量级技术,即使仅有9B参数的本地模型也能在忠实性得分上超越480B参数的云端模型,揭示了上下文工程相对于模型规模的主导性优势。此外,该基准发现的“后SQL聚合赤字”模式——小模型在Top-N查询中常从原始行样本编造聚合结果——推动了针对性缓解策略的研究。同时,双裁判协议与Cohen's kappa的一致性分析成为评估LLM裁判可靠性的重要参考,激励了更稳健的自动评估范式设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务