bluffbench2
收藏数据链接:
官方服务:
资源简介:
bluffbench2是一个用于评估大型语言模型在数据可视化中识别细微数据质量问题的基准测试数据集,包含两个子数据集:bluff2_dataset(包含用于评估的样本,每个样本定义了多轮对话和目标答案)和bluff2_results(包含按模型、样本ID和纪元划分的评估结果)。
BluffBench2 is a benchmark dataset developed to evaluate large language models (LLMs) on their capacity to identify subtle data quality issues in data visualizations. It comprises two sub-datasets: bluff2_dataset, which contains the evaluation samples where each sample defines a multi-turn dialogue and a target answer; and bluff2_results, which stores evaluation results categorized by model, sample ID and epoch.
创建时间:
2026-07-07
原始信息汇总
数据集概述:bluffbench2
- 名称:bluffbench2
- 类型:LLM评估数据集,用于衡量AI代理在数据可视化中发现细微数据质量问题的能力。
- 来源:继承自 bluffbench。
数据集内容
- bluff2_dataset:包含26个评估样本,每个样本定义了多轮对话及目标答案。
- 主要字段:
id(样本标识符)、input(对话输入,为 tibble)、target(目标答案,即预期指出的数据质量问题描述)。 - 示例样本:
assay_rerun_specimens、bridges_repeated_inspections、claims_join_strings等。 - 数据质量问题类型:包括卡住的传感器、错误的连接、插值到线上的点、列交换、伪重复、不同单位等。
- 主要字段:
- bluff2_results:包含评估结果,涵盖多个模型在样本上的表现。
- 主要字段:
model、id、epoch、score、cost。 - 评分等级:
- C:代理主动发现人为痕迹。
- P:代理在后续提示后才注意到。
- I:从未发现。
- 结果统计:得分计算方式为每个 C 计1分,每个 P 计0.5分。整体上大多数人为痕迹被忽略;领先模型(如 Gemini 3.5 Flash、Claude Fable 5)得分在十几分左右,OpenAI系列模型得分低于10%。
- 主要字段:
评估机制
- 工作方式:通过一个通用的编码代理评估框架,结合数据分析提示。代理先进行几轮“平静”对话(生成无关图表和表格),然后被要求生成一个包含细微视觉人为痕迹的数据可视化,这些痕迹可能来自真实数据生成过程。
- 使用方式:可通过 R 包安装并运行。使用
bluff2_task()创建任务,然后调用$eval()方法评估指定模型。需要传入 ellmerChat对象。
安装与使用
- 安装:R 包,可通过
pak::pak("posit-dev/bluffbench2")安装。 - 运行评估示例: r tsk <- bluff2_task() tsk$eval( solver_chat = ellmer::chat("anthropic/claude-opus-4-7") )
搜集汇总
数据集介绍

构建方式
bluffbench2是一个专为评估大语言模型在数据可视化中识别细微数据质量问题的能力而设计的基准测试。其构建方式基于一个相对通用的编码代理框架,并结合了与数据分析相关的提示。在评估过程中,代理首先经历几个“平静”轮次,生成与评估无关的图表和表格,模拟真实对话场景。随后,代理被要求生成一幅包含微妙视觉伪影的数据可视化图像,这些伪影模拟了真实数据生成过程中可能出现的各种数据质量问题,如传感器卡顿、错误连接、点被插值到线上、列交换、伪重复、单位不一致等。
特点
该数据集的核心特点在于其精心设计的26个独特样本,每个样本模拟了一个包含细微数据质量问题的多轮对话场景。伪影类型丰富多样,涵盖了从传感器故障到数据合并错误等一系列现实问题。评估采用三级评分体系:代理自主发现伪影得C(正确)、仅在提示后注意到得P(部分正确)、始终未能察觉得I(不正确)。最终得分将每个P计为半分,以C类得分占比衡量模型表现,这使得评估结果能够精细反映模型对微妙数据问题的敏感性。
使用方法
使用bluffbench2进行模型评估时,首先需通过R包安装工具如pak安装该包。接着,调用bluff2_task()函数创建一个vitals::Task对象。然后,利用该任务的$eval()方法,并传入一个由ellmer包创建的Chat对象(其中指定待评估的模型,例如anthropic/claude-opus-4-7)作为solver_chat参数,即可启动评估流程。评估完成后,可通过bluff2_results数据集查看各模型在不同样本和轮次下的得分与成本。此外,该包还提供了bluff2_dataset数据集,包含所有样本的具体输入和目标答案,便于用户复现或分析评估细节。
背景与挑战
背景概述
bluffbench2是由Posit团队于近期开发的一款大型语言模型评估工具,旨在衡量AI代理在面对数据可视化中细微瑕疵时的数据质量警觉能力。作为bluffbench的继任者,该数据集以R语言实现,并依托vitals框架构建。其核心研究问题聚焦于当代前沿模型在多轮交互式数据分析场景中,能否自主识别诸如传感器卡顿、连接错误、伪复制、单位混淆等现实数据质量隐患。通过模拟真实分析对话,bluffbench2在低警觉性阶段后植入隐蔽的视觉伪影,从而检验模型对微小数据异常的敏感度。这一评估体系为衡量大模型在数据科学实践中的真实可靠性提供了独特视角,填补了现有基准过分强调性能而忽视数据质量意识的空白。
当前挑战
该数据集面临的挑战首先来源于领域问题本身:当代大模型在处理可视化信息时,往往缺乏对数据生成过程底层缺陷的洞察能力,例如在26个样本的测试中,多数伪影被模型遗漏,顶尖模型仅达到中高十位数的识别率,揭示了模型在现实数据质量问题上的薄弱环节。构建过程中,挑战则体现在设计逼真且多样化的伪影场景——从虚假回归到交换列、单位不一致等,每一类伪影都需确保既不显眼又具有数据科学意义上的典型性。此外,多轮对话交互的编排要求系统在自然推进中巧妙引导至特定可视化任务,避免模型预先警觉,同时保持任务间的衔接流畅,这对评估框架的灵活性与隐蔽性提出了严峻考验。
常用场景
经典使用场景
在数据科学实践中,细微的数据质量问题往往被忽略,而bluffbench2正是为评估大型语言模型(LLM)在应对数据可视化中细微异常时所表现出的警觉性而设计的基准测试。该数据集通过模拟真实数据分析对话,在特定轮次要求模型生成带有微妙视觉伪影(如传感器卡滞、连接错误、列交换、伪重复等)的图表,从而系统衡量模型是否能够自主发现并报告这些潜在的数据质量问题。这一场景聚焦于模型在长时间交互中保持对数据完整性的敏感度,而非仅完成表面任务。
实际应用
在实际应用中,bluffbench2可被企业数据团队用于筛选和采购具备更高数据审查能力的AI辅助分析工具。例如,在生物统计、市场调研或质量控制等领域,该数据集可帮助验证自动化数据分析管线中的智能代理是否能在用户未明确指示的情况下主动报告可疑结果,从而降低因忽视数据异常而导致的决策风险。此外,它也为金融审计、临床数据监控和科研数据复现性检查等场景提供了评估AI助手数据严谨性的参照基准。
衍生相关工作
bluffbench2的前身bluffbench开创了评估模型对数据可视化异常敏感性的范式,而本版本进一步扩展了伪影类型并引入了多轮对话交互机制。基于此数据集,已有研究探索了提示工程对模型异常检测能力的影响,以及不同架构模型(如Claude、Gemini与GPT系列)在数据警觉性上的显著差异。这些工作促进了面向数据质量保障的专用微调数据集和评测框架的诞生,例如将bluffbench2的异常模式整合到更广泛的数据清理与验证任务中,从而衍生出更为鲁棒的AI辅助数据质量管理工具链。
以上内容由遇见数据集搜集并总结生成



