遇见数据集

InSight

收藏
arXiv2026-09-01 更新2026-09-03 收录
数据链接:
官方服务:

资源简介:

InSight是一个面向交互式可视化环境的代理式声明验证基准数据集,由伦敦大学城市学院、帝国理工学院和艾伦·图灵研究所联合创建。该数据集包含21,349条自然语言声明,源自297个人类撰写的分析笔记本,每条声明关联至基于Vega-Lite的交互式可视化界面,并标注为支持、反驳或证据不足三种类别。数据集构建历经四个阶段:从叙述中提取统计或视觉洞察片段、分解为原子声明、通过受控变异生成反驳与证据不足声明,最后经专家验证确保标签质量。InSight旨在评估模型在动态、部分可观测的可视化环境中主动搜寻证据并验证声明真实性的能力,弥补了传统静态图表理解基准缺乏交互与序列决策的不足。

InSight is a proxy-based claim verification benchmark dataset tailored for interactive visualization environments, co-developed by City, University of London, Imperial College London, and the Alan Turing Institute. This dataset comprises 21,349 natural language claims derived from 297 human-authored analytical notebooks. Each claim is associated with a Vega-Lite-powered interactive visualization interface and annotated with one of three categories: supported, refuted, or insufficient evidence. The development of the InSight dataset follows four sequential stages: extracting statistical or visual insight snippets from narratives, decomposing these snippets into atomic claims, generating refuted and insufficient-evidence claims via controlled perturbation, and finally conducting expert validation to ensure annotation quality. InSight aims to evaluate a model's capacity to actively search for evidence and verify the validity of claims in dynamic, partially observable visualization environments, addressing the gap left by traditional static chart understanding benchmarks that lack interactivity and sequential decision-making capabilities.

创建时间:
2026-09-01
原始信息汇总

数据集概述

InSight 是一个用于评估多模态智能体在交互式可视化环境中进行声明验证(Claim Verification)能力的基准测试集。它要求智能体面对一个交互式 HTML 可视化图表和一句自然语言命题,通过多轮操作(点击、悬停、导航)与图表交互,最终将命题分类为 True(正确)、False(错误)或 NotEnoughInfo(信息不足)。

数据集内容

数据集文件存放于 data/ 目录下,包含以下部分:

  • 测试集 (data/insight_test.jsonl):包含 500 条命题,三个类别(True / False / NotEnoughInfo)数量均衡分布。
  • 扩展集 (data/insight_extended.jsonl):在相同可视化图表基础上,额外包含 20,849 条命题。
  • 可视化图表 (data/html/):共 297 个被命题所引用的交互式 HTML 可视化文件。

每个 JSONL 样本包含以下字段:

字段 说明
source_id 样本唯一标识符
html_file 对应的 HTML 文件相对路径(如 html/602.html
proposition 待验证的自然语言命题
class 真实标签,取值为 True / False / NotEnoughInfo

环境与运行

该基准环境使用 Playwright 渲染可视化图表,支持通过 HuggingFace 评估开源模型,以及通过 OpenAI 兼容 API 评估闭源模型,实验结果可记录至 Weights & Biases。

环境安装:需创建 Python 3.12 的 conda 环境,安装依赖并下载 Chromium 浏览器。

运行方式:可通过 run_benchmark.py 脚本调用,支持 HuggingFace 本地模型、UI-TARS 系列模型(使用特殊 Thought: / Action: 输出格式)以及 OpenAI/Gemini 等 API 模型。脚本支持配置最大交互轮数(默认 10 轮)、采样参数(top-ptop-ktemperature 等)以及提示词与解析模式(defaultui_tars)。可通过 --limit / --offset 参数运行数据子集以快速测试。

许可证

该数据集及代码基于 CC BY-NC-SA 4.0 许可证发布。

搜集汇总
数据集介绍
InSight 数据集图片
构建方式
InSight数据集源自297个人类分析师撰写的交互式可视化笔记本,这些笔记本结合了Vega-Lite可视化与自然语言叙述。构建流程分为四个阶段:首先,基于Lundgard和Satyanarayan的四层语义模型,通过三次独立的大型语言模型运行提取统计性和视觉性洞察的文本片段,并采用基于三元词组重叠的共识机制合并,以剔除幻觉提取。其次,将保留的片段分解为原子化、去语境化的命题,通过自验证确保其语义一致性,并重新分配语义标签。随后,通过三种受控变异策略生成假声明和证据不足声明:反义词替换、词表内参数替换和词表外参数替换,并利用预训练的NLI模型筛选验证,确保语义关系符合预期。最后,由13名专家进行人工验证,采用贝叶斯Dawid-Skene模型校准标签,确保数据集质量。
特点
InSight包含21,349条声明,其中True占41.6%,False占45.0%,NEI占13.4%,平均每条声明18个词。数据集的视觉环境均基于Vega-Lite构建,每个笔记本平均包含4.5个视图和3.7个可视化规范,67%的笔记本采用多视图组合,这使得验证任务需跨视图定位相关证据。环境设计为部分可观测,所有声明均无法从初始视口直接验证,需依赖悬停提示、点击选择等交互机制揭示证据。此外,交互轨迹被视为推理过程的显式代理,通过交互效率得分(IES)评估模型是否有效探索环境,以惩罚被动感知。数据集还提供明确的NEI监督,挑战了传统静态基准的局限性,反映了真实分析流程的动态性。
使用方法
InSight的使用涉及模型需在网页环境中执行交互式声明验证任务,模型仅接收当前视口的RGB截图,无法访问DOM或HTML源码,通过受限动作空间(如滚动、点击、悬停、拖拽)与环境交互,最终输出True、False或NEI标签。每个实例预设最大交互预算(如10步),模型需在有限动作内收集证据。评估时,模型需根据截图和声明选择单一动作直至提交答案。核心指标为交互效率得分(IES),兼顾答案准确性与有效交互比例,有效动作定义为引起环境状态变化的操作,正确但未交互的答案得分为零。该基准支持对多模态代理的探索策略、证据获取及推理行为进行细粒度分析,适用于评估模型在交互式可视化中的视觉验证能力及反证推理的鲁棒性。
背景与挑战
背景概述
InSight基准数据集由伦敦城市大学与帝国理工学院的研究团队于2026年联合推出,旨在填补交互式可视化环境中智能体声明验证研究的空白。该数据集包含21,349条源自人类专家分析叙事的声明,并配套完整的交互式Vega-Lite可视化环境,覆盖真、假及信息不足三类标签。其核心研究问题在于,视觉语言模型能否在动态、部分可观测的界面中通过主动探索有效获取证据并验证数据声明。作为首个将智能体决策过程与可视化推理深度融合的基准,InSight为评估多模态智能体的视觉素养与交互推理能力提供了新范式,对推动可信人工智能在数据分析领域的发展具有重要影响。
当前挑战
InSight面临的挑战可分为两个层面。在领域问题上,视觉语言模型虽在静态图表理解上表现优异,却普遍缺乏交互式环境中的可视化素养,难以处理证据被遮挡、跨视图分布或需用户操作才能揭示的场景,验证过程常陷入盲目探索与过早结论的困境。在数据集构建层面,如何从多样化的分析叙事中稳定提取可验证声明、生成语义可控且质量均衡的假声明与信息不足声明,以及确保人工标注的一致性,均是攻坚难点。此外,部分可观测环境的设计使得无交互的正确回答无法视为有效的视觉推理,凸显了构建过程中平衡真实性与评价指标合理性的复杂性。
常用场景
经典使用场景
InSight基准的核心应用场景在于对交互式可视化环境中的声明进行智能体验证,模拟真实数据分析过程中用户通过点击、悬停和滚动等操作主动探索证据的认知行为。该数据集针对部分可观察环境设计,证据往往隐藏于多视图仪表板或动态提示信息之后,要求模型具备顺序决策与视觉证据综合能力,从而超越传统静态图像问答的局限。它提供了21,349条基于专家分析笔记的真实声明,涵盖支持、反驳及信息不足三类标签,是评估视觉语言模型在动态数据探索任务中表现的首创性工具。
衍生相关工作
InSight的提出催生了一系列后续研究,包括改进视觉语言模型在交互式环境中的目标导向探索策略、开发基于交互轨迹的推理可视化分析工具,以及将触觉提示与筛选操作整合进强化学习框架以优化证据采集。其标签生成流程启发了更严谨的声明变异与NLI验证方法,而交互效率指标影响了对代理系统脆弱性的评估标准。该数据集也推动了多模态事实核查与图表达推理的交叉探索,成为连接视觉叙事、人机交互与自主智能体研究的关键桥梁。
数据集最近研究
最新研究方向
该数据集的前沿研究聚焦于将视觉语言模型从静态图表理解拓展至交互式可视化环境中的智能体式验证任务,旨在逼真再现数据分析中证据部分隐藏、跨视图分布以及依赖用户操作揭示信息的真实场景。其研究方向包括设计能主动执行点击、悬停、滚动等操作以验证自然语言主张的自适应智能体,引入交互足迹作为推理过程的可追踪代理,并提出交互效率评分以识别缺乏视觉基础的无依据预测。这一方向深化了对模型主动证据搜寻策略、多维信息综合能力及证伪难度的理解,为构建具备真实可视化素养和多模态论证能力的下一代智能系统提供了关键评测基座。
相关研究论文
  • 1
    InSight: A Benchmark for Agentic Claim Verification in Interactive Visualizations伦敦大学城市学院; 帝国理工学院; 艾伦·图灵研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务