awesome-misleading-visualizations
收藏官方服务:
资源简介:
这是一个精心策划的资源集合,专注于误导性可视化及其与人工智能研究交互的主题。它收集和索引了相关的研究论文、数据集和其他资源,覆盖了误导性可视化检测、纠正、问答以及自动化事实核查等领域。该合集旨在为研究人员和从业者提供一个全面的参考目录,以促进该领域的发展。
This is a curated collection of resources focused on the topic of misleading visualizations and their intersection with artificial intelligence research. It collects and indexes relevant research papers, datasets and other resources, spanning fields such as misleading visualization detection, correction, question answering, and automated fact-checking. This collection aims to provide a comprehensive reference catalog for researchers and practitioners to advance the development of this field.
创建时间:
2025-09-01
原始信息汇总
数据集与资源总览
该页面是一个关于“误导性可视化及其与AI研究交互”的精选资源集合,涵盖了论文、数据集和相关资源。
主要研究方向
- 误导性可视化问答(QA):研究人类及AI模型(如多模态大语言模型)在面对误导性图表时的表现与鲁棒性。
- 相关数据集:
- Pandey et al. (CHI 2015): 李克特量表、选择题
- Lauer & OBrien (SIGDOC 2020): 李克特量表
- CALVI (CHI 2023): 选择题
- CHARTOM (arXiv 2025): 选择题、自由文本、排序
- Real-world (ACL 2025): 选择题
- Misleading ChartQA (EMNLP 2025): 选择题
- Mahbub et al. (VIS 2025): 李克特量表
- AttackViz (arXiv 2026): 自由文本
- 相关数据集:
- 误导性可视化检测与修正:开发用于识别图表是否具有误导性、并定位具体问题的数据集与检测技术。
- 检测数据集:
- MISCHA-QA (2024): 合成数据
- DCDM (LNAI 2025): 合成数据
- Misvisfix (VIS 2025): 真实世界数据
- Misviz (ACL 2025): 真实世界数据
- Misviz-synth (ACL 2025): 合成数据
- MisVisBench (arXiv 2026): 真实世界数据
- True (VIS) Lies (arXiv 2026): 真实世界数据
- HVPD (IEEE Access 2026): 合成数据
- 检测数据集:
- 检测可视化篡改:专注于检测直接应用于图表图像的可视化编辑。
- 分析与分类法:提供误导性可视化的分类法,并分析其对网络用户的影响。
- 基于可视化的自动事实核查:利用可视化作为可靠证据,自动检测虚假声明。
搜集汇总
数据集介绍

构建方式
在数据可视化与人工智能交叉领域,误导性可视化(misleading visualizations)日益成为研究焦点。该数据集以GitHub仓库形式构建,系统收集并整理了来自顶级学术会议与期刊(如TVCG、CHI、ACL、EMNLP等)的相关论文、数据集及资源。构建过程遵循社区驱动原则,通过开放PR(Pull Request)机制吸纳学术界最新成果,并由维护团队定期更新至2026年,确保资源的时效性与全面性。数据集内容涵盖问答(QA)、检测与校正、分析分类学及自动化事实核查等多个子领域,每个条目均附有论文链接、代码仓库及数据集访问地址,形成结构化知识图谱。
特点
该数据集的核心特色在于其跨学科整合能力与动态演化机制。它不仅收录了传统人类被试实验研究(如Pandey et al. 2015),更聚焦于多模态大语言模型(MLLM)在误导性图表上的脆弱性评估,涵盖从规则检测器到AI模型的多层次检测方法。数据集包含真实世界与合成数据两种类型,如Misviz(真实世界)与MISCHA-QA(合成),支持从Likert量表到多选题、自由文本等多种评测范式。此外,其分类学部分揭示了误导性可视化的修辞策略与设计缺陷,为理论框架构建提供实证基础。
使用方法
使用者可通过GitHub仓库的目录结构(Table of Contents)快速定位所需子领域,如'QA with misleading visualizations'或'Misleading visualization detection and correction'。每个条目均提供可直接访问的论文DOI、代码仓库及数据集链接(如Hugging Face数据集UKPLab/misviz)。研究人员可下载相应数据集进行模型训练或评估,或通过提交Issue或PR参与资源贡献。该仓库还标注了每个资源的发表年份与会议信息,便于追踪领域发展脉络。建议结合配套论文中的实验设置(如提示词模板、评估指标)进行复现或扩展研究。
背景与挑战
背景概述
随着数据可视化在日常信息传播与决策支持中的广泛应用,误导性图表所带来的认知风险与信息操纵问题日益凸显。为系统探究这一现象,德国达姆施塔特工业大学UKP实验室的Jonathan Tonglet等人于2025年前后发起并维护了“awesome-misleading-visualizations”资源库,旨在汇集关于误导性可视化及其与人工智能交互的前沿研究成果。该资源库涵盖了从传统人为实验到多模态大语言模型脆弱性测试的多维度研究,核心问题聚焦于如何量化、检测并纠正图表中的误导性设计,以及如何提升AI模型在复杂视觉推理任务中的鲁棒性。这一系统性梳理不仅为可视化误导性研究提供了基准参考,也推动了人机交互、计算语言学与信息可视化等领域的交叉融合,其影响力在TVCG、ACL、EMNLP等顶级会议论文中持续显现。
当前挑战
该领域面临的核心挑战包括:其一,误导性视觉化的表现形式高度多样,涵盖坐标轴截断、面积比例失真、选择性数据呈现等数十种策略,现有模型在跨类型泛化检测上仍存在显著盲区;其二,真实世界中的误导性图表往往嵌入复杂的语义上下文与修辞意图,使得基于规则或简单分类的检测方法难以识别深层欺骗;其三,构建高质量标注数据集极具难度,需兼顾图表的真实性、误导类型的覆盖度以及标注者间的一致性,同时避免合成数据与真实场景之间的分布偏移;其四,多模态大语言模型在面对精心设计的误导性图表时,常表现出令人担忧的脆弱性,如何设计有效的对抗训练与鲁棒推理框架成为亟待突破的技术瓶颈。
常用场景
经典使用场景
在信息可视化与人工智能交叉领域,误导性可视化数据集常被用于评估多模态大语言模型对图表中潜在欺骗性元素的鲁棒性。研究者通过构建包含截断坐标轴、不当比例缩放、选择性数据呈现等典型误导手法的图表问答任务,系统性地测试模型在理解、推理与回答时的脆弱性。这类场景不仅揭示了当前视觉语言模型在感知偏见与逻辑谬误面前的局限性,也为设计更可信、更透明的可视化交互系统提供了关键基准。
衍生相关工作
该数据集衍生了一系列具有里程碑意义的学术工作,包括基于规则的可视化审查工具如VizLinter与VisuaLint,它们通过形式化方法自动检测图表中的欺骗性元素。此外,MisVisFix等交互式系统结合大语言模型实现了误导图表的定位、解释与自动修正。在基准测试方面,Misleading ChartQA与CHARTOM等数据集进一步扩展了评估维度,引入了理论心智推理与多轮对话场景,推动了对模型视觉欺骗理解能力的深入探索。
数据集最近研究
最新研究方向
在数据可视化与人工智能交叉的前沿领域,误导性可视化研究正经历从传统人因实验向多模态大模型鲁棒性评估的深刻范式转变。当前研究焦点集中于两个核心维度:一是构建专用基准数据集(如Misleading ChartQA、Misviz、CHARTOM等),系统评估GPT-4V、LLaVA等视觉语言模型在面对轴截断、比例操纵、标注误导等欺骗性图表时的脆弱性;二是开发基于规则与AI的混合检测框架,如利用视觉变换器和大型语言模型自动识别图表中的修辞性欺骗与设计缺陷。值得注意的是,2025至2026年间涌现的ChartAttack、MisVisFix等工作,不仅揭示了模型在恶意提示下的生成风险,更开创了交互式纠正与防御性指令调优的新方向。这些研究呼应了社交媒体上数据可视化滥用引发的公共信息危机,为建立可信赖的自动化事实核查体系奠定了方法论基础,其成果将直接影响AI辅助决策系统在金融、健康等高风险领域的部署安全。
以上内容由遇见数据集搜集并总结生成



