VisJudgeBench
收藏资源简介:
VisJudgeBench是一个用于评估可视化美学和质量的综合基准数据集,包含3,090个来自真实场景的专家标注样本,涵盖单一可视化、多重可视化和仪表板等32种图表类型。每个样本包含可视化图像、基于保真度-表达力-美学评估框架的六维质量评分以及评估提示。
VisJudgeBench is a comprehensive benchmark dataset for evaluating visual aesthetics and quality. It contains 3,090 expert-annotated samples sourced from real-world scenarios, covering 32 chart types such as single visualizations, multiple visualizations, dashboards, and more. Each sample includes a visualization image, a six-dimensional quality score based on the fidelity-expression-aesthetics evaluation framework, and evaluation prompts.
VisJudgeBench 数据集概述
数据集简介
VisJudgeBench 是一个用于评估多模态大语言模型可视化美学和质量的综合基准,包含 3,090 个来自真实场景的专家标注样本,涵盖 32 种图表类型。
评估框架
基于 Fidelity-Expressiveness-Aesthetics 三维评估框架,细分为六个可测量指标:
1. 保真度 - 数据准确性和真实性
data_fidelity:评估视觉编码是否准确反映原始数据
2. 表达力 - 信息清晰度和可理解性
semantic_readability:评估基本信息编码的清晰度insight_discovery:评估揭示深层数据模式的有效性
3. 美学 - 视觉美学和精细化
design_style:测量设计的创新性和独特性visual_composition:关注空间布局的合理性color_harmony:评估颜色组合的协调性和功能性
数据集统计
类别分布
| 类别 | 样本数量 | 子类型数量 | 主要子类型及数量 |
|---|---|---|---|
| 单一可视化 | 1,041 | 22 | 柱状图 (176) • 饼图 (129) • 折线图 (100) • 面积图 (75) • 树状图 (62) • 桑基图 (61) • 热力图 (55) • 散点图 (49) • 直方图 (48) • 环形图 (47) • 漏斗图 (45) • 气泡图 (29) • 等值线地图 (25) • 雷达图 (24) • 网络图 (23) • K线图 (20) • 仪表盘图 (20) • 箱线图 (17) • 点地图 (12) • 词云 (1) • 小提琴图 (1) • 其他单一视图 (22) |
| 多重可视化 | 1,024 | 5 | 比较视图 (670) • 小多重 (195) • 协调视图 (97) • 其他多重视图 (59) • 概览细节 (3) |
| 仪表板 | 1,025 | 5 | 分析仪表板 (743) • 操作仪表板 (122) • 交互仪表板 (91) • 战略仪表板 (62) • 其他仪表板 (7) |
| 总计 | 3,090 | 32 | 完整覆盖所有可视化类型 |
基准结果
模型性能比较
| 模型 | MAE ↓ | MSE ↓ | 相关性 ↑ |
|---|---|---|---|
| VisJudge | 0.442 | 0.306 | 0.681 |
| GPT-5 | 0.551 | 0.484 | 0.429 |
| GPT-4o | 0.609 | 0.575 | 0.482 |
| Claude-4-Sonnet | 0.618 | 0.596 | 0.470 |
| Gemini-2.0-Flash | 0.680 | 0.716 | 0.395 |
| Gemini-2.5-Pro | 0.661 | 0.674 | 0.266 |
| Claude-3.5-Sonnet | 0.823 | 1.006 | 0.395 |
| Qwen2.5-VL-7B | 1.048 | 1.502 | 0.322 |
关键发现
- VisJudge 相比 GPT-5 在 MAE 上提升 19.8%
- VisJudge 与人类专家的相关性相比 GPT-5 提高 58.7%
- 在所有可视化评估任务指标上均优于商业 MLLMs
- 最先进模型与人类专家判断仍存在显著差距
数据格式
数据集以 JSON 格式存储,每个条目包含以下字段:
_id:唯一标识符type:可视化类别subtype:具体子类别image_path:可视化图像路径overall_score:整体质量分数(1.0-5.0)dimension_scores:六维质量评估分数prompt:完整评估提示
存储结构
VisJudgeBench/ ├── VisJudgeBench.json # 完整数据集 ├── figures/ # 文档图表 └── images/ # 可视化图像 ├── single_vis/ # 单一可视化图表 ├── multi_vis/ # 多面板可视化 └── dashboard/ # 仪表板样式可视化




