AIBench
收藏资源简介:
AIBench是一个用于评估学术插图生成的基准和工具包。它包含300篇来自顶级会议的开放获取论文和5704个用于逻辑和质量检查的QA对。数据集专注于评估现代图像生成模型是否能生成既与源论文逻辑一致又具有美学价值的学术插图。
AIBench is a benchmark and toolkit for evaluating academic illustration generation. It includes 300 open-access papers from top-tier conferences and 5,704 QA pairs for logical and quality validation. This dataset focuses on evaluating whether modern image generation models can produce academic illustrations that are both logically consistent with the source papers and aesthetically pleasing.
AIBench 数据集概述
数据集简介
AIBench 是一个用于评估学术插图生成的基准和工具包。它专注于评估现代图像生成模型能否生成既与源论文逻辑一致,又在美学上可作为学术插图接受的、可用于论文的方法/框架图。
核心特点
- 首个基于VQA的基准:通过结构化问答评估学术插图质量。
- 四层次逻辑评估:从低层次组件到高层次语义。
- 基于VLM的美学评估:在逻辑一致性之外补充风格/视觉质量评估。
- 解耦设计:推理和评估分离,便于调试和复用。
- JSONL数据流:使用结构化的JSONL输入/输出以支持可扩展的批量处理。
- 多角色评估:支持生成图像 (
image_gen)、真实图像 (gt) 和空白图像基线 (blank)。 - 配置驱动的工作流:模型后端、并行度、重试次数和路径均通过YAML配置控制。
数据集快照
- 来源:来自顶级会议的300篇开放获取论文。
- 规模:包含5704个用于逻辑和质量检查的问答对。
- 质量保证:问答对通过流程生成,并由多位人类专家手动检查。
方法概述
对于逻辑评估,AIBench将评估构建为一系列基于从论文方法文本总结出的逻辑图的视觉问答任务。问题分为四个层次:
- 组件存在性层次
- 局部拓扑层次
- 阶段架构层次
- 全局语义层次 此设计提供了关于生成插图在何处成功或失败的细粒度、可解释的信号。文本渲染质量也被隐式测试,因为许多问答项要求图中正确生成的标签/标记。
主要发现(来自论文)
- 模型在学术插图生成任务上的性能差距远大于常见生成任务。
- 逻辑正确性和美学常常存在冲突;改进一方可能会损害另一方。
- 强大的推理能力和高密度的视觉生成对此任务都是必需的。
- 在推理和生成两端的测试时扩展策略可以显著提高性能。
贡献
- AIBench:首个结合逻辑和美学维度评估学术插图生成的基于VQA的基准。
- 可扩展的问答构建框架:从总结的逻辑图生成高质量、多层次的问题。
- 全面的评估:对最先进的开放/闭源统一模型和文生图模型进行了全面评估,包括测试时扩展分析。
引用
bibtex @article{liao2025aibench, title={AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation}, author={Liao, Zhaohe and Jiang, Kaixun and Liu, Zhihang and Wei, Yujie and Yu, Junqiu and Li, Quanhao and Yu, Hongtao and Li, Pandeng and Wang, Yuzheng and Xing, Zhen and Zhang, Shiwei and Xie, Chen-Wei and Zheng, Yun and Liu, Xihui}, journal={arXiv preprint arXiv:2603.28068}, year={2026} }




