SADU
收藏资源简介:
SADU是一个用于评估多模态模型在软件架构图理解上的基准测试,专注于软件工程图的问题回答,强调如图推理任务(如计数和检索)。该仓库包括基准数据、模型响应生成脚本、评估代码和结果分析工具。
SADU is a benchmark designed to evaluate multimodal models' comprehension of software architecture diagrams. It focuses on question answering over software engineering diagrams, with an emphasis on diagrammatic reasoning tasks such as counting and retrieval. This benchmark includes diagram samples, question-answer pairs, model outputs, and analytical scripts, supporting a reproducible benchmarking workflow.
SADU 数据集概述
数据集名称
SADU: A Benchmark for Software Architecture Diagram Understanding
数据集简介
SADU 是一个用于评估多模态模型在软件架构图理解任务上的基准。该数据集专注于软件工程图表的问答,强调如图表推理任务,例如计数和检索。
数据集目的
旨在支持对多模态模型理解软件工程图表能力的系统性评估,而非仅从图像中读取文本。该基准适用于研究图表感知和结构推理。
数据集内容与结构
数据集主要包含两个部分:
dataset/SAD/:基准数据,按图表类型分组。behavior/structural/ER/
dataset/SAD_hard/:用于案例研究的困难示例,按图表类型分组。long_arrow/multiple_arrow/not_right_arrow/overlap_arrow/
主要任务与问题类型
基准围绕多个图表类别组织,支持推理密集型问题类型,例如:
- 计数:例如,实体、组件或关系的数量。
- 检索:例如,识别连接的元素、源、目标或相关实体集。
数据获取
SADU 基准可以从 https://github.com/ShuyinOuyang/SADU/blob/main/dataset/SAD 下载。
相关资源
- 标注指南位于:https://github.com/ShuyinOuyang/SADU/blob/main/src/benchmark_construction/labeling_scripts/SADU%20label%20guide.pdf
- 仓库包含基准数据、模型响应生成脚本、评估代码和结果分析工具。





