遇见数据集

SVGEditBench

收藏
arXiv2024-04-22 更新2024-06-21 收录
官方服务:

资源简介:

SVGEditBench是由东京大学创建的一个基准数据集,用于量化评估大型语言模型(LLMs)编辑SVG代码的能力。该数据集包含1366个SVG图像,源自Twemoji数据集,经过筛选去除不相关内容。数据集的创建旨在通过六种编辑任务测试LLMs的能力,包括颜色更改、轮廓设置、代码压缩等。这些任务设计用于测试LLMs对SVG功能的理解和应用,特别是在无需图形界面的情况下通过文本交互进行图形编辑的能力。SVGEditBench不仅用于评估现有模型,还可用于未来针对SVG编辑优化的LLMs的测试。

SVGEditBench is a benchmark dataset created by The University of Tokyo for quantitatively evaluating the ability of Large Language Models (LLMs) to edit SVG code. This dataset consists of 1,366 SVG images sourced from the Twemoji dataset, with irrelevant content removed via screening. It was developed to test LLMs' capabilities through six editing tasks, including color modification, outline configuration, code compression, and others. These tasks are designed to assess LLMs' understanding and application of SVG functionalities, particularly their capacity to perform graphical editing via text-based interaction without the need for a graphical user interface. SVGEditBench can be used not only to evaluate existing models but also to test future LLMs optimized for SVG editing.

提供机构:
东京大学
创建时间:
2024-04-22
搜集汇总
数据集介绍
SVGEditBench 数据集图片
构建方式
SVGEditBench的构建基于Twemoji数据集中经过筛选的1366个高质量emoji SVG图像,剔除了区域指示符号、ZWJ序列及旗帜等与外观无关或名称难以获取的样本。针对每个图像,设计了六项可自动生成正确答案的编辑任务:改变颜色、设置轮廓、压缩代码、上下翻转、设置半透明以及裁剪至左半部分。每项任务通过修改或添加特定的SVG属性(如fill、stroke、transform、opacity、viewBox)实现,并随机选取100个emoji为每项任务创建提示与答案,共计600个编辑样本,确保评估的全面性与自动化程度。
特点
该数据集的核心特点在于其定量评估能力,通过将LLM输出的SVG代码渲染为72×72像素的PNG图像,并与正确答案计算均方误差(MSE)来客观衡量编辑质量。除压缩任务额外计算代码压缩率外,其余任务均以MSE为指标,背景设为白色以正确处理透明区域。数据集覆盖了从简单属性修改(如颜色变更)到需全局理解代码语义的复杂操作(如压缩),能够有效测试LLM对SVG语法和图形语义的掌握程度,且所有任务均支持自动评估,避免了人工主观偏差。
使用方法
使用SVGEditBench时,用户需将包含任务描述、原始SVG代码及输出格式要求的提示文本输入待评估的LLM,并提取模型响应中位于svg和之间的代码。随后利用CairoSVG库将输出SVG与标准答案渲染为72×72的PNG图像,计算逐像素MSE作为量化指标。对于压缩任务,还需比较输入与输出代码长度计算压缩率。评估过程中建议设置temperature为0以保证结果可复现,最终通过对比各任务的平均MSE或压缩率来判断模型性能,低于无编辑基准线的指标表示模型成功完成了编辑操作。
背景与挑战
背景概述
随着大语言模型在文本生成与代码理解领域的显著进展,利用LLM直接处理可缩放矢量图形(SVG)的编辑任务成为新兴研究方向。SVG以其XML文本格式的特性,天然适配LLM的输入输出范式,然而现有研究多局限于定性展示编辑案例,缺乏对模型编辑能力的系统性量化评估。针对这一空白,东京大学的Kunato Nishina与Yusuke Matsui于2024年提出了SVGEditBench基准数据集,旨在通过标准化任务与自动评估指标,客观衡量LLM在SVG代码编辑中的表现。该数据集基于Twemoji表情符号库筛选出1366个高质量SVG图像,并设计了六类典型编辑任务,涵盖颜色修改、轮廓添加、代码压缩、翻转、透明化与裁剪等操作,为评估LLM对SVG语法与语义的理解提供了坚实平台。
当前挑战
SVGEditBench所解决的领域问题核心在于LLM对矢量图形编辑的精准控制与代码理解能力。具体挑战包括:1)模型需准确解析SVG标签与属性语义,例如在颜色修改任务中正确识别并替换指定填充色,而非误改其他属性;2)复杂编辑任务如代码压缩要求LLM在不改变渲染结果的前提下,通过形状替换或坐标优化缩短代码长度,这考验了模型对图形几何与SVG语法的全局理解;3)构建过程中,数据集需从Twemoji中剔除区域指示符、ZWJ序列及旗帜等特殊元素,避免语义歧义干扰LLM判断;4)针对每项编辑任务需自动生成标准答案,如通过修改viewBox实现裁剪,确保评估的客观性与可重复性。
常用场景
经典使用场景
SVGEditBench作为首个专门用于量化评估大语言模型(LLM)可缩放矢量图形(SVG)编辑能力的基准数据集,其经典使用场景聚焦于衡量LLM在六类基础编辑任务上的表现:更改颜色、设置轮廓、代码压缩、上下翻转、透明度调整以及半幅裁剪。该基准通过精心设计的提示模板,将原始SVG代码与编辑指令结合,引导模型输出修改后的SVG代码,并借助渲染后的光栅图像与标准答案之间的均方误差(MSE)以及代码压缩率等指标,实现客观、可复现的性能度量。这一框架为系统比较不同LLM(如GPT-4与GPT-3.5)在SVG编辑领域的细微差异提供了标准化工具。
解决学术问题
SVGEditBench直面了当前LLM处理SVG编辑任务时缺乏定量评估体系的学术困境。以往研究多依赖零星的示例展示模型能力,却未能提供可重复的量化指标来比较不同模型或同一模型在不同任务上的表现。该数据集通过构建包含1366个精选Twemoji图像、覆盖六类典型编辑操作的标准化测试集,解决了三个关键问题:其一,确立了从提示设计到结果解析的完整评估流程,确保实验的可复现性;其二,采用MSE与压缩率等客观指标,使LLM的编辑质量得以精确度量;其三,通过对比GPT-4与GPT-3.5的实验,验证了该基准能够有效反映模型性能差异。这一工作填补了该领域量化评估的空白,为后续研究奠定了方法论基础。
衍生相关工作
SVGEditBench的提出催生了一系列衍生研究工作。在模型层面,它启发了针对SVG编辑的LLM微调方法,研究者可基于该基准构建专用训练集以提升模型在特定编辑任务上的表现。在任务扩展方面,该基准为引入涉及语义理解的高级编辑任务(如按文本描述重构图形元素)提供了评估框架,推动了从基础属性修改到高层次场景理解的跃迁。此外,该数据集与现有SVG生成模型(如StarVector、SVGDreamer)形成互补,促使学界探索将编辑能力与生成能力融合的混合架构,例如通过LLM实现从文本到矢量图形的端到端编辑与生成。这些工作共同丰富了矢量图形智能处理的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务