遇见数据集

Rapidata/svg-benchmark

收藏
Hugging Face2026-06-29 更新2026-07-22 收录
官方服务:

资源简介:

Rapidata静态SVG生成基准数据集由Rapidata构建,包含1,355,161条人类响应,用于比较30个前沿大型语言模型(LLM)从文本提示生成静态SVG(可缩放矢量图形)的能力。数据集包含188,754个头对头比较记录,每个记录对应两个模型对同一提示生成的SVG渲染结果,由人类标注者根据三个独立问题评分:偏好(主观视觉吸引力)、连贯性(视觉合理性,减少伪影)和对齐性(SVG与提示描述的匹配程度)。数据集涉及500个提示,生成14,872个独特的栅格化图像(PNG格式,分辨率768×768)。数据特性包括提示文本、两个图像、两个模型的SVG代码、模型ID以及三个评分维度的加权结果和详细结果。数据集的构建过程透明,包括提示集的多样性采样、30个模型的SVG生成、栅格化处理和人类评估。该数据集旨在评估LLM在SVG生成任务上的性能,并提供排行榜以支持模型比较和评估。

The Rapidata Static SVG Generation Benchmark dataset, built by Rapidata, contains 1,355,161 human responses comparing the performance of 30 frontier large language models (LLMs) in generating static SVGs (Scalable Vector Graphics) from text prompts. The dataset includes 188,754 head-to-head comparison rows, each representing two models SVG renders of the same prompt, scored by human annotators on three independent questions: Preference (subjective visual appeal), Coherence (visual soundness, fewer artifacts), and Alignment (faithfulness of the SVG to the prompt description). It involves 500 prompts, resulting in 14,872 unique rasterized images (PNG format, 768×768 resolution). Features include the prompt text, two images, SVG code from both models, model IDs, and weighted and detailed results for the three scoring dimensions. The dataset construction is transparent, covering diverse prompt sampling, SVG generation from 30 models, rasterization, and human evaluation. It is designed to evaluate LLM performance on SVG generation tasks and provides leaderboards for model comparison and assessment.

提供机构:
Rapidata
搜集汇总
数据集介绍
Rapidata/svg-benchmark 数据集图片
构建方式
该数据集旨在系统性地评估前沿大语言模型在静态SVG生成任务上的表现。构建过程始于精心设计的500条文本提示,这些提示来源于约50条人工撰写的种子提示与从公开数据集通过最远点采样算法筛选出的语义多样化样本,涵盖了图标、图表、界面元素等对人类实用但模型难以直接渲染的主题。随后,30个前沿模型被要求基于每条提示生成原始SVG标记,并利用cairosvg工具将其栅格化为768×768像素的PNG图像。最终,通过Rapidata平台收集了超过135万条人类标注反馈,以成对比较的方式对模型生成的图像进行评分。
特点
该数据集的核心特色在于其多维度的评估体系与大规模的人类参与。每个图像对均从三个独立维度被评判:对齐性评估图像与提示的匹配程度,连贯性衡量图像是否存在伪影或逻辑不一致,偏好性则反映人类对图像主观上的视觉喜好。数据集包含188,754行成对比较记录,共计1,355,161条人类投票,且保留了每位标注者的详细评分信息。此外,所有SVG均由模型以原始标记形式生成,避免了自动化指标的干扰,使得评估结果更贴近真实的生成质量。
使用方法
该数据集适用于多种研究场景,包括文本到图像生成模型的评估与基准测试。研究人员可以直接利用数据集中的提示和成对图像进行模型对比分析,或通过访问Rapidata提供的交互式排行榜来观察模型在不同维度上的排名。数据集中的权重评分列(如weighted_results_image1_preference)可直接用于计算Elo分数或训练奖励模型。此外,由于数据包含了每对图像的详细标注结果,研究者亦可深入分析特定类型的提示或模型在不同语义方向上的表现差异。
背景与挑战
背景概述
可缩放矢量图形(SVG)作为Web图形标准,其在图标、图表、用户界面等场景中的应用日益广泛。然而,大规模语言模型(LLM)生成高质量SVG代码的能力长期缺乏系统性的评估基准。由Rapidata团队构建的svg-benchmark静态SVG生成基准数据集,于2025年创立,旨在填补这一空白。该数据集涵盖了来自30个前沿LLM的188,754组逐对比较结果,涉及超过135万条人工标注反馈,从偏好性、连贯性与对齐度三个独立维度对模型生成的SVG质量进行多角度评估。通过精心挑选的500条具有语义多样性的文本提示词,该基准为文本到SVG生成任务建立了首个大规模、细粒度、基于人类判断的标准化评估框架,对推动LLM在代码生成与可缩放矢量图形领域的交叉研究具有里程碑式的重要意义。
当前挑战
svg-benchmark数据集主要致力于解决文本到SVG生成领域的关键评估挑战。首先,传统自动化评估指标难以捕捉SVG在视觉逻辑一致性、结构合理性与美学偏好等主观维度上的真实质量,该基准通过大规模人类偏好标注建立了可靠的评估参照系。其次,SVG生成需要对空间关系、几何构造和样式属性进行精确建模,现有模型在应对复杂组合提示(如“骑在宇航员上的马”)时常出现语义错位、结构异常或视觉伪影等问题。在数据集构建过程中,研究团队面临着确保500条提示语义多样性的挑战,采用了最远点采样策略并结合人工设计种子提示,以覆盖广泛的应用场景而避免概念冗余。此外,跨30个模型的SVG代码生成与光栅化流程需要严格的质量控制,包括处理格式不规范的XML输出和无法渲染的路径文件,最终筛选出能够有效参与比较的模型集合。
常用场景
经典使用场景
在文本到矢量图形生成这一前沿领域中,svg-benchmark数据集为评估和比较前沿大型语言模型(LLM)生成静态SVG图像的能力提供了黄金标准。该数据集包含了来自30个前沿模型的近19万组图像对和超过135万条人类标注反馈,每一组数据都围绕同一文本提示词,对比两个模型渲染的SVG图像在**对齐性**(与提示词的匹配程度)、**连贯性**(视觉无伪影程度)和**偏好**(整体视觉吸引力)三个维度上的表现。研究者可借助这些丰富的成对比较数据,系统地评估模型在构图、几何精确性和美学层次上的表现,从而建立科学、可复现的模型生成能力排行榜。
实际应用
在工业应用中,svg-benchmark推动了多个技术领域的实质性进步。在**图形设计自动化**方面,该数据集帮助开发者筛选出能准确生成图标、Logo、UI组件和教育插画的LLM,极大提升了设计工具和内容生产平台的效率。在**人机交互**领域,对齐性和偏好评分能够指导智能助手(如聊天机器人或设计助手)选择更具视觉美感和语义准确性的输出,从而改善用户体验。此外,该数据集还服务于**强化学习与偏好对齐**研究,其详尽的成对偏好数据可用于训练奖励模型,进而通过人类反馈优化生成模型的输出质量。
衍生相关工作
在svg-benchmark数据集的基础上,衍生出一系列具有深远影响的研究工作。其中最直接的是基于该基准构建的模型排行榜,它直观地比较了30个前沿LLM在矢量图生成任务上的综合表现,为社区提供了选型参考。此外,该数据集中细粒度的对齐性与连贯性标注被广泛用于训练**奖励模型**(Reward Model),这类模型通过“从人类反馈中强化学习”(RLHF)机制,能够进一步提升生成器的输出质量。该数据集还被用作文本到SVG生成任务的评测集,催生了针对特定劣化模式(如背景畸变、元素断裂)的修复算法研究,并推动了面向“指令跟随”与“视觉连贯性”联合优化的新范式探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务