遇见数据集

svg-benchmark

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

Rapidata静态SVG生成基准数据集是一个大规模人类偏好数据集,旨在评估大语言模型从文本提示生成静态可缩放矢量图形(SVG)的能力。该数据集由Rapidata构建,包含1,355,161个人类响应,通过头对头比较方式,对30个前沿大语言模型(包括Claude、GPT、Gemini等系列)在500个多样化文本提示下生成的SVG进行多维度评估。每个数据样本包括原始提示文本、两个模型生成的SVG原始代码、对应的栅格化PNG图像(分辨率为768×768),人类标注者从对齐度(评估SVG与文本提示的匹配程度)、连贯性(评估图像的视觉完整性和无伪影程度)和偏好度(评估图像的整体主观视觉吸引力)三个独立维度进行评分。数据集规模为188,754个比较行,产生14,872个独特的栅格化图像,其中66,039行包含所有三个维度的完整评分。构建过程注重透明度和可复现性:提示集结合了人工编写的种子提示和从公开数据集采样的多样化提示,通过语义嵌入和最远点采样确保概念多样性;SVG生成过程记录了每个模型的原始标记输出;栅格化过程使用严格验证将SVG转换为PNG;人类评估通过Rapidata平台收集详细的投票数据,包括标注者人口统计信息。该数据集适用于文本到图像生成、图像分类、强化学习等任务,特别为SVG生成、矢量图形、代码生成和人类偏好对齐研究提供了基准资源,采用CC-BY-4.0许可。

The Rapidata Static SVG Generation Benchmark Dataset is a large-scale human preference dataset designed to evaluate the ability of large language models to generate static scalable vector graphics (SVG) from text prompts. Constructed by Rapidata, it contains 1,355,161 human responses, evaluating SVGs generated by 30 cutting-edge large language models (including Claude, GPT, Gemini series, etc.) on 500 diverse text prompts through head-to-head comparisons. Each data sample includes the original prompt text, raw SVG code from two models, corresponding rasterized PNG images (768×768 resolution), and human annotator ratings across three independent dimensions: alignment (assessing how well the SVG matches the text prompt), coherence (evaluating visual completeness and absence of artifacts), and preference (assessing overall subjective visual appeal). The dataset comprises 188,754 comparison rows, yielding 14,872 unique rasterized images, with 66,039 rows containing complete ratings across all three dimensions. The construction process emphasizes transparency and reproducibility: the prompt set combines manually crafted seed prompts and diverse prompts sampled from public datasets, ensuring conceptual diversity via semantic embeddings and farthest point sampling; SVG generation records raw token outputs from each model; rasterization converts SVGs to PNGs with rigorous validation; human evaluation collects detailed voting data via the Rapidata platform, including annotator demographics. The dataset is suitable for tasks such as text-to-image generation, image classification, and reinforcement learning, providing a valuable benchmark for SVG generation, vector graphics, code generation, and human preference alignment research, under the CC-BY-4.0 license.

创建时间:
2026-06-23
原始信息汇总

数据集概览:SVG Generation Benchmark (Static)

这是一个由 Rapidata 构建的、用于评估30个前沿大语言模型从文本提示生成静态SVG能力的基准数据集。核心数据来源于1,355,161条人工标注反馈,所有评分均基于人类偏好,而非自动指标。

核心统计数据

指标 数值
头对头比较数量(行数) 188,754
人工投票总数 1,355,161
参与模型数量 30
提示词数量 500
唯一光栅化图像数量 14,872
三项指标均有评分的行数 66,039

数据集结构与用途

  • 任务类别:文本到图像生成、图像分类、强化学习
  • 语言:英语
  • 许可协议:Creative Commons Attribution 4.0 International (CC-BY-4.0)
  • 数据集规模:训练集包含188,754个样本,总大小约24.03 GB
  • 主要用途:评估和比较不同模型在SVG代码生成任务上的表现,包括忠实度、一致性和主观偏好。

数据集特性(每行数据包含的字段)

每行数据代表两个模型针对同一提示生成结果的对比,包含以下字段:

字段名 类型 描述
prompt 字符串 用于生成图像的文本提示。
image1 图像 model1 生成的SVG光栅化PNG图像。
image2 图像 model2 生成的SVG光栅化PNG图像。
svg1 字符串 model1 生成的原始SVG标记代码。
svg2 字符串 model2 生成的原始SVG标记代码。
model1 字符串 生成 image1 的模型ID。
model2 字符串 生成 image2 的模型ID。
weighted_results_image1_preference 浮点数 image1偏好维度的加权得分(0-1)。
weighted_results_image2_preference 浮点数 image2偏好维度的加权得分(0-1)。
detailed_results_preference 字符串 包含每条投票记录的JSON数据(含投票选择和标注者信息)。
weighted_results_image1_coherence 浮点数 image1一致性维度的加权得分(0-1)。
weighted_results_image2_coherence 浮点数 image2一致性维度的加权得分(0-1)。
detailed_results_coherence 字符串 包含每条投票记录的JSON数据。
weighted_results_image1_alignment 浮点数 image1对齐性维度的加权得分(0-1)。
weighted_results_image2_alignment 浮点数 image2对齐性维度的加权得分(0-1)。
detailed_results_alignment 字符串 包含每条投票记录的JSON数据。

三大评估排行榜

该基准测试通过三个独立的排行榜评估模型:

排行榜 面向标注者的问题 是否显示提示词 衡量内容
Alignment(对齐性) “哪张图像更符合描述?” SVG描述内容的忠实度
Coherence(一致性) “哪张图像有更多伪影,更可能是AI生成的?” 视觉合理性(伪影更少者优)
Preference(偏好) “你更喜欢哪张图像?” 整体主观吸引力

数据集构建方式

  1. 提示词集(500个):包含约50个人工撰写的种子提示,其余来自公共数据集 yupp-ai/yupp-svg-20251204,并通过最远点采样(FPS)和余弦距离选择,以确保语义多样性。所有非英语提示被翻译为英语。
  2. SVG生成:每个提示均以 "Make an SVG of <subject>" 的格式发送给30个模型,原始SVG标记代码被逐字保存。
  3. 光栅化:所有SVG都被渲染为 768×768 像素的PNG图像。
  4. 人工评估:将光栅化后的PNG上传至Rapidata平台进行成对比较,收集人工投票。

参与模型的总体排名(Elo评分综合排行)

排名 模型 Elo评分
1 claude-fable-5-thinking 1232.9
2 claude-fable-5 1225.9
3 gemini-3.1-pro-preview 1168.0
4 gpt-5.5-high 1123.0
5 claude-opus-4-6-thinking 1120.3
6 gemini-3.5-flash 1116.9
7 qwen3.7-max-preview 1115.8
8 claude-opus-4-7-thinking 1110.4
9 quiver-arrow-1.1 1101.2
10 claude-opus-4-6 1099.9
11 claude-opus-4-8-thinking 1095.2
12 claude-opus-4-8 1091.1
13 claude-opus-4-7 1090.5
14 minimax-m3 1068.0
15 claude-sonnet-4.6 1057.1
16 mimo-v2.5-pro 1054.2
17 gpt-5.4-high 1037.7
18 glm-5.1 1037.5
19 deepseek-v4-flash 970.5
20 grok-4.20-multi-agent 956.8
21 deepseek-v4-pro 942.0
22 deepseek-v4-pro-thinking 939.6
23 grok-4.20-beta1 840.3
24 kimi-k2.5-thinking 835.8
25 hunyuan-hy3-preview 834.6
26 kimi-k2.6 821.1
27 nvidia-nemotron-3-ultra-550b-a55b-nvfp4 800.2
28 mistral-large-3 743.2
29 mistral-medium-3.5 725.7
30 mistral-small-4 644.7
搜集汇总
数据集介绍
svg-benchmark 数据集图片
构建方式
该数据集旨在系统性地评估前沿大语言模型生成静态SVG图形的能力。其构建过程严谨而精细:首先,从人工撰写的约50个种子提示与公开数据集中经语义过滤、翻译及远点采样筛选出500个语义多样且富有挑战性的文本提示;随后,30个前沿LLM基于这些提示生成原始SVG标记,并经过cairosvg光栅化为768×768的PNG图像;最后,通过Rapidata平台收集了超过135万条人工标注,对每对模型输出从偏好性、连贯性与对齐度三个维度进行成对比较,从而构建了包含188,754行比较记录的综合基准。
使用方法
该数据集适用于多种研究与评估场景。研究人员可直接加载数据,利用image1和image2字段进行视觉对比,通过weighted_results_*列获取各维度聚合得分,或解析detailed_results_*列中的JSON字符串分析个性化标注细节。对于希望评估自定义模型的用户,可通过Rapidata的MRI工具将自身模型加入基准测试,以Elo评分系统为框架,在相同提示集上生成SVG并获取人类评价,从而公平地与其他30个前沿模型进行排名比较。
背景与挑战
背景概述
可缩放矢量图形(SVG)作为一种基于文本的二维图像描述格式,在网页设计、数据可视化与图形界面中占据着不可替代的地位。然而,随着大语言模型(LLM)被广泛用于直接从文本描述生成SVG代码,如何系统性地评估模型在语义对齐、视觉连贯性与主观美学偏好上的表现,成为一项亟待解决的挑战。在此背景下,Rapidata团队于近期发布了svg-benchmark数据集,旨在建立一个由人类偏好驱动的静态SVG生成评估基准。该数据集汇集了来自30个前沿大语言模型、涵盖500个多样化文本提示所生成的近15,000张栅格化图像,并通过超过135万条来自人类标注员的对比较为模型在一致性(Coherence)、对齐性(Alignment)与总体偏好(Preference)三个核心维度上赋予Elo评分。这一首创性工作不仅填补了文本到矢量图形生成领域综合性人类评估标准的空白,也为后续LLM生成能力的比较提供了重要参照。
当前挑战
该数据集所着力解决的领域核心挑战在于:现有文本到SVG的生成评估多依赖自动衡量指标,但这些指标难以捕捉人类对视觉质量、语义匹配与艺术审美的细腻判断。为此,数据集通过构建三重独立的人类偏好排行榜,将来自30个模型的图像两两配对,让人类在不知晓模型来源的条件下依次评价“哪幅图像与描述更匹配”(对齐)、“哪幅图像含有更多伪影”(一致性)以及“你更偏爱哪幅图像”(偏好),从而获得反映真实用户体验的评分。而在构建过程中,研究人员面临两大难点:一是需要设计一组兼具难度与实用性的500条提示,为此采用基于语义嵌入的最远点采样法,从人工种子提示与公共用户请求中系统化筛选,以避免概念重复并确保语义多样性;二是必须应对从各模型获取的原始SVG代码在栅格化后可能出现解析失败或渲染伪影的问题,仅能在可修复的前提下保留有效图像,确保所有比较均基于有效的视觉输出。
常用场景
经典使用场景
在文本到图像生成领域,svg-benchmark数据集被广泛用于评估前沿大语言模型生成静态可缩放矢量图形的能力。该数据集通过人类注释者对30个顶尖模型生成的SVG图像进行成对比较,从对齐度、连贯性和偏好性三个核心维度进行评判,为研究者提供了一个系统化、多维度的评估框架。其经典使用方式是利用包含188,754组对比数据、超过135万条人类反馈的丰富资源,对模型生成SVG的忠实度、视觉完整性以及整体美感进行量化排名,从而在统一基准下横向比较不同模型的表现优劣。
解决学术问题
该数据集解决了SVG生成领域长期缺乏标准化、大规模人类评估基准的学术瓶颈。以往研究多依赖自动指标或小规模人工评价,难以全面衡量模型在语义理解、视觉逻辑和审美偏好上的综合表现。svg-benchmark通过引入对齐度、连贯性和偏好性三重评价体系,不仅刻画了模型能否精准描绘提示主题,还揭示了其生成图像在结构合理性上的不足,以及人类对视觉结果的真实偏好。这一多维评估机制为文本生成矢量图形的学术研究提供了可复现的比较标准,显著推动了该领域从定性分析向定量评估的范式转变。
实际应用
在实际应用中,svg-benchmark数据集为图标设计、用户界面构建、数据可视化、教育图表制作及品牌标识开发等场景提供了重要的技术支撑。通过评估模型生成SVG的效率和品质,该数据集帮助开发者和设计团队筛选最适合特定任务的生成模型,从而加速设计流程、降低创作成本。此外,该数据集中包含的500个精心设计的提示词覆盖了从简单图标到复杂场景的广泛需求,使得依赖于矢量图形自动生成的工具链、在线创作平台和内容管理系统能够获得更可靠的模型性能参考,进而提升用户体验与生产效率。
数据集最近研究
最新研究方向
svg-benchmark数据集聚焦于多模态生成模型的标准化人类偏好评估,近期研究前沿主要围绕文本到SVG生成的质量对齐与一致性优化。该基准通过收集超过135万条人类标注反馈,系统评估了30种前沿大语言模型在静态SVG生成任务中的对齐度、连贯性与主观偏好三个维度的综合表现。其核心创新在于引入了多维细粒度人工评价体系,突破了传统自动化指标在捕捉视觉语义保真度和美感愉悦方面的局限,为code-generation与text-to-svg领域提供了可复现的排名基准。该数据集与当前文本到视觉内容生成的热点趋势紧密呼应,其揭示的模型差异与缺陷模式,为后续改进矢量图形生成的逻辑自洽性和指令遵循能力提供了关键实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务