遇见数据集

Semantic Alignment Benchmark

收藏
arXiv2026-09-03 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是SVG-Score评估框架的核心,由哈索·普拉特纳研究院和摩德纳大学与雷焦艾米利亚大学联合创建,用于评估文本到SVG生成的语义对齐程度。数据集包含超过12,000个由人类标注的caption-SVG对评分,涵盖8,671个SVG和1,858个caption,评分范围为1至5,评估对象包括对象存在性、颜色、数量及空间关系等属性。构建过程从OmniSVG数据集采样caption-SVG对,通过检索扩展并结合人工标注,确保评分的准确性。该数据集旨在解决现有评估指标(如CLIPScore)对SVG语义错误不敏感的问题,为训练和验证人类对齐的SVG评估器提供基准,推动文本到SVG生成模型的可靠评估。

This dataset is the core of the SVG-Score evaluation framework, jointly created by the Hasso Plattner Institute and the University of Modena and Reggio Emilia, for evaluating the semantic alignment of text-to-SVG generation. It contains over 12,000 human-annotated caption-SVG pair scores, covering 8,671 SVGs and 1,858 captions, with scores ranging from 1 to 5. The evaluated attributes include object existence, color, quantity, spatial relationships and other relevant properties. The dataset construction process samples caption-SVG pairs from the OmniSVG dataset, expands them via retrieval and incorporates manual annotation to ensure the accuracy of the scoring. This dataset aims to address the issue that existing evaluation metrics (e.g., CLIPScore) are insensitive to SVG semantic errors, serve as a benchmark for training and validating human-aligned SVG evaluators, and advance reliable evaluation of text-to-SVG generation models.

创建时间:
2026-09-03
搜集汇总
数据集介绍
Semantic Alignment Benchmark 数据集图片
构建方式
Semantic Alignment Benchmark的构建源于对文本到SVG生成任务中现有评估方法不足的深刻洞察。鉴于CLIPScore等自然图像指标在矢量图形领域的显著分布偏移,以及现成VLM评判在语义错误检测上的不均衡敏感性,该数据集精心设计了双轨资源体系。核心部分是从OmniSVG数据集中采样SVG作为检索查询,通过宽松相似性标准为每个原始描述配对各6个额外SVG,从而生成覆盖不同语义对齐程度的候选对。经五位标注者基于1至5分的整体语义对齐评分,最终形成包含8,671个唯一SVG、1,858个唯一描述及12,957个有效评分实例的集合。同时,为保障训练与测试的独立性,实施了基于描述和SVG双重不相交的划分策略。此外,还构建了由1,616条人工验证描述组成的独立生成器基准,按复杂度分为三个层级。
特点
该数据集的显著特点在于其以人类标注为核心,精准聚焦于SVG生成中语义对齐的细粒度评估。不同于依赖自动或弱对齐描述的大规模预训练数据,此基准提供了100%人工注释的范例,确保评分反映真实人类判断。其评分体系覆盖对象存在性、属性(如颜色、数量)、空间关系及整体语义一致性,能够揭示CLIP等传统指标无法捕获的错误类型。数据集的多样性体现在涵盖从简单图标到复杂构图的不同难度描述,并通过对SVG与描述的双重隔离划分,有效防止数据泄漏。此外,构建过程融入了严格的质量控制,包括对原始描述的重新描述以提升数据质量,保证了标注的可靠性与数据的实用性。
使用方法
Semantic Alignment Benchmark主要用作训练和验证文本到SVG生成评估器的标准基准。研究人员可利用其训练划分对CLIP模型进行矢量图形领域的适配与人类偏好对齐,或对VLM评判(如Qwen3-VL-8B)进行监督微调和基于GRPO的强化学习,以提升其与人类评分的一致性。其独立的测试划分则用于客观评估这些自动评估器在语义对齐判断上的性能,衡量指标包括与人类评分的相关性(ρ、r、τ)、平均绝对误差及配对排名准确率。同时,独立的生成器基准(含1,616个不同复杂度描述)可用于系统性的跨模型对比,通过自动化评估器对生成SVG进行打分,从而在统一标准下比较优化型、开源型及商业型生成器的性能差异。值得一提的是,该数据集支持参考自由的评估模式,直接评判生成SVG与其文本描述间的语义忠实度,无需原始SVG作为参照。
背景与挑战
背景概述
文本到SVG生成技术近年来发展迅猛,得益于生成模型在表现力与可控性上的持续精进,但该领域的评估体系却显著滞后。现有评估实践普遍借用针对自然图像设计的指标,如CLIPScore,然而矢量图形与自然图像在视觉统计特征、抽象程度及稀疏参数结构上存在本质差异,导致CLIP模型遭遇严重的分布偏移,其评分与人类对语义保真度的感知仅有微弱关联。为填补这一空白,Hasso-Plattner研究所与摩德纳-雷焦艾米利亚大学等机构的Marco Cipriano、Leonardo Zini等人于近期推出了Semantic Alignment Benchmark(语义对齐基准),旨在构建一个以人为中心、专门针对文本到SVG生成任务的评估框架。该基准包含一个由五名注释者人工评分的逾12,000条标题-SVG配对实例,覆盖8,671个唯一SVG与1,858条标题,从对象存在、属性、空间关系及整体语义一致性等维度进行1至5的量表评分。此数据集为训练和验证面向矢量图形的语义评估器提供了坚实基石,其发布有望重塑该领域的评估范式,推动生成模型向更符合人类感知的方向发展。
当前挑战
当前领域面临多重挑战。一方面,评估协议严重缺失:CLIPScore等传统指标因在自然图像上训练,对SVG生成中的细粒度语义错误(如颜色替代、数量错配、空间关系倒置)反应迟钝,干扰分析显示其评分变化趋近于零,无法有效区分输出质量。尽管VLM-based法官对语义扰动更为敏感,但其响应在不同错误类型与图形风格间极不均衡,尤其在黑白图形上对数量与空间信息的感知近乎失效。另一方面,构建该基准亦非易事:需从大规模粗标注数据中甄别并清洗低质量配对,通过人工标题重写与精确检索策略确保数据语义的准确性与多样性;同时,严格划分训练与测试集,避免标题或SVG重叠带来的泄露风险,并确保人工评分在5个注释者间具有高一致性(二次加权Cohen's κ达79.85%)。此外,如何使自动评估器既保持CLIP的高效推理优势,又能通过人类偏好对齐提升判断精度,也是模型设计中的核心难点。
常用场景
经典使用场景
该数据集的核心应用在于为文本到SVG生成模型提供一种与人类判断高度一致的语义对齐评估基准。它由超过12,000条人工标注的图-文对组成,覆盖8,671个SVG图形和1,858条描述,每个实例依据1至5的序数尺度评估生成结果对文本的忠实程度。研究人员利用这一基准,可以系统性地量化不同生成器在色彩、数量、空间关系等语义属性上的表现差异,从而在统一且可信的框架下比较各类模型的语义保真度。
解决学术问题
该数据集直面现有评估体系的核心缺陷:传统CLIPScore等指标源自自然图像域,难以捕捉矢量图形特有的抽象结构与稀疏参数分布,而现成的视觉语言模型评判亦对语义错误反应不均。通过构建大规模人工标注的语义对齐评分,数据集为训练和验证自动评估器提供了可靠的监督信号,解决了度量与人类感知错位的学术难题。其意义在于建立了首个针对SVG语义保真度的基准,推动生成模型评估从粗放的相关性度量迈向精细的人类对齐验证。
衍生相关工作
围绕该数据集衍生了系列开创性工作:其一为适应矢量图形域并融合人类偏好的CLIP评分器,通过大规模SVG-文本对比学习与成对排序目标实现高效评估;其二为经监督微调与GRPO强化学习训练的视觉语言评判模型,能够输出结构化理由与评分。这些工作拓展了自动评估在矢量图形领域的边界,并为后续研究提供了可复用的评估框架与训练范式,激发了更多关于人类对齐评估指标的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务