遇见数据集

Birchlabs/sdxl-latents-artbench

收藏
Hugging Face2023-11-22 更新2024-03-04 收录
官方服务:

资源简介:

该数据集名为ArtBench,通过Ollin VAE将ArtBench样本编码为float16 SDXL latents。数据集使用特定脚本创建,未保存均值和logvar,因为方差足够低,不值得为了保留而增加文件大小。数据集包含原始图像和从对角高斯分布采样的潜在表示。数据集的来源包括WikiArt、Ukiyo-e.org数据库和The Surrealism Website,并遵循Fair Use许可。数据集包含训练集和测试集,分别有50000和10000个样本。

This dataset is named ArtBench. ArtBench samples are encoded into float16 SDXL latents via Ollin VAE. The dataset was constructed using a custom script, and the mean and logvar values were not saved, as the variance was sufficiently low to not justify the increased file size required to preserve them. The dataset includes both original images and latent representations sampled from a diagonal Gaussian distribution. Its source materials are drawn from WikiArt, the Ukiyo-e.org database, and The Surrealism Website, and it is released under the Fair Use license. The dataset comprises a training set with 50,000 samples and a test set with 10,000 samples.

提供机构:
Birchlabs
原始信息汇总

ArtBench 数据集概述

数据集创建

  • 数据集通过将 ArtBench 样本编码为 float16 SDXL 潜在变量创建,使用 Ollin VAE 进行编码。
  • 数据集创建脚本:make_sdxl_latent_dataset.py

数据集内容

  • 未保存均值和方差,因为方差足够低,不值得为了保留它们而使文件大小翻倍。
  • 从对角高斯分布中采样,保存了结果的潜在变量。
  • 保留了原始图像。

数据集结构

python from typing import TypedDict, Iterator from webdataset import WebDataset Sample = TypedDict(Sample, { key: str, url: str, cls.txt: bytes, # UTF-8 编码的类别 ID,范围从 0 到 9 img.png: bytes, # 序列化的 PIL 图像,256256 像素 latent.pth: bytes, # 序列化的 FloatTensor,3232 潜在变量 })

it: Iterator[Sample] = WebDataset(train/{00000..00004}.tar)

for sample in it: pass

数据集大小

  • 训练集:50000 样本
  • 测试集:10000 样本

统计信息

测试集

  • 均值 (test/avg/val.pt): python [-0.11362826824188232, -0.7059057950973511, 0.4819808006286621, 2.2327630519866943]

  • 平方和 (test/avg/sq.pt): python [52.59075927734375, 30.115631103515625, 44.977020263671875, 30.228885650634766]

  • 标准差 (std): python [7.251058578491211, 5.442180633544922, 6.689148902893066, 5.024306297302246]

  • 标准差的倒数 (1/std): python [0.1379109025001526, 0.18374986946582794, 0.14949584007263184, 0.19903245568275452]

训练集

  • 均值 (train/avg/val.pt): python [-0.1536690890789032, -0.7142514586448669, 0.4706766605377197, 2.24863600730896]

  • 平方和 (train/avg/sq.pt): python [51.99677276611328, 30.184646606445312, 44.909732818603516, 30.234216690063477]

  • 标准差 (std): python [7.2092413902282715, 5.447429656982422, 6.68492317199707, 5.017753601074219]

  • 标准差的倒数 (1/std): python [0.1387108564376831, 0.18357281386852264, 0.14959034323692322, 0.1992923617362976]

搜集汇总
数据集介绍
构建方式
在艺术数据集与生成式模型的交汇点上,Birchlabs/sdxl-latents-artbench数据集应运而生。其构建基于ArtBench-10的原始图像,通过Ollin VAE编码器将样本转换为float16精度的SDXL潜变量。具体流程采用定制脚本,从对角高斯分布中采样,直接保存潜变量结果,并保留原始图像作为对照。由于方差较低,为优化存储效率,未保留均值与logvar信息,从而在不显著损失质量的前提下控制文件体积。
使用方法
数据集的调用遵循WebDataset的流式加载范式,用户可通过WebDataset类遍历指定分片文件(如train/{00000..00004}.tar)来高效迭代样本。每个样本以字典形式呈现,键包括'__key__'、'__url__'、'cls.txt'(UTF-8编码的类别ID)、'img.png'(序列化的PIL图像)及'latent.pth'(序列化的FloatTensor)。这一设计使得数据加载与模型训练无缝衔接,尤其适用于需要原始图像与潜变量双输入的生成式或判别式任务。
背景与挑战
背景概述
在生成式人工智能与艺术创作交叉的领域,潜在空间表示(latent representation)的优化已成为提升图像生成质量的关键环节。Birchlabs/sdxl-latents-artbench数据集于2023年由独立研究者Birch-san基于ArtBench-10构建,旨在为Stable Diffusion XL(SDXL)模型提供预编码的潜在特征,以简化扩散解码器的训练与评估。该数据集将ArtBench-10中涵盖的10类艺术风格(包括WikiArt、浮世绘与超现实主义作品)的50,000张训练样本与10,000张测试样本,通过Ollin VAE编码为float16精度的SDXL潜在张量,并保留原始256×256像素图像。其核心研究问题聚焦于如何在保持低方差的前提下,通过高斯采样压缩潜在空间,从而在不显著增加存储开销的前提下,为艺术风格迁移与可控生成任务提供高效的数据支撑。这一工作填补了针对SDXL潜在空间标准化处理的空白,推动了艺术数据集在潜在扩散模型中的直接应用,对计算艺术与生成模型社区产生了显著影响。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:ArtBench-10涵盖的艺术风格跨度极大,从古典写实到现代抽象,潜在空间编码需兼顾风格多样性与语义一致性,而SDXL的潜在表示维度(32×32)可能丢失部分纹理细节,导致生成结果在风格保真度上存在偏差。其次,构建过程中需解决编码效率与存储平衡的难题——尽管作者选择舍弃均值和logvar以缩减文件体积,但此举可能牺牲潜在变量的可解释性,不利于后续模型对潜在分布进行精确调控。此外,数据来源涉及WikiArt、浮世绘数据库等第三方平台,版权归属复杂,虽声明采用合理使用许可,但跨平台数据整合仍面临合规性风险,可能限制其在商业场景中的推广。最后,潜在空间统计量(如均值与标准差)的差异表明,训练集与测试集在潜在分布上存在细微偏移,这为模型泛化能力带来了隐性挑战。
常用场景
经典使用场景
Birchlabs/sdxl-latents-artbench 数据集将 ArtBench-10 的艺术作品图像编码为 SDXL 潜空间中的 float16 张量,为生成式模型的研究提供了高效且紧凑的表示形式。其经典使用场景聚焦于条件图像生成与潜在扩散模型的训练与评估,研究者可直接利用已编码的 32×32 潜变量,结合类别标签(0-9类)进行风格可控的艺术图像合成。这一设计免去了重复编码的计算开销,尤其适用于大规模实验中对潜在分布特性的探索,例如分析不同艺术风格在潜空间中的聚类规律或评估扩散模型对艺术特征的保真度。
解决学术问题
该数据集有效解决了艺术图像生成研究中两大核心挑战:数据预处理的高计算成本与潜空间统计特性的量化困难。通过提供预计算的均值、方差及逆标准差统计量,它使研究者能快速标准化潜变量分布,从而聚焦于模型架构优化与生成质量提升。此外,数据集保留了原始 256×256 像素图像,支持对潜空间与像素空间映射关系的对照分析,为理解扩散模型在艺术领域中的信息压缩机制提供了实证基础。这一贡献显著降低了艺术生成任务的可复现门槛,推动了风格迁移与条件生成等方向的规范化研究。
实际应用
在实际应用中,该数据集可支撑数字艺术创作辅助工具的开发,例如基于文本或类别提示自动生成特定流派(如印象派、浮世绘)的艺术作品。其预编码潜变量格式兼容 WebDataset 等高效数据加载框架,使得在资源受限环境下(如移动设备或边缘计算)部署实时艺术生成模型成为可能。同时,数据集中的潜空间统计信息可被用于设计更鲁棒的生成后处理流程,例如通过逆标准化调整生成结果的色彩分布,从而适配不同显示设备的色域特性。
数据集最近研究
最新研究方向
在生成式人工智能与数字艺术交叉领域,Birchlabs/sdxl-latents-artbench数据集通过将ArtBench-10的艺术作品编码为SDXL潜空间表示,为可控图像生成与风格迁移研究提供了标准化基准。该数据集采用Ollin VAE将256×256像素图像压缩为32×32潜变量,并保留原始图像以实现端到端对比分析。当前前沿方向聚焦于利用潜空间扩散模型进行艺术风格解耦与高保真度重构,结合WebDataset高效加载范式支持大规模训练。其意义在于弥合了传统艺术分类数据集与生成模型潜在空间之间的鸿沟,推动无监督风格合成、多模态艺术理解及扩散模型可解释性研究的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务