遇见数据集

sdxl-qwen-phase1-cache

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

SDXL + Qwen3.5 Phase-1 Conditioning Cache 是一个预计算的、冻结编码器条件数据集,专为 SDXL 与 Qwen 整流流微调任务设计。其核心目的是通过一次性预计算昂贵的编码过程,为下游训练器提供所有必要的数组数据,避免重复编码开销,从而实现跨运行和项目的可重用性。数据集基于源数据集 AbstractPhil/sdxl-qwen-phase0(包含标题、图像和 aleph 地址)构建,规模在1万到10万样本之间(10K<n<100K)。数据内容以每行一个图像/标题对的形式组织,包含多个字段,如行标识符、原始标题、增强重描述文本、序列长度、潜在表示、交叉注意力上下文、池化输出、Qwen模型向量等。数据集适用于文本到图像生成任务,特别是基于 SDXL 和 Qwen 模型的微调与实验,支持多种使用方式,如复现标准条件、替换部分条件或添加锚点。数据以 Parquet 文件分片存储(使用 zstd 压缩),并附有详细的解码说明和元数据。需要注意的是,数据集是 SDXL(基于 CreativeML OpenRAIL++-M 许可证)和 Qwen3.5 输出的派生表示,下游使用需遵守上游模型和数据的许可证。

SDXL + Qwen3.5 Phase-1 Conditioning Cache is a pre-computed, frozen encoder conditioning dataset designed for SDXL and Qwen rectified-flow fine-tuning tasks. Its core purpose is to pre-compute expensive encoding processes once, providing all necessary array data for downstream trainers, avoiding repetitive encoding overhead, and enabling reusability across runs and projects. The dataset is built on the source dataset AbstractPhil/sdxl-qwen-phase0 (containing captions, images, and aleph addresses), with a scale between 10,000 and 100,000 samples (10K<n<100K). The data is organized as one image/caption pair per row, including fields such as row identifier, original caption, enhanced re-description text, sequence length, latent representation, cross-attention contexts, pooled outputs, Qwen model vectors, and more. It is suitable for text-to-image generation tasks, particularly fine-tuning and experiments with SDXL and Qwen models, supporting various usage modes like reproducing standard conditions, replacing partial conditions, or adding anchor points. The data is stored in sharded Parquet files (compressed with zstd) and includes detailed decoding instructions and metadata (meta.json). Note that the dataset is a derived representation of SDXL (based on the CreativeML OpenRAIL++-M license) and Qwen3.5 outputs, and downstream use must comply with upstream model and data licenses.

创建时间:
2026-06-06
原始信息汇总

数据集概述

数据集名称: SDXL + Qwen3.5 Phase-1 Conditioning Cache
许可证: Apache-2.0(注意:数据集为派生表示,下游使用需遵守上游模型/数据许可)
语言: 英语
任务类别: 文本到图像生成(Text-to-Image)
数据规模: 10K < n < 100K 条样本
数据文件格式: Parquet(分片存储,每片 256 行,Zstd 压缩)
发布者: AbstractPhil


数据集目的与背景

本数据集为 SDXL + Qwen3.5 修正流(Rectified Flow)微调 提供 预计算、冻结编码器条件向量。核心目标是将昂贵的编码过程(VAE、CLIP、Qwen)一次性完成,使下游训练器可直接复用,避免重复计算。

  • 数据来源: AbstractPhil/sdxl-qwen-phase0(包含原始图像、描述文本和 aleph 地址)
  • 图像尺寸: 1024×1024 → 潜在表示形状 [4, 128, 128]
  • VAE 缩放因子: 0.13025(已应用于 lat 列)
  • 编码器(冻结): SDXL VAE + CLIP-L(text_encoder)+ CLIP-G(text_encoder_2)+ Qwen3.5-0.8B

数据模式(Schema)

每条样本对应一个图像/文本对。数组列以 原始小端 float16 字节 存储在 Parquet 的 binary 列中,需通过指定形状解码。文本/整数列为原生类型。

列名 类型 形状 来源 说明
rid string 行 ID row{global_index:08d} 或源数据集中的 id
caption string 源数据集 原始描述文本
gen_text string Qwen 两次生成(Two-shot Greedy) 经过丰富重述的描述文本(实际编码对象)
seq_len int32 Qwen qseq 中非填充的真实 token 数量
lat fp16 [4, 128, 128] SDXL VAE 编码(fp32 执行) 已乘以 vae_scale=0.13025
clipl fp16 [77, 768] SDXL CLIP-L,倒数第二层隐藏状态 交叉注意力上下文第一部分
clipg fp16 [77, 1280] SDXL CLIP-G,倒数第二层隐藏状态 交叉注意力上下文第二部分
clipgp fp16 [1280] SDXL CLIP-G 池化向量 微条件输入(text_embeds
qpool fp16 [1024] Qwen 最后一层的最后一个 token 池化 与训练器的池化缓存完全一致
qseq fp16 [512, 1024] Qwen 完整最后一层隐藏状态 左填充,真实 token 位于尾部
addr fp16 [32, 128] 从源数据集直接传递 geolip aleph 符号投影地址

qseq 解码提示: 真实 token 位于序列末尾,可通过 qseq[512 - seq_len:] 提取。实际长度较短(约 50–100 tokens),因此填充部分多为零,Zstd 压缩后占用空间小。


条件向量组合方式(适用于 SDXL 训练)

标准 SDXL 文本条件为:concat(clipl, clipg)[77, 2048] 作为交叉注意力上下文,clipgp [1280] 融入时间步嵌入。本数据集将这些组件分开存储,并额外提供 Qwen 池化/序列向量和 aleph 地址,支持三种使用方式:

  1. 复现标准 SDXL 条件: 直接使用 cliplclipgclipgp
  2. 替换组件: 例如,将 CLIP-G 池化替换为 qpool(对应 geolip 程序 aleph_clipl_clipg_pooled
  3. 扩展条件: 将 aleph 地址 addr [32,128] 拼接到交叉注意力上下文中

本数据集捕获时使用的训练配方为 aleph_clipl_clipg_pooled(CLIP-L 序列被交换,CLIP-G 序列保留真实值,CLIP-G 池化替换为 Qwen 池化,aleph 地址启用)。但捕获结果本身与配方无关,组合方式由训练器决定。


数据提取细节

  • Qwen 文本特征 (qpool, qseq, gen_text, seq_len): 每个原始描述先经过 Qwen 两次生成(greedy,max_new_tokens=64)得到丰富描述 gen_text,然后包裹在对话模板中,以左填充方式分词(max_length=1024),执行前向传播获取完整隐藏状态。qseq 取最后一个解码器层(layer −1)的隐藏状态,qpool 为该层最后一个真实 token 的池化结果。由于池化读取最后的真实 token 且填充在左侧,qpool 与训练器自行计算的结果完全一致。
  • SDXL 潜在表示 (lat): 图像缩放/中心裁剪至 1024×1024,归一化至 [-1, 1],由 SDXL VAE 在 fp32 精度下编码,再乘以 vae_scale=0.13025,存储为 fp16。
  • SDXL 文本特征 (clipl, clipg, clipgp): 分别对 77 token 提示进行编码,取倒数第二层隐藏状态(cliplclipg)和 CLIP-G 池化输出(clipgp)。这些是拼接前的原始编码器输出。
  • Aleph 地址 (addr): 32 个锚点方向 × 128 维的符号投影地址,直接从源数据集传递,不做任何修改。

数据使用与解码示例

解码所有数组中列的标准方法:

python import numpy as np from datasets import load_dataset

SPECS = { "lat": (np.float16, (4, 128, 128)), "clipl": (np.float16, (77, 768)), "clipg": (np.float16, (77, 1280)), "clipgp": (np.float16, (1280,)), "qpool": (np.float16, (1024,)), "qseq": (np.float16, (512, 1024)), "addr": (np.float16, (32, 128)), }

def decode(row, key): dt, shape = SPECS[key] return np.frombuffer(row[key], dtype=dt).reshape(shape).copy()

ds = load_dataset("AbstractPhil/sdxl-qwen-phase1-cache", split="train", streaming=True) row = next(iter(ds))

lat = decode(row, "lat") clipgp = decode(row, "clipgp") qseq = decode(row, "qseq") qtok = qseq[512 - row["seq_len"]:]

转换为训练器 .npy 缓存: 使用 qwen_cache_dataset.pyMODE="rehydrate" 将 Parquet 分片展开为训练器所需的每个样本的 .npy 文件布局。映射关系如下:

列名 训练器文件名
lat {rid}_lat.npy
clipl {rid}_clipl.npy
qpool {rid}_qpool.npy
clipg {rid}_clipg.npy
clipgp {rid}_clipgp.npy
addr {rid}_addr.npy

qseqseq_lengen_textcaption 不会被基础训练器消费,其中 qseq 用于全序列(Qwen 交叉注意力)条件实验。参考图像(fid_ref/)在展开时从源数据集中拉取,不存储在本数据集中。


数据集结构

data/shard_00000.parquet data/shard_00001.parquet ... meta.json # 机器可读的解码契约(形状、数据类型、Qwen 设置) README.md


复现说明

使用 qwen_cache_dataset.pyMODE="prepare" 构建:流式读取源数据集(不解码图像),对每个分片的样本执行一次编码(VAE + CLIP-L + CLIP-G + Qwen,一次前向同时获得池化与序列),写入 data/shard_NNNNN.parquet(Zstd 压缩,每片 256 行),并即时上传至 Hub。构建过程从中断点恢复,确保在长时间编码前验证 512 序列长度覆盖语料库,以及捕获的池化向量与训练器编码器一致。


引用与致谢

本数据集属于 AbstractPhil 的 geolip 几何深度学习生态系统。使用此缓存时,请致谢此仓库。

搜集汇总
数据集介绍
sdxl-qwen-phase1-cache 数据集图片
构建方式
该数据集通过冻结编码器的方式,对SDXL与Qwen3.5混合架构的整流流微调过程中的条件信息进行预计算与缓存。构建流程始于源数据集中的图像-文本对,图像经缩放与中心裁剪至1024×1024像素后,由浮点32精度的SDXL VAE编码为潜在表示,并乘以缩放因子0.13025存储为半精度浮点格式。文本描述先由Qwen模型通过两样本贪婪生成策略进行重描述以增强语义丰富性,随后分别由SDXL的CLIP-L与CLIP-G编码器提取倒数第二层隐藏状态及池化特征,同时经左填充至最大长度1024的Qwen模型输出最后一层隐藏状态序列与最后一个词元的池化向量。此外,每个样本还保留了源自源数据集的geolip aleph有符号投影地址。所有编码结果按256行每分片组织为Parquet文件,采用zstd压缩,并立即上传至Hub,构建过程支持中断恢复,确保计算资源的高效利用。
特点
数据集的核心特点在于其一次编码、多次复用的设计哲学,极大减少了重复计算开销。每个数据行包含完整的条件信息元件:SDXL VAE潜在张量、CLIP-L与CLIP-G的文本嵌入、CLIP-G池化向量、Qwen池化与完整序列嵌入,以及aleph地址,均以独立的半精度二进制列存储。特别地,Qwen序列嵌入保留了先前缓存流水线中丢弃的全序列信息,使研究者既能复现标准SDXL训练配方,也可探索序列条件化实验。列存储采用原始小端序半精度字节格式,配合预设的形状规格,解码便捷。数据集的构建参数与编码合约完整记录于元数据文件中,确保可复现性。
使用方法
数据集可通过HuggingFace Datasets库以流式方式加载,使用`load_dataset`函数指定数据集名称与训练集划分即可访问。每个样本是包含二进制数组列与文本列的字典,需借助NumPy库按照预设的形状规格进行解码:从指定列读取字节数据,通过`np.frombuffer`转换为半精度浮点数组并重塑为目标维度。对于左填充的Qwen序列,需根据真实的词元数量从数组末尾截取有效部分。在训练集成时,数据集支持通过重水合模式将分片直接展开为Geolip SDXL训练器所需的逐行NumPy缓存布局,自动生成索引文件并从源数据集获取参考图像,训练器检测到缓存完备后将跳过自身的构建阶段。
背景与挑战
背景概述
该数据集由AbstractPhil主导创建,隶属于geolip几何深度学习生态系统,旨在为SDXL与Qwen3.5结合的整流流微调提供预计算的条件编码缓存。其核心研究问题在于解决多阶段扩散模型训练中编码阶段的重复计算开销,通过一次性冻结编码器输出(包括SDXL VAE潜变量、CLIP-L/CLIP-G文本特征、Qwen3.5池化与完整序列特征以及geolip aleph特征),实现跨运行和项目的高效复用。该数据集采用分片存储策略,支持断点续传,显著提升了大规模文本到图像生成任务的训练效率,为条件编码的标准化复用树立了新范式。
当前挑战
该数据集所解决的领域挑战在于,多编码器(如SDXL VAE、CLIP-L/CLIP-G、Qwen3.5)的重复前向传播是扩散模型训练中的主要瓶颈,导致昂贵且冗余的计算开销。构建过程中面临的挑战包括:1)确保跨编码器的特征对齐与数值一致性,特别是Qwen序列在左填充下的真实标记恢复;2)处理高维张量(如qseq列每行约1MB)在Parquet格式中的存储与读取效率,以及HuggingFace数据集查看器的兼容性问题;3)设计可中断重续的分片流水线,保证生成过程在临时计算环境中的鲁棒性;4)在复用多阶段模型输出时,需严格遵循上游模型(如SDXL的CreativeML OpenRAIL++-M和Qwen3.5)的许可协议,避免衍生表示的版权风险。
常用场景
经典使用场景
在文本生成图像这一前沿领域,该数据集被设计为一种高效的预计算条件缓存,专为SDXL与Qwen3.5的融合微调而生。其经典的使用方式在于,它将图像经过VAE编码的潜在表示、SDXL所需的CLIP文本特征、以及Qwen3.5生成的池化与全序列隐藏状态,连同地理拓扑嵌入地址,统一打包为每一行对应一个图像-文本对的标准化格式。研究者可直接调用这些预先计算好的编码产物,从而省去在每次训练或推理时重复执行昂贵的编码前向传播,极大提升了实验迭代的效率。
衍生相关工作
围绕该数据集衍生出的经典工作,核心体现于它对新型条件控制机制的探索。其中,使用Qwen生成的文本特征替代部分或全部CLIP特征的实验,揭示了语言模型增强的文本描述如何提升生成图像与复杂语义的对齐能力。地理拓扑嵌入的引入,则为视觉空间的结构化引导提供了新的维度。该数据集的构建范式——即预先计算并共享编码缓存——本身也催生了可复现的微调管线设计,包括后续对序列级交叉注意力融合方法的评估,以及对不同文本编码器组合进行消融研究的标准基准。这些工作共同构建了一个面向下一代文本到图像模型的基础设施生态。
数据集最近研究
最新研究方向
该数据集聚焦于扩散模型文本到图像生成中的条件编码缓存优化,属于多模态生成与高效训练的前沿交叉方向。通过预计算并存储SDXL VAE潜变量、CLIP-L/CLIP-G文本特征、Qwen3.5池化与全序列隐藏状态,以及geolip aleph地址,实现了编码阶段的一次性开销与跨项目复用。当前热点事件包括文生图模型中大语言模型与扩散架构的深度融合,以及生成质量与计算效率的平衡需求。此数据集为研究者提供了灵活的实验平台,支持标准SDXL条件配方、Qwen序列条件实验及地理嵌入空间实验,推动了条件编码解耦与高效训练范式的发展,对降低训练门槛、加速模型迭代具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务