遇见数据集

sdxl-qwen-phase0

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

SDXL–Qwen Phase-0是一个专为训练AbstractPhil/geolip-sdxl-aleph模型而构建的研究性数据集。其目标是通过整流流(rectified-flow)目标,在保持SDXL基础模型不变的情况下,用新的文本编码器(Qwen)替换原有的CLIP-G编码器进行再训练。数据集包含三个核心字段:图像(由Qwen-Image-Lightning模型根据提示词生成的1024×1024合成渲染图,使用4步蒸馏且无分类器引导)、提示词(来源于Conceptual Captions的未标注数据流,经过质量过滤和年龄内容过滤)和Aleph地址(一个32×128维的float16数组,通过冻结的aleph谱变分自编码器从提示词的字节三元组图像计算得到,作为编码器无关的、确定性的几何地址,用于重建表面形式而非语义)。数据构建过程包括提示词来源与过滤、图像生成和地址计算。数据集实施了严格的内容安全策略,包括提示词年龄正则匹配过滤和生成图像的年龄分类器过滤,从结构上排除了未成年人相关内容。该数据集规模较小(训练集约3839个样本),属于可行性研究的“第0阶段”,图像均为合成数据,继承了Qwen-Image的偏见和伪影。Aleph地址是形式重建码,不表达语义相似性。数据集适用于训练基于流匹配的文本到图像生成模型,特别是那些需要将图像作为流匹配目标,并将aleph地址作为编码器不变锚点的场景。数据遵循Apache-2.0许可证分发。

SDXL–Qwen Phase-0 is a research dataset built specifically for training the `AbstractPhil/geolip-sdxl-aleph` model. It aims to retrain the model by replacing the original CLIP-G encoder with a new text encoder (Qwen) while keeping the SDXL base model unchanged, using a rectified-flow objective. The datasets images serve as flow-matching targets for SDXL, where the model learns to reproduce these images based on new conditional inputs. The data includes three core fields: 1) **Images**: 1024×1024 synthetic renderings generated by the Qwen-Image-Lightning model from prompts (using 4-step distillation and no classifier guidance); 2) **Prompts**: Text descriptions used to generate the images, sourced from unannotated data streams of Conceptual Captions, with quality filtering (removing degenerate text) and age content filtering; 3) **Aleph addresses**: A 32×128-dimensional float16 array computed from byte trigram images of the prompts via a frozen aleph spectral variational autoencoder, serving as an encoder-agnostic, deterministic geometric address for reconstructing surface forms rather than semantics. The data construction process involves prompt sourcing and filtering, image generation with Qwen-Image-Lightning, and aleph address computation. The dataset implements strict content safety policies, including prompt age regex matching filtering and generated image age classifier filtering, structurally excluding content related to minors. It is relatively small (approximately 3,839 samples in the training set) and represents a feasibility study "Phase 0." All images are synthetic, inheriting biases and artifacts from Qwen-Image. Aleph addresses are form reconstruction codes and do not express semantic similarity. The dataset is suitable for training flow-matching-based text-to-image generation models, particularly in scenarios where images are used as flow-matching targets and aleph addresses as encoder-invariant anchors. The data is distributed under the Apache-2.0 license.

创建时间:
2026-06-03
原始信息汇总

数据集概述

SDXL–Qwen Phase-0 是一个专为训练 AbstractPhil/geolip-sdxl-aleph 模型而构建的合成图像-文本配对数据集。该数据集的核心目标是在修正流(Rectified-Flow) 框架下,使用新的Qwen文本编码器替换原有的CLIP-G编码器来重新训练SDXL模型。

  • 数据集大小: 约3839个样本,规模为Phase-0( 1K<n<10K ),单 train 分割。
  • 许可证: Apache-2.0。
  • 语言: 英语(en)。
  • 任务类别: 文生图(text-to-image)。

数据内容与结构

数据集包含三个关键字段:

字段 类型 描述
image Image 由Qwen-Image-Lightning根据对应文本提示生成的1024×1024图像。这是修正流的目标图像。
caption string 用于生成图像的文本提示。来源为Conceptual Captions,并经过了质量过滤和年龄审核。
aleph_address Array2D(shape=(32, 128), float16) 根据caption的字节流,通过冻结的aleph模型计算得出的编码器无关几何地址。它是一个表面形式重建码,而非语义嵌入。

构建过程

  1. 字幕来源: 主要从Conceptual Captions(unlabeled 流)中获取文本,未使用其原始图像。
  2. 质量门控: 过滤掉退化文本(如数字坐标、符号垃圾、单字重复等),保留包含足够真实字母单词的caption。
  3. 图像生成: 使用Qwen-Image和 lightx2v/Qwen-Image-Lightning 的4步LoRA,在无分类器引导(CFG off)条件下,以可重复的随机种子生成1024×1024图像。
  4. Aleph地址计算: 将caption转换为字节三元组图像,通过冻结的aleph谱VAE得到签名投影码本行,再进行自适应池化以生成固定尺寸(32×128)的地址。

内容安全机制

为遵循内容政策(CSAM),数据构建时设置了两个硬性门槛:

  • 提示门控: 在图像生成前,对所有caption进行年龄标志正则表达式检查,命中则丢弃。
  • 输出门控: 对生成的每张图像进行年龄分类(使用 nateraw/vit-age-classifier 模型),任何被判定为未成年的图像将被直接拒绝且不写入数据集。此门控倾向于过度拒绝无人图像,以确保安全。

Aleph地址说明

  • 性质:该地址是表面形式重建码,而非语义嵌入。它编码的是caption字节的形式(词法和字符重叠度高),与句子相似度几乎无关。
  • 优势:
    • 编码器无关:源于字节,不依赖于文本编码器(CLIP或Qwen)。
    • 确定性:相同的caption总是产生相同的地址。
    • 尺度无关:是底层谱VAE地址方案的一个属性。

预期用途

旨在训练图像→噪声→图像(image→noise→image)的修正流模型。该模型同时以池化文本表示和不变的aleph地址作为条件输入。主要消费模型为 geolip-sdxl-aleph

数据加载

python from datasets import load_dataset ds = load_dataset("AbstractPhil/sdxl-qwen-phase0", split="train") row = ds[0] img = row["image"] caption = row["caption"] import numpy as np address = np.asarray(row["aleph_address"], dtype=np.float16)

来源与许可

  • 图像: 由Qwen-Image(Apache-2.0)生成。
  • 字幕: 源自Conceptual Captions(Google),遵守其条款。
  • Aleph地址: 由冻结的aleph模型 AbstractPhil/geolip-aleph-void 产生。

局限性

  • 图像为合成图像,继承Qwen-Image的偏差和伪影。
  • 字幕经过过滤但未人工精选,仍存在噪声。
  • 年龄输出门控可能导致部分无人图像被过度拒绝。
  • aleph_address 是重建码,而非语义向量。
  • 规模较小(Phase-0),仅适用于可行性验证,不适合大规模训练。
搜集汇总
数据集介绍
sdxl-qwen-phase0 数据集图片
构建方式
本数据集专为训练几何流匹配模型而构建,旨在将稳定扩散XL模型(SDXL)的文本编码器从CLIP-G替换为Qwen。数据构建历经严谨流程:首先从Conceptual Captions数据集中提取文本描述,并通过质量门控过滤掉数字坐标、符号垃圾及单字重复等退化文本;随后,利用Qwen-Image模型(附带4步蒸馏LoRA)为每条描述生成1024×1024分辨率的高质量图像,并禁用无分类器引导以确保生成稳定性;最后,基于描述文本的字节序列,通过冻结的aleph谱变分自编码器计算得到编码器不变的几何“aleph地址”,该地址经自适应池化后固定为32×128维的张量。所有图像均经过年龄内容筛查,确保数据集安全合规。
特点
该数据集的核心特点在于其独特的几何引导机制。aleph地址是从文本字节的trigram图像中提取的谱编码,其本质是一种表面形式重建码,而非语义嵌入,因此具有编码器不变性、确定性和尺度无关性,能够在编码器替换过程中提供稳定的几何支撑。数据集中的图像并非SDXL自身的生成结果,而是来自更强大的Qwen-Image分布,这迫使SDXL在流匹配目标下学习向更优分布靠拢,从而突破其原有生成能力的局限。数据集规模为数千条样本,仅有训练集划分,适合可行性验证和阶段性研究。
使用方法
用户可通过HuggingFace Datasets库轻松加载本数据集,默认使用`load_dataset("AbstractPhil/sdxl-qwen-phase0", split="train")`指令。每条样本包含三个字段:`image`为PIL图像对象(尺寸1024×1024),`caption`为生成该图像的文本提示字符串,`aleph_address`为32×128的float16类型NumPy数组,代表几何aleph地址。该数据集主要面向训练结合池化文本表示与不变几何地址的图像→噪声→图像流匹配模型,其典型应用场景为`geolip-sdxl-aleph`模型的训练,其中Qwen-Image渲染图作为流匹配目标,aleph地址作为编码器不变的几何锚点。
背景与挑战
背景概述
SDXL-Qwen Phase-0数据集由研究人员AbstractPhil于近期创建,旨在探索将Qwen文本编码器替代CLIP-G与Stable Diffusion XL(SDXL)结合的文本到图像生成方法。该数据集属于geolip研究计划的一部分,核心研究问题在于如何利用Qwen-Image生成的高质量合成图像作为流匹配目标,通过整流流训练使SDXL学习新的条件分布,而非简单自生成。通过引入基于字节的几何“aleph”地址作为编码器不变标签,该数据集为多模态生成模型的分布迁移提供了新范式,对文本到图像领域具有方法论的创新意义。
当前挑战
该数据集聚焦于双重挑战:其一,在领域问题层面,SDXL受限于CLIP-G文本编码器的表达能力,难以捕捉文本-图像映射中的细粒度语义与几何结构;需通过分布迁移突破其原有生成边界。其二,在构建过程中,需解决合成图像的质量控制(Qwen-Image的四步蒸馏渲染)、低质量标题的自动过滤(如数字坐标乱码、符号堆叠),以及多层级安全筛查(包括基于正则的提示词过滤与年龄分类模型的双重审核),同时保持aleph地址的编码不变性与确定性,这对大规模高效pipeline构建提出了工程性挑战。
常用场景
经典使用场景
SDXL–Qwen Phase-0数据集专为文本到图像生成模型的重新训练而设计,其经典使用场景聚焦于将Stable Diffusion XL (SDXL)的基础文本编码器从CLIP-G替换为Qwen-Image-Lightning,并采用整流流(rectified-flow)目标进行训练。该数据集包含由Qwen-Image-Lightning生成的合成图像、对应的文本描述以及基于描述字节计算的不变几何地址(aleph地址)。在训练过程中,模型以这些合成渲染作为流匹配目标,学习在新的条件约束下重现图像,从而实现对SDXL进行微调,以融合更强大的生成分布。
解决学术问题
该数据集解决了跨文本编码器的流匹配训练中关键学术问题:如何在不依赖原始CLIP-G编码器的情况下,使SDXL模型适应新的Qwen文本编码器,同时避免自我生成数据带来的弱点固化。通过引入aleph地址作为编码器不变的几何锚点,该数据集为文本条件图像生成提供了一种稳定的结构支撑,使模型能在编码器切换后保持生成一致性。此外,它还探索了合成数据在模型迭代中的价值,展示了如何利用外部强模型(如Qwen-Image)的输出提升目标模型的生成质量,对文本到图像领域的迁移学习和数据蒸馏研究具有重要启示。
衍生相关工作
该数据集是geoLip项目系列的一部分,其核心思路衍生自多个经典工作:基础技术源于整流流匹配(rectified-flow)和流匹配(flow-matching)框架,参考了Lune SD1.5的流匹配配方;aleph地址的设计基于geoLip-svae谱变分自编码器(spectral-VAE)的技术路线,提供了一种新颖的几何编码方法;图像生成部分采用了Qwen-Image-Lightning的4步蒸馏LoRA,体现了快速推理与高质量生成的平衡。此外,该数据集还借鉴了Conceptual Captions的文本数据筛选经验,并结合了vit-age-classifier等图像年龄分类方法,为合成数据集的构建和安全性保障树立了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务