遇见数据集

Krea-2-Turbo-Checkpoint-Format-Benchmark

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

Krea 2 Turbo ComfyUI格式保真度基准数据集是一个用于系统评估Krea 2 Turbo模型在不同量化检查点格式下图像生成质量的配对比较数据集。该数据集旨在为模型量化研究提供可复现的基准测试,涵盖BF16、FP8 Scaled、INT8 ConvRot、MXFP8、NVFP4、INT4 ConvRot W4A4、GGUF Q8_0和GGUF Q4_K_M共八种格式。数据集包含240个已评分的1024×1024分辨率图像,每个图像均配有对应的提示词、随机种子、格式类型和检查点来源信息。此外,数据集还提供了完整的科学实验数据,包括float32解码张量、最终潜在表示、每一步的去噪轨迹、原始指标表格、GPU/系统遥测数据以及统计比较结果。数据组织采用多模态结构:包含用于Hugging Face Dataset Viewer的小型Parquet分片(嵌入图像和所有元数据)、标准的ImageFolder树结构(用于直接文件访问)、原始科学数据文件、指标表格目录、格式比较表、遥测数据记录、实验环境证明文件和完整的复现脚本。数据集在严格控制条件下生成:使用15个提示词和2个确定性种子,每个提示-种子组合生成8种格式的图像,采用固定推理参数(8步Euler采样器、CFG 1.0、批大小1等)。数据集适用于文本到图像生成任务的量化评估、模型保真度比较、生成质量指标分析等研究场景。所有生成图像、数据和报告均在CC BY 4.0许可下发布,基准测试脚本为MIT许可,模型权重遵循Krea 2社区许可。

创建时间:
2026-07-13
原始信息汇总

数据集概述

数据集名称:Krea 2 Turbo ComfyUI Format Fidelity Benchmark
语言:英语
许可证:CC-BY-4.0
任务类别:文本到图像(text-to-image)
标签:图像、表格、ComfyUI、Krea-2、量化、基准测试、BF16、FP8、INT8、MXFP8、NVFP4、INT4、GGUF、Q8-0、Q4-K-M
大小:小于1000条样本(n<1K)


主要结果

  1. BF16 是未量化的官方检查点,作为最高保真度参考。
  2. INT8 ConvRot 在预先注册的LPIPS-Alex指标上略微领先,但GGUF Q8_0在统计上与它持平(Holm调整置换检验 p=0.9067),并在DISTS、DINO相似性和重构权重SNR上领先。
  3. GGUF Q8_0 是新增三种格式中保真度最高的。
  4. MXFP8 保真度排名第四(LPIPS 0.071229),模型大小减半至BF16的一半,但在本测试的Ada GPU上无法使用原生SM 10.0快速路径,导致回退采样耗时31.929秒。
  5. FP8 Scaled 排名第五(LPIPS 0.093701),大小为12.239 GiB,且在原始五种格式中推理速度最快(19.503秒)。
  6. GGUF Q4_K_M 是一种存储质量折衷方案:6.972 GiB,保真度比INT4 ConvRot更接近BF16,但在本Ada GPU上因ComfyUI-GGUF反量化执行路径而速度较慢。
  7. NVFP4 大小为7.147 GiB,保真度中等损失(LPIPS 0.205124),与MXFP8类似,原生快速乘法需要SM 10.0,本测试使用回退路径耗时24.925秒。
  8. INT4 ConvRot W4A4 是三种新增格式中最小的检查点,在RTX 4060 Ti上推理速度最快,但保真度损失最大。

注意:未使用加权复合分数。详细技术报告见 TECHNICAL_REPORT.md,决策表见 tables/decision_table.csv


重要性能限制

  • 测试GPU为NVIDIA GeForce RTX 4060 Ti 16 GB(SM 8.9)。
  • MXFP8和NVFP4的原生快速矩阵乘法需要SM 10.0,在本次运行时不可用。
  • GGUF Q8_0和Q4_K_M使用了固定的ComfyUI-GGUF按需反量化矩阵乘法路径。
  • 这些Ada GPU上的计时结果不能直接推广至原生Blackwell执行环境。
  • 原始五种格式与新增三种格式在不同会话中测量。通过五次无评分的BF16和INT8 ConvRot桥接重复测量来量化漂移。INT8超出了预先注册的5%漂移阈值,因此新旧版本的精确计时比较需谨慎;保真度比较仍与同一保存的BF16提示/种子输出配对。

数据集组织

  • data/train/metadata.jsonldata/train/images/:数据集查看器和加载源,使用Hugging Face ImageFolder。数据集卡片明确将train分割限制在此目录树中,以避免仓库中其他科学JSON文件被错误推断为数据集分割。每行元数据将图像与提示、种子、格式、检查点来源、原始科学工件和展平的指标值关联。
  • raw/:包含每个评分运行的decoded_float32.npyfinal_latent_float32.npytrajectory.npz和采集metadata.json
  • metrics/:包含原始每图像、每参数、配对统计、汇总、轨迹、延迟和性能表格。
  • comparison_sheets/:包含八格式联系表、BF16相对差异图和自动选择的细节裁剪图。
  • telemetry/:包含评分GPU/系统遥测数据以及BF16/INT8桥接遥测数据。
  • provenance/:包含净化后的环境、模型、运行和发布清单。
  • reproduction/:包含ComfyUI工作流、自定义捕获节点、基准测试驱动程序、分析器、模型下载器和精确说明。

固定推理控制

  • 15个提示 × 2个确定种子 × 8种检查点格式 = 240张评分图像
  • 分辨率:1024×1024,批次大小:1
  • 步数:8步,CFG:1.0,采样器:Euler,调度器:simple,去噪:1.0
  • 共享文本编码器qwen3vl_4b_bf16.safetensors和VAEqwen_image_vae.safetensors
  • 使用零值正条件作为负条件
  • 无提示重写、LoRA、预览、放大或后处理
  • 每个八格式提示/种子组的初始噪声SHA-256相同

复现与验证

  • 按照 reproduction/README.md 操作。
  • 完整重新运行需下载约104 GiB的上游模型文件,并至少预留150 GiB空闲空间用于模型、采集、分析缓存和报告。
  • 在Windows 11上使用16 GB NVIDIA GPU测试;低内存配置未认证。
  • 验证下载的发布版本:python scripts/validate_release.py --root . --full
  • 上传本地重建副本:python scripts/upload_to_huggingface.py OWNER/DATASET --root .

许可证与责任使用

  • 生成的图像、数据和报告遵循CC BY 4.0许可证。
  • 基准测试脚本遵循MIT许可证。
  • 模型权重不重新分发,仍受Krea 2社区许可证约束。
  • Krea声明不对用户生成的输出主张知识产权,用户仍对其提示、输出和下游使用负责。
  • 下载或运行检查点前,请查阅 Krea 2 Turbo模型卡和许可证
  • 提示套件避免请求真实人物、露骨内容、非法活动或受保护标志。生成的图像仍可能包含模型错误、刻板印象、畸形文字或意外相似。
  • 本基准测试仅评估单次受控实验中的检查点保真度,并非人类审美偏好或所有硬件的通用排名。

引用

请参见 CITATION.cff。项目归属名称为 Krea 2 Turbo Formats Benchmark Contributors

搜集汇总
数据集介绍
构建方式
该数据集基于Krea 2 Turbo检查点,在ComfyUI环境中对八种量化格式(BF16、FP8 Scaled、INT8 ConvRot、MXFP8、NVFP4、INT4 ConvRot W4A4、GGUF Q8_0和GGUF Q4_K_M)进行了配对确定性比较。通过固定15个提示词、2个确定性种子,生成了240张1024×1024的评分图像。每张图像均保存为float32解码张量、最终潜变量及完整去噪轨迹,并附有原始度量表、遥测数据和统计比较结果。数据集以Hugging Face ImageFolder格式组织,包含metadata.jsonl和图像文件,同时提供原始数据、度量表、对比图、遥测数据、来源清单及复现代码。
特点
该数据集的核心特点在于其系统化的基准测试设计,通过严格的实验控制(如固定步数、CFG值、采样器和调度器)确保比较的公平性。BF16作为未量化的参考标准,展示了最高保真度;INT8 ConvRot在LPIPS-Alex指标上表现最佳,而GGUF Q8_0在多项指标上与INT8统计上相当。数据集提供了从存储大小到推理速度的多维度评估,揭示了不同量化格式在保真度、存储效率和推理性能之间的权衡,特别强调了MXFP8和NVFP4在Ada GPU上的性能局限。
使用方法
用户可通过Hugging Face Datasets库直接加载图像表格,使用`load_dataset`函数获取训练拆分数据。复现实验需遵循`reproduction/README.md`中的详细指南,需下载约104 GiB的模型文件并确保150 GiB的可用空间。数据集支持本地验证(`validate_release.py`)和重新上传(`upload_to_huggingface.py`)。生成的图像、数据和报告采用CC BY 4.0许可,脚本为MIT许可,用户需遵守Krea 2社区许可协议并自行承担使用责任。
背景与挑战
背景概述
Krea-2-Turbo-Checkpoint-Format-Benchmark数据集于2023年由Krea研究团队创建,旨在系统性地评估文本到图像生成模型中不同量化格式对输出精度的实际影响。该数据集围绕Krea 2 Turbo模型,对比了BF16、FP8、INT8、MXFP8、NVFP4、INT4及GGUF等多种格式在ComfyUI环境下的保真度表现,通过240张1024×1024分辨率图像、配对确定性实验与详尽统计比较,揭示了量化策略在模型压缩与生成质量间的权衡。作为首个严格控制变量、采用标准化评估流程的量化格式基准,它对模型部署、硬件适配及低精度推理研究产生了重要影响,为后续量化优化提供了可靠参考。
当前挑战
该数据集面临的挑战涵盖两大层面。在领域问题层面,文本到图像模型在资源受限场景下需在压缩效率与生成保真度间取得平衡,现有量化格式如INT4和NVFP4虽显著减小模型体积,却导致不可忽视的质量损失,且不同格式在特定硬件上的性能差异使通用最优解难以确立。在构建过程中,团队需克服多格式统一管理的复杂性,确保15个提示词、2个随机种子与8种量化格式的确定性配对实验无偏差扩散,同时处理GPU架构差异带来的性能评估偏差,如MXFP8原生快速路径在Ada GPU上不可用而依赖回落路径,增加了时间统计的领域特异性,限制了结论的跨硬件泛化性。
常用场景
经典使用场景
在生成式人工智能与模型压缩技术交织并进的当下,Krea-2-Turbo-Checkpoint-Format-Benchmark数据集为研究者提供了一套严谨、可复现的基准评测框架。其最经典的用途在于对同一扩散模型(Krea 2 Turbo)经不同量化与格式转换后的生成保真度进行成对确定性比较。通过固定15条提示词、2个确定性种子及8种代表性格式(如BF16、FP8、INT8、GGUF Q8_0等),生成240张1024×1024的高分辨率图像,并配套保存完整的去噪轨迹、解码张量及原始指标表。这套标准化的实验范式使得研究者能够在可控条件下精准量化量化方法对生成质量的影响,从而指导模型部署时格式的理性选择。
实际应用
在实际产业应用层面,该数据集直接服务于生成式AI模型的边缘部署、云端服务与硬件适配决策。技术团队可依据其中记录的LPIPS数值、显存占用、推理延迟等关键性能参数,为不同硬件环境(如消费级Ada架构GPU与未来Blackwell架构)选择合适的模型格式。例如,侧重存储效率的场景可采纳GGUF Q8_0或Q4_K_M格式以平衡质量与体积;追求推理速度的实时应用可参考FP8 Scaled格式的低延迟表现;而在条件受限的移动设备上,则可根据INT4 ConvRot的最小权重体积做出取舍。数据集提供的完整复现代码和ComfyUI工作流,更使得工程人员无需从零搭建评测管线,即可在自有设备上验证并延展其结论。
衍生相关工作
围绕该数据集衍生出的相关工作已深入到模型压缩、量化感知训练及跨硬件性能预测等多个重要研究分支。其中,基于数据集中保存的噪声轨迹与中间张量,研究者得以提出针对扩散过程特性的非均匀量化策略,以优化关键去噪步骤的精度。另有工作利用该数据的成对指标体系,设计出能够根据硬件算力自动选取最优量化格式的分级推理系统。此外,数据集中揭示的Ada架构与原生Blackwell加速路径的性能差异,也催生了关于量化格式在不同GPU代际间迁移性研究的热潮。这些工作不仅深化了对生成模型量化本质的理解,也推动了更为普适的量化评估基准与工具链的建立,惠及领域内研究者与工程实践者。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务