Krea-2-Turbo-Checkpoint-Format-Benchmark
收藏资源简介:
Krea 2 Turbo ComfyUI格式保真度基准数据集是一个用于系统评估Krea 2 Turbo模型在不同量化检查点格式下图像生成质量的配对比较数据集。该数据集旨在为模型量化研究提供可复现的基准测试,涵盖BF16、FP8 Scaled、INT8 ConvRot、MXFP8、NVFP4、INT4 ConvRot W4A4、GGUF Q8_0和GGUF Q4_K_M共八种格式。数据集包含240个已评分的1024×1024分辨率图像,每个图像均配有对应的提示词、随机种子、格式类型和检查点来源信息。此外,数据集还提供了完整的科学实验数据,包括float32解码张量、最终潜在表示、每一步的去噪轨迹、原始指标表格、GPU/系统遥测数据以及统计比较结果。数据组织采用多模态结构:包含用于Hugging Face Dataset Viewer的小型Parquet分片(嵌入图像和所有元数据)、标准的ImageFolder树结构(用于直接文件访问)、原始科学数据文件、指标表格目录、格式比较表、遥测数据记录、实验环境证明文件和完整的复现脚本。数据集在严格控制条件下生成:使用15个提示词和2个确定性种子,每个提示-种子组合生成8种格式的图像,采用固定推理参数(8步Euler采样器、CFG 1.0、批大小1等)。数据集适用于文本到图像生成任务的量化评估、模型保真度比较、生成质量指标分析等研究场景。所有生成图像、数据和报告均在CC BY 4.0许可下发布,基准测试脚本为MIT许可,模型权重遵循Krea 2社区许可。
数据集概述
数据集名称:Krea 2 Turbo ComfyUI Format Fidelity Benchmark
语言:英语
许可证:CC-BY-4.0
任务类别:文本到图像(text-to-image)
标签:图像、表格、ComfyUI、Krea-2、量化、基准测试、BF16、FP8、INT8、MXFP8、NVFP4、INT4、GGUF、Q8-0、Q4-K-M
大小:小于1000条样本(n<1K)
主要结果
- BF16 是未量化的官方检查点,作为最高保真度参考。
- INT8 ConvRot 在预先注册的LPIPS-Alex指标上略微领先,但GGUF Q8_0在统计上与它持平(Holm调整置换检验 p=0.9067),并在DISTS、DINO相似性和重构权重SNR上领先。
- GGUF Q8_0 是新增三种格式中保真度最高的。
- MXFP8 保真度排名第四(LPIPS 0.071229),模型大小减半至BF16的一半,但在本测试的Ada GPU上无法使用原生SM 10.0快速路径,导致回退采样耗时31.929秒。
- FP8 Scaled 排名第五(LPIPS 0.093701),大小为12.239 GiB,且在原始五种格式中推理速度最快(19.503秒)。
- GGUF Q4_K_M 是一种存储质量折衷方案:6.972 GiB,保真度比INT4 ConvRot更接近BF16,但在本Ada GPU上因ComfyUI-GGUF反量化执行路径而速度较慢。
- NVFP4 大小为7.147 GiB,保真度中等损失(LPIPS 0.205124),与MXFP8类似,原生快速乘法需要SM 10.0,本测试使用回退路径耗时24.925秒。
- INT4 ConvRot W4A4 是三种新增格式中最小的检查点,在RTX 4060 Ti上推理速度最快,但保真度损失最大。
注意:未使用加权复合分数。详细技术报告见 TECHNICAL_REPORT.md,决策表见 tables/decision_table.csv。
重要性能限制
- 测试GPU为NVIDIA GeForce RTX 4060 Ti 16 GB(SM 8.9)。
- MXFP8和NVFP4的原生快速矩阵乘法需要SM 10.0,在本次运行时不可用。
- GGUF Q8_0和Q4_K_M使用了固定的ComfyUI-GGUF按需反量化矩阵乘法路径。
- 这些Ada GPU上的计时结果不能直接推广至原生Blackwell执行环境。
- 原始五种格式与新增三种格式在不同会话中测量。通过五次无评分的BF16和INT8 ConvRot桥接重复测量来量化漂移。INT8超出了预先注册的5%漂移阈值,因此新旧版本的精确计时比较需谨慎;保真度比较仍与同一保存的BF16提示/种子输出配对。
数据集组织
data/train/metadata.jsonl和data/train/images/:数据集查看器和加载源,使用Hugging Face ImageFolder。数据集卡片明确将train分割限制在此目录树中,以避免仓库中其他科学JSON文件被错误推断为数据集分割。每行元数据将图像与提示、种子、格式、检查点来源、原始科学工件和展平的指标值关联。raw/:包含每个评分运行的decoded_float32.npy、final_latent_float32.npy、trajectory.npz和采集metadata.json。metrics/:包含原始每图像、每参数、配对统计、汇总、轨迹、延迟和性能表格。comparison_sheets/:包含八格式联系表、BF16相对差异图和自动选择的细节裁剪图。telemetry/:包含评分GPU/系统遥测数据以及BF16/INT8桥接遥测数据。provenance/:包含净化后的环境、模型、运行和发布清单。reproduction/:包含ComfyUI工作流、自定义捕获节点、基准测试驱动程序、分析器、模型下载器和精确说明。
固定推理控制
- 15个提示 × 2个确定种子 × 8种检查点格式 = 240张评分图像
- 分辨率:1024×1024,批次大小:1
- 步数:8步,CFG:1.0,采样器:Euler,调度器:simple,去噪:1.0
- 共享文本编码器
qwen3vl_4b_bf16.safetensors和VAEqwen_image_vae.safetensors - 使用零值正条件作为负条件
- 无提示重写、LoRA、预览、放大或后处理
- 每个八格式提示/种子组的初始噪声SHA-256相同
复现与验证
- 按照
reproduction/README.md操作。 - 完整重新运行需下载约104 GiB的上游模型文件,并至少预留150 GiB空闲空间用于模型、采集、分析缓存和报告。
- 在Windows 11上使用16 GB NVIDIA GPU测试;低内存配置未认证。
- 验证下载的发布版本:
python scripts/validate_release.py --root . --full - 上传本地重建副本:
python scripts/upload_to_huggingface.py OWNER/DATASET --root .
许可证与责任使用
- 生成的图像、数据和报告遵循CC BY 4.0许可证。
- 基准测试脚本遵循MIT许可证。
- 模型权重不重新分发,仍受Krea 2社区许可证约束。
- Krea声明不对用户生成的输出主张知识产权,用户仍对其提示、输出和下游使用负责。
- 下载或运行检查点前,请查阅 Krea 2 Turbo模型卡和许可证。
- 提示套件避免请求真实人物、露骨内容、非法活动或受保护标志。生成的图像仍可能包含模型错误、刻板印象、畸形文字或意外相似。
- 本基准测试仅评估单次受控实验中的检查点保真度,并非人类审美偏好或所有硬件的通用排名。
引用
请参见 CITATION.cff。项目归属名称为 Krea 2 Turbo Formats Benchmark Contributors。




