遇见数据集

minimax-h3-soup

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

MiniMax H3 Soup 是一个用于 ComfyUI MiniMax H3 Ref2V 基准测试的可复现性存档数据集。该数据集在 NVIDIA RTX 3090(32 GB DDR4 RAM、CUDA 13、ComfyUI 0.34.4、PyTorch 2.9.1+cu130)上创建,旨在记录和分享对 MiniMax H3 模型和 LoRA 的局部基准测试结果。数据集包含以下内容:原始基准测试工作流图(source_prompt.json)、清单和结果表;来自 C1-C11 基准测试网格的所有一秒 MP4 视频(包括主要 res_multistep 采样器和 Euler 消融扫描);标注的 C1-C11 视觉接触表、Ref2VA 库存控制表以及静态渲染时间汇总图;以及可复用的 ComfyUI 工作流 JSON。文件按约定组织为 benchmark/、videos/、reports/ 和 workflows/ 目录。数据集查看器通过 metadata.csv 提供每个视频的元数据,包括实验案例(C1-C11 或 Stock)、显示名称、模型/LoRA、百万像素、原生分辨率、步数、采样器(ksampler)、种子和实测渲染时间。C1-C11 图例详细列出了 11 种模型/LoRA 配置(包括 Stock 基础模型)。所有主要网格测试使用一秒时长、固定种子和 res_multistep 采样器,而 Euler 网格在相同分辨率/步数下重复 C1-C11。质量指标文件 quality_metrics.csv 和数据集查看器列提供了透明、确定性的技术评分,包括锐度(拉普拉斯方差)、对比度(亮度标准差)、曝光(裁剪像素分数)、饱和度均值、时间一致性(光流对齐残差)以及综合技术质量分数(45% 锐度 + 25% 对比度 + 20% 曝光 + 10% 时间一致性)。该数据集适用于评估 MiniMax H3 视频生成模型在不同 LoRA 和采样器下的渲染速度和技术质量,但不对身份准确性、提示遵循度、音频或艺术偏好进行评分。

MiniMax H3 Soup is a reproducibility archive dataset for benchmarking ComfyUI MiniMax H3 Ref2V. Created on NVIDIA RTX 3090 (32 GB DDR4 RAM, CUDA 13, ComfyUI 0.34.4, PyTorch 2.9.1+cu130), it records and shares local benchmark results of MiniMax H3 model and LoRAs. The dataset includes: original benchmark workflow graph (source_prompt.json), manifest and results table; all one-second MP4 videos from C1-C11 benchmark grid (including primary res_multistep sampler and Euler ablation scan); annotated C1-C11 visual contact table, Ref2VA inventory control table, and static rendering time summary plot; and reusable ComfyUI workflow JSONs. Files are organized into benchmark/, videos/, reports/, and workflows/ directories. The dataset viewer provides per-video metadata via metadata.csv, including experiment case (C1-C11 or Stock), display name, model/LoRA, megapixels, native resolution, steps, sampler (ksampler), seed, and measured render time. The C1-C11 legend details 11 model/LoRA configurations (including Stock base model). All main grid tests use one-second duration, fixed seed, and res_multistep sampler, while the Euler grid repeats C1-C11 at identical resolution/steps. Quality metrics file quality_metrics.csv and dataset viewer columns provide transparent, deterministic technical scores: sharpness (Laplacian variance), contrast (brightness standard deviation), exposure (clipped pixel fraction), saturation mean, temporal consistency (optical flow alignment residual), and composite technical quality score (45% sharpness + 25% contrast + 20% exposure + 10% temporal consistency). This dataset is suitable for evaluating rendering speed and technical quality of MiniMax H3 video generation models under different LoRAs and samplers, but does not score identity accuracy, prompt adherence, audio, or artistic preferences.

创建时间:
2026-09-08
原始信息汇总

MiniMax H3 Soup 数据集概述

数据集简介

MiniMax H3 Soup 是一个用于 ComfyUI MiniMax H3 Ref2V 视频生成基准测试的可复现性存档数据集,记录在 NVIDIA RTX 3090 上运行的本地基准测试结果。该数据集聚焦于 C1-C11 模型/LoRA 组合的一秒短视频生成效果对比。

数据集内容

核心文件

  • 基准测试工作流图source_prompt.json
  • 执行记录results.jsonl(追加式记录)和 results.csv(表格导出)
  • 视频文件:原始 C1-C11 基准网格及其 Euler 重复扫描的全部一秒 MP4 视频
  • 视觉对比图:带标签的 C1-C11 视觉接触表、Ref2VA 库存控制表和渲染时间汇总图
  • 技术评分工具quality_metrics.csv 和评分脚本 tools/score_h3_primary_videos.py

目录结构

路径 内容
benchmark/primary_res_multistep_1s/ 主 C1-C11 模型/LoRA 测试(res_multistep,1秒)
benchmark/euler_ablation_1s/ 完整 C1-C11 重复网格(euler,1秒)
benchmark/c7_r1_original_turbo_1s/ 修正后的 C7 原始 Larry v4 实验
videos/ 对应各组视频文件
reports/ 接触表和渲染时间图表
workflows/ 清理后的可复用 ComfyUI 工作流 JSON

系统配置

  • NVIDIA RTX 3090
  • 32 GB DDR4 RAM
  • CUDA 13
  • ComfyUI 0.34.4
  • PyTorch 2.9.1+cu130

数据集配置

数据集包含三个可浏览配置:

  1. primary_res_multistep_1s:使用 res_multistep 采样器的主测试结果
  2. euler_ablation_1s:使用 euler 采样器的重复对比结果
  3. c7_r1_original_turbo_1s:修正后的 C7_r1 实验视频(4/6/8 步)

C1-C11 模型/LoRA 对照表

标签 含义
Stock Ref2VA 基础模型,无 LoRA,分别在 20/25/30 步测试
C1 minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot(无 LoRA)
C2 Minimax_H3_fl2va_Pruned_Lightx2v_turbo_4step_v1.2_768p_INT8(无 LoRA)
C3 Minimax_H3_FL2VA_PRUNED_Turbo_8step_v1.0_768p_INT8(无 LoRA)
C4 Ref2VA + minimax_h3_fl2v_turbo_4step_v1.1_768p LoRA
C5 Ref2VA + minimax_h3_fl2v_turbo_4step_v1.2_768p LoRA
C6 Ref2VA + minimax_h3_ref2v_turbo_4step_v0.1 LoRA
C7(旧版) Ref2VA + Larry 原始 LoRA(标准加载器,仅历史参考)
C7_r1(修正) Ref2VA + 同一 LoRA(使用 MiniMaxH3TurboLoRA 和 TurboSampler)
C8 Ref2VA + minimax_h3_fl2v_turbo_8step_v1.0 LoRA
C9 Ref2VA + minimax_h3_fl2v_turbo_8step_v1.0_768p LoRA
C10 Ref2VA + 转换后的 fasth3_6step_converted_dense_datafree LoRA
C11 minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot(无 LoRA)

技术质量指标

数据集采用 h3-transparent-v1 方法进行确定性技术评分,使用 OpenCV 5.0.0 和 NumPy 2.4.4 实现,每段视频取 8 个均匀间隔的帧进行评分:

指标 含义
清晰度(Laplacian 方差) 边缘细节代理指标
对比度(亮度标准差) 亮度对比度
曝光度(裁剪像素比例) 近黑/近白像素占比
饱和度均值 色彩饱和度诊断(不计入总分)
时间一致性(光流对齐残差) 帧间残差
综合技术质量分 45% 清晰度 + 25% 对比度 + 20% 曝光度 + 10% 时间一致性

这些指标不评估身份准确性、提示词遵循度、音频、运动方向或艺术偏好,仅作为技术筛选工具。

重要说明

  • C7 修正注意事项:旧版 C7 结果使用标准 ComfyUI LoRA 加载器,不能作为原始 v4 LoRA 的有效质量排名依据。应使用修正后的 C7_r1 配置(自定义加载器 + Turbo Sampler,8 步,low_vram=false)进行判断。
  • 编号说明:原始文件名使用内部 ID(如 09_...10_...)对应面向用户的 C8 和 C9,元数据列已映射至正确标签。
  • 评分工具可复现:对未修改的 MP4 重新运行评分脚本可得到相同结果。
  • 基准范围:本数据集是实验性基准,不代表通用模型质量声明;视觉偏好和音频质量单独评估,每次扫描均使用相同的随机种子和提示词设置。
搜集汇总
数据集介绍
minimax-h3-soup 数据集图片
构建方式
在视频生成模型评估领域,可复现性基准是验证模型性能的关键环节。该数据集构建于NVIDIA RTX 3090环境,依托ComfyUI 0.34.4与PyTorch 2.9.1+cu130,系统性地对MiniMax H3 Ref2V模型进行了受控实验。数据集囊括主要分辨率多步长实验、Euler采样器消融实验,以及修正后的C7_r1原始Turbo实验三大配置,每项配置均包含完整的视频文件、元数据侧车(metadata.csv)与工作流JSON。实验设计严谨,针对C1-C11共11种模型/LoRA组合,在固定种子、时长与提示词条件下,变化分辨率和步数,并额外引入无LoRA的Stock对照,确保评估的全面性与可比性。
特点
该数据集的核心特色在于其透明性与可复现性。所有视频文件名保留原始内部ID,元数据列提供案例标签、显示名称等易读信息,并特别修正了C8/C9的内部编号映射。此外,数据集提供了一套确定性的技术质量评分方法(h3-transparent-v1),通过拉普拉斯方差、亮度标准差等客观指标,对视频的清晰度、对比度、曝光和时序一致性进行量化,同时公开了评分工具脚本,保证了评分的可重复性。视觉对比组图与渲染时间汇总表的收录,则进一步辅助研究者进行直观比较与分析。
使用方法
数据集的使用便捷且多维度。研究者可通过HuggingFace Dataset Viewer直接浏览各配置下的视频,并依元数据列进行筛选与比对。更深入的定制化分析可利用附带的工作流JSON文件,在更新本地模型路径后于ComfyUI中复现实验。对于技术质量评估,可运行开源的评分脚本,针对原始MP4文件重新生成一致性指标。值得注意的是,使用时应遵循数据集内的说明,例如区分C7历史数据与修正版C7_r1的适用场景,避免误用历史数据评判原始LoRA性能,从而确保研究结论的准确性与可靠性。
背景与挑战
背景概述
MiniMax H3 Soup数据集诞生于2025年,由ComfyUI社区的研究人员创建,旨在系统评估MiniMax H3视频生成模型在消费级硬件(RTX 3090)上的性能。该数据集围绕Ref2VA基础模型及其多种LoRA适配器,构建了包含11种配置的基准测试网格,涵盖了分辨率、步长和采样器类型的组合,并提供了完整的视频样本、工作流和透明化质量评分。其核心研究问题在于量化不同模型变体在受控条件下的视觉质量与渲染效率,为社区提供了可复现的对比框架,对视频生成模型的本地化部署与优化研究具有重要参考价值,填补了该领域在低端硬件基准测试方面的空白。
当前挑战
该数据集所解决的领域问题涉及视频生成模型评估中的两大核心挑战:一是技术质量的客观量化,研究中设计了h3-transparent-v1评分体系,综合锐度、对比度、曝光及时间一致性等多维度指标,以超越单纯主观视觉判断;二是模型兼容性与部署的复杂性,尤其在非标准采样器或LoRA加载方式的处理上,例如C7配置因使用错误加载器导致基准失效,需定制化节点予以修正。构建过程中面临的挑战包括硬件资源限定(单张RTX 3090和32GB内存)带来的渲染时间限制,以及文件命名不一致(内部ID与用户标签错位)和系统文件锁等数据管理问题,这些均需精心设计元数据映射与存档策略,确保基准的可靠性与可复现性。
常用场景
经典使用场景
MiniMax H3 Soup数据集作为复现基准的珍贵档案,为视频生成模型在消费级硬件上的系统评估提供了严谨的框架。其核心使用场景聚焦于对ComfyUI中MiniMax H3 Ref2V工作流的可复现性验证,通过固定种子、统一提示词及受控分辨率/步长网格,研究者得以量化不同模型与LoRA适配组合在RTX 3090上的生成性能。数据集中涵盖的C1至C11系列实验,细致刻画了基础模型与各种微调LoRA在单秒视频生成任务中的表现差异,为硬件受限环境下视频生成管线的优化提供了标准化测试协议。
实际应用
在实际应用层面,MiniMax H3 Soup为视频生成工具链的开发者与创意工作者提供了一份弥足珍贵的实践指南。诸如C7_r1的修正案例,明确了特定LoRA(如Larry v4)必须借助专用加载器与采样器方能释放完整潜能,这为社区规避配置陷阱、实现最优生成效果提供了直接参照。数据集中渲染耗时统计与视觉对比图集,可辅助用户在质量与速度间做出权衡,选择契合自身硬件与创意的模型和参数。同时,其记录的ComfyUI工作流JSON作为可复用资产,显著降低了视频生成技术探索的上手门槛,加速了从研究原型到实际应用的转化。
衍生相关工作
该数据集的发布滋生了多元化的衍生研究脉络。其一,它所确立的‘透明技术评分’(h3-transparent-v1)方法,激励了更为精细的自动化视频质量评估工具的开发,后续工作可在此基础上融合语义一致性、运动合理性等维度加以拓展。其二,对Euler与res_multistep等采样器的详尽对照,催生了针对特定模型架构的自适应采样算法研究。其三,C7案例中关于LoRA兼容性与加载器角色的追根究底,引发了社区对模型微调产物可移植性与封装规范的广泛探讨,可能推动标准化模型适配接口的出现。最后,作为在受限硬件上生成高质量视频的实证,它为边缘计算与实时视频生成领域的模型轻量化探索树立了参照坐标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务