
MiniMax H3 × Z-Image REF2VA ZS05 INT8 ConvRot 是由 joeygambino 制作的 MiniMax H3 空间细节增强模型。
该版本以 MiniMax H3 为基础,将 Z-Image 的 spatial-attention profile(空间注意力特征) graft 到 H3 的视频生成引擎中,在保留 MiniMax H3 原有视频、音频和参考条件能力的基础上,增强场景空间细节、环境纹理以及画面丰富度。
当前文件:
minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors
属于 REF2VA + ZS05 + INT8 ConvRot 版本。
该模型的核心并不是改变 MiniMax H3 的整体生成方式,而是增强 H3 对空间和纹理细节的表现。
作者将其描述为:
Z-Image spatial-attention profile on H3's engine
主要用于改善:
与简单的后期锐化不同,该模型的目标不是不断增加画面锐度,而是将 Z-Image 的空间注意力特征直接融合进 H3,使生成结果拥有更丰富的空间结构和纹理,同时避免连续镜头出现逐镜头锐化累积的问题。
当前版本为:
REF2VA
即 MiniMax H3 的 Reference-to-Video + Audio 分支。
相比 FL2VA,REF2VA 更适合需要保持参考主体信息的任务,例如:
如果任务重点是人物身份、参考图和声音信息保持,优先使用 REF2VA。
如果任务重点是让视频严格从指定首帧运动到指定尾帧,则更适合选择对应的 FL2VA 版本。
文件名中的:
zs05
不是普通版本号。
作者定义为:
late-block gains, dose 0.5
即 Z-Image spatial detail graft 使用 0.5 dose,主要作用于 H3 的后段 blocks。
因此可以把 ZS05 理解为当前模型采用的 Z-Image 空间特征融合强度 / graft 配置。
该 graft 已经直接 baked into checkpoint,使用时不需要额外加载 Z-Image,也不需要另外添加相关 LoRA。
当前文件属于:
int8_convrot
版本。
这是作者提供的 ComfyUI Native INT8 ConvRot 构建,模型大小约 20.97 GB。
作者同时提供 BF16、FP8、INT8、W4A8、W4A4、NVFP4、MXFP8 等多个精度版本,可以根据显存和硬件环境选择。
其中 INT8 / INT8 ConvRot 主要用于在降低模型资源需求的同时保留较高的生成质量。
不需要 Trigger Words。
这是完整的 MiniMax H3 diffusion model / checkpoint,而不是 LoRA。
Z-Image spatial graft 已经直接写入模型权重,因此不需要通过特殊 Prompt 触发。
正常按照 MiniMax H3 的 Prompt 方式使用即可。
不适用。
该模型不是 LoRA,因此没有 LoRA Strength 参数。
ZS05 的 Z-Image graft dose 已经在模型构建过程中固定为 0.5,使用时不需要再设置额外的 Z-Image Strength。
如果需要,还可以继续在该 checkpoint 上加载兼容 MiniMax H3 的其他 LoRA。
作者提供的是 ComfyUI Native 模型,可以使用普通:
Load Diffusion Model
节点加载。
要求:
ComfyUI 0.32+
模型文件放入对应的 diffusion model / UNet 模型目录后,在现有 MiniMax H3 Workflow 中选择该 checkpoint 即可。
REF2VA 与 FL2VA 的选择逻辑和原版 MiniMax H3 保持一致,因此已有 H3 Workflow 通常不需要因为 Z-Image graft 而重新设计整套节点结构。
Model: MiniMax H3 × Z-Image REF2VA ZS05
Creator: joeygambino
Base Model: MiniMax H3
Type: Diffusion Model / UNet Checkpoint
Variant: REF2VA
Modification: Z-Image Spatial Detail Graft
ZS05: Late-block gains / Dose 0.5
Quantization: INT8 ConvRot
Pruned: Yes
Trigger Words: None
Strength: N/A
Video + Audio: Supported
Framework: ComfyUI Native
Recommended ComfyUI: 0.32+
License: MiniMax H3 Community License
Creator: joeygambino
Hugging Face Repository:
https://huggingface.co/joeygambino/MiniMax-H3-x-Z-Image-native
Original Filename:
minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors
Hugging Face 当前仍提供完全同名文件。
HF 文件记录:
Size: 20,970,379,680 bytes
SHA256: 71b8085ac4221ee036708c230a007d617dccca1b0028b95bb4ee106cb2a385c5
该仓库明确标注:
Base Model: MiniMaxAI/MiniMax-H3
Creator: joeygambino
Project: MiniMax-H3 × Z-Image — spatial detail graft
No creation yet
