minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors
UpdateSep 16, 2026 17:56PublishedAug 27, 2026 18:17
26
0
0
minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors - 1
Avatar
Lorena
Type
UNet
Basic Model
MiniMax H3
Published time
Aug 27, 2026 18:17
File Signature
93970fdc4577466500c0e22ab96dd61cf359b4c0e8466360b50289a122f5326c
minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors
19.53 GB

MiniMax H3 × Z-Image REF2VA ZS05 INT8 ConvRot

MiniMax H3 × Z-Image REF2VA ZS05 INT8 ConvRot 是由 joeygambino 制作的 MiniMax H3 空间细节增强模型。

该版本以 MiniMax H3 为基础,将 Z-Image 的 spatial-attention profile(空间注意力特征) graft 到 H3 的视频生成引擎中,在保留 MiniMax H3 原有视频、音频和参考条件能力的基础上,增强场景空间细节、环境纹理以及画面丰富度。

当前文件:

minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors

属于 REF2VA + ZS05 + INT8 ConvRot 版本。

主要效果

该模型的核心并不是改变 MiniMax H3 的整体生成方式,而是增强 H3 对空间和纹理细节的表现。

作者将其描述为:

Z-Image spatial-attention profile on H3's engine

主要用于改善:

  • 场景空间细节
  • 环境纹理丰富度
  • 背景与布景表现
  • 表面材质和局部细节
  • 多镜头之间的视觉一致性
  • 在增加细节的同时保持人物 Identity

与简单的后期锐化不同,该模型的目标不是不断增加画面锐度,而是将 Z-Image 的空间注意力特征直接融合进 H3,使生成结果拥有更丰富的空间结构和纹理,同时避免连续镜头出现逐镜头锐化累积的问题。

REF2VA

当前版本为:

REF2VA

即 MiniMax H3 的 Reference-to-Video + Audio 分支。

相比 FL2VA,REF2VA 更适合需要保持参考主体信息的任务,例如:

  • 参考图生视频
  • 人物 Identity 保持
  • 角色参考
  • Voice Anchoring
  • Identity Bank
  • 连续角色视频生成

如果任务重点是人物身份、参考图和声音信息保持,优先使用 REF2VA。

如果任务重点是让视频严格从指定首帧运动到指定尾帧,则更适合选择对应的 FL2VA 版本。

ZS05 是什么?

文件名中的:

zs05

不是普通版本号。

作者定义为:

late-block gains, dose 0.5

即 Z-Image spatial detail graft 使用 0.5 dose,主要作用于 H3 的后段 blocks。

因此可以把 ZS05 理解为当前模型采用的 Z-Image 空间特征融合强度 / graft 配置

该 graft 已经直接 baked into checkpoint,使用时不需要额外加载 Z-Image,也不需要另外添加相关 LoRA。

INT8 ConvRot

当前文件属于:

int8_convrot

版本。

这是作者提供的 ComfyUI Native INT8 ConvRot 构建,模型大小约 20.97 GB

作者同时提供 BF16、FP8、INT8、W4A8、W4A4、NVFP4、MXFP8 等多个精度版本,可以根据显存和硬件环境选择。

其中 INT8 / INT8 ConvRot 主要用于在降低模型资源需求的同时保留较高的生成质量。

Trigger Words

不需要 Trigger Words。

这是完整的 MiniMax H3 diffusion model / checkpoint,而不是 LoRA。

Z-Image spatial graft 已经直接写入模型权重,因此不需要通过特殊 Prompt 触发。

正常按照 MiniMax H3 的 Prompt 方式使用即可。

Strength

不适用。

该模型不是 LoRA,因此没有 LoRA Strength 参数。

ZS05 的 Z-Image graft dose 已经在模型构建过程中固定为 0.5,使用时不需要再设置额外的 Z-Image Strength。

如果需要,还可以继续在该 checkpoint 上加载兼容 MiniMax H3 的其他 LoRA。

ComfyUI 使用

作者提供的是 ComfyUI Native 模型,可以使用普通:

Load Diffusion Model

节点加载。

要求:

ComfyUI 0.32+

模型文件放入对应的 diffusion model / UNet 模型目录后,在现有 MiniMax H3 Workflow 中选择该 checkpoint 即可。

REF2VA 与 FL2VA 的选择逻辑和原版 MiniMax H3 保持一致,因此已有 H3 Workflow 通常不需要因为 Z-Image graft 而重新设计整套节点结构。

模型信息

Model: MiniMax H3 × Z-Image REF2VA ZS05
Creator: joeygambino
Base Model: MiniMax H3
Type: Diffusion Model / UNet Checkpoint
Variant: REF2VA
Modification: Z-Image Spatial Detail Graft
ZS05: Late-block gains / Dose 0.5
Quantization: INT8 ConvRot
Pruned: Yes
Trigger Words: None
Strength: N/A
Video + Audio: Supported
Framework: ComfyUI Native
Recommended ComfyUI: 0.32+
License: MiniMax H3 Community License

原始来源

Creator: joeygambino

Hugging Face Repository:

https://huggingface.co/joeygambino/MiniMax-H3-x-Z-Image-native

Original Filename:

minimax_h3_ref2va_pruned_zs05_int8_convrot.safetensors

Hugging Face 当前仍提供完全同名文件。

HF 文件记录:

Size: 20,970,379,680 bytes
SHA256: 71b8085ac4221ee036708c230a007d617dccca1b0028b95bb4ee106cb2a385c5

该仓库明确标注:

Base Model: MiniMaxAI/MiniMax-H3
Creator: joeygambino
Project: MiniMax-H3 × Z-Image — spatial detail graft

Gallery

No creation yet