From 5f68f1dce9ffbd0d31e15f9c9db5fdae47508e6e Mon Sep 17 00:00:00 2001 From: Daniel Maddern Date: Thu, 13 Aug 2026 23:29:29 +0700 Subject: [PATCH] Decode preview VAE in inference mode --- tools/direct_t2v_preview.py | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/tools/direct_t2v_preview.py b/tools/direct_t2v_preview.py index bf8317f..5a39c70 100644 --- a/tools/direct_t2v_preview.py +++ b/tools/direct_t2v_preview.py @@ -47,7 +47,8 @@ if args.model_timesteps_capture is not None: ] latent = sample_video_res_multistep(model, H3PromptPacker(checkpoint), text, video, audio, steps=args.steps, model_timesteps=model_timesteps) vae = MiniMaxH3VideoVAE.from_safetensors("/vae/minimax_h3_video_vae_fp16.safetensors", device="cuda").eval() -pixels = vae.decode(latent.to(next(vae.parameters()).dtype))[:, :, :frames] +with torch.inference_mode(): + pixels = vae.decode(latent.to(next(vae.parameters()).dtype))[:, :, :frames] pixels = ((pixels[0].permute(1, 2, 3, 0).clamp(-1, 1) + 1) * 127.5).to(torch.uint8).cpu() args.output.parent.mkdir(parents=True, exist_ok=True) raw = args.output.with_suffix(".rgb")