diff --git a/src/h3_blackwell_runtime/qwen3vl_vision.py b/src/h3_blackwell_runtime/qwen3vl_vision.py index 05eae4c..7fd2fcb 100644 --- a/src/h3_blackwell_runtime/qwen3vl_vision.py +++ b/src/h3_blackwell_runtime/qwen3vl_vision.py @@ -213,7 +213,8 @@ class _VisionPatchEmbed(nn.Module): def forward(self, x: torch.Tensor) -> torch.Tensor: target = self.weight.dtype x = x.view(-1, 3, VISION_TEMPORAL, VISION_PATCH, VISION_PATCH) - return F.conv3d(x.to(target), self.weight, self.bias, kernel_size=(VISION_TEMPORAL, VISION_PATCH, VISION_PATCH), stride=(VISION_TEMPORAL, VISION_PATCH, VISION_PATCH)).view(-1, self.weight.shape[0]) + s = (VISION_TEMPORAL, VISION_PATCH, VISION_PATCH) + return F.conv3d(x.to(target), self.weight, self.bias, stride=s).view(-1, self.weight.shape[0]) class _VisionMLP(nn.Module):