Fix: allocate FP4 buffers as uint8 then view-cast

This commit is contained in:
2026-05-17 21:25:04 +00:00
parent 7256070dd3
commit 803e7160d8

View File

@@ -167,14 +167,14 @@ class CuTeDSLMoERunner:
padded_max_slots, self.hidden_size, dtype=torch.bfloat16, device=self.device
),
'hidden_fp4': torch.zeros(
padded_max_slots, self.hidden_size // 2, dtype=torch.float4_e2m1fn_x2, device=self.device
),
padded_max_slots, self.hidden_size, dtype=torch.uint8, device=self.device
).view(torch.float4_e2m1fn_x2),
'activated': torch.zeros(
padded_max_slots, self.intermediate_size, dtype=torch.bfloat16, device=self.device
),
'activated_fp4': torch.zeros(
padded_max_slots, self.intermediate_size // 2, dtype=torch.float4_e2m1fn_x2, device=self.device
),
padded_max_slots, self.intermediate_size, dtype=torch.uint8, device=self.device
).view(torch.float4_e2m1fn_x2),
})
self._shared_bufs = CuTeDSLMoERunner._shared_padded_bufs[device_key]