damn clankers

This commit is contained in:
2026-05-14 20:23:42 +00:00
parent 6aae8f1393
commit 5bbe51357c
4 changed files with 15 additions and 293 deletions

View File

@@ -36,17 +36,17 @@ class SymmBuffer:
device = torch.cuda.current_device()
# NVFP4: packed E2M1 (2 values per byte), so K//2
sf_k_groups_hidden = hidden_size // (16 * 4) # UE4M3 block16, 4 packed per uint32
sf_k_groups_inter = intermediate_size // (16 * 4)
sf_k_groups_hidden = hidden_size // 16 # UE4M3 block16, 1 scale per group
sf_k_groups_inter = intermediate_size // 16
# Staging buffers (matching DeepGEMM layout)
# Staging buffers (matching kernel's expected input format)
self.x = torch.empty(
max_num_tokens, hidden_size // 2,
dtype=torch.int8, device=device,
)
self.x_sf = torch.empty(
max_num_tokens, sf_k_groups_hidden,
dtype=torch.uint32, device=device,
dtype=torch.float8_e4m3fn, device=device,
)
self.topk_idx = torch.empty(
max_num_tokens, top_k,