From ae6b879d3890c7bf2354291eba878183b3238a9e Mon Sep 17 00:00:00 2001 From: biondizzle Date: Sun, 17 May 2026 07:59:00 +0000 Subject: [PATCH] fix: pass expert_offsets without leading 0 to GEMM (matches pipeline) --- vllm/nvfp4_cutedsl.py | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/vllm/nvfp4_cutedsl.py b/vllm/nvfp4_cutedsl.py index 6c05e53e..46625cef 100644 --- a/vllm/nvfp4_cutedsl.py +++ b/vllm/nvfp4_cutedsl.py @@ -274,7 +274,7 @@ class CuTeDSLMoERunner: l1_out = run_nvfp4_grouped_gemm( mat_a=x_fp4, mat_b=self._l1_mat_b, scale_a=l1_scale_a, scale_b=self._l1_scale_b, - expert_offsets=expert_offsets[:self.num_experts + 1], + expert_offsets=expert_offsets[1:self.num_experts + 1], global_scale_a=l1_gsa, global_scale_b=self._l1_gsb, ) @@ -300,7 +300,7 @@ class CuTeDSLMoERunner: l2_out = run_nvfp4_grouped_gemm( mat_a=l2_x_fp4, mat_b=self._l2_mat_b, scale_a=l2_scale_a, scale_b=self._l2_scale_b, - expert_offsets=expert_offsets[:self.num_experts + 1], + expert_offsets=expert_offsets[1:self.num_experts + 1], global_scale_a=l2_gsa, global_scale_b=self._l2_gsb, )