diff --git a/docker-compose.yml b/docker-compose.yml index 11cf955f..146862ef 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -15,7 +15,8 @@ services: - --trust-remote-code - --enable-expert-parallel - --tensor-parallel-size=8 - - --enforce-eager + - --compilation-config + - '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}' - --tokenizer-mode=deepseek_v4 - --host=0.0.0.0 - --port=8000 diff --git a/vllm/patches/deepseek_v4.py b/vllm/patches/deepseek_v4.py index 2bbe2db7..277e34a1 100644 --- a/vllm/patches/deepseek_v4.py +++ b/vllm/patches/deepseek_v4.py @@ -2212,7 +2212,7 @@ class DeepseekV4ForCausalLM(nn.Module): # AutoWeightsLoader bypasses this logic and would break NVFP4 loading. loaded_params = self.model.load_weights(rest) loaded_params.add("lm_head.weight") - print(" Checkpoint loaded. Transferring weights to GPU & preparing NVFP4...", flush=True) + print(" Checkpoint loaded. Preparing NVFP4...", flush=True) self.model.finalize_mega_moe_weights() self.model._convert_nvfp4_post_load() print(" NVFP4 model ready ✓", flush=True) diff --git a/vllm/patches/lly be able to do atte b/vllm/patches/lly be able to do atte deleted file mode 100644 index e69de29b..00000000