From 8496ac99bcc56c5ddc396f3322c81e7950774084 Mon Sep 17 00:00:00 2001 From: biondizzle Date: Sat, 16 May 2026 06:28:16 +0000 Subject: [PATCH] dang clonkurs --- docker-compose.yml | 3 ++- vllm/patches/deepseek_v4.py | 2 +- vllm/patches/lly be able to do atte | 0 3 files changed, 3 insertions(+), 2 deletions(-) delete mode 100644 vllm/patches/lly be able to do atte diff --git a/docker-compose.yml b/docker-compose.yml index 11cf955f..146862ef 100644 --- a/docker-compose.yml +++ b/docker-compose.yml @@ -15,7 +15,8 @@ services: - --trust-remote-code - --enable-expert-parallel - --tensor-parallel-size=8 - - --enforce-eager + - --compilation-config + - '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}' - --tokenizer-mode=deepseek_v4 - --host=0.0.0.0 - --port=8000 diff --git a/vllm/patches/deepseek_v4.py b/vllm/patches/deepseek_v4.py index 2bbe2db7..277e34a1 100644 --- a/vllm/patches/deepseek_v4.py +++ b/vllm/patches/deepseek_v4.py @@ -2212,7 +2212,7 @@ class DeepseekV4ForCausalLM(nn.Module): # AutoWeightsLoader bypasses this logic and would break NVFP4 loading. loaded_params = self.model.load_weights(rest) loaded_params.add("lm_head.weight") - print(" Checkpoint loaded. Transferring weights to GPU & preparing NVFP4...", flush=True) + print(" Checkpoint loaded. Preparing NVFP4...", flush=True) self.model.finalize_mega_moe_weights() self.model._convert_nvfp4_post_load() print(" NVFP4 model ready ✓", flush=True) diff --git a/vllm/patches/lly be able to do atte b/vllm/patches/lly be able to do atte deleted file mode 100644 index e69de29b..00000000