diff --git a/quantize_modelopt.py b/quantize_modelopt.py index d3c5de1..ad9f801 100644 --- a/quantize_modelopt.py +++ b/quantize_modelopt.py @@ -100,6 +100,10 @@ def main(): } if args.use_seq_device_map: model_kwargs["device_map"] = "auto" + model_kwargs["offload_folder"] = "offload" + model_kwargs["offload_state_dict"] = True + model_kwargs["max_memory"] = {i: "160GiB" for i in range(8)} + model_kwargs["max_memory"]["cpu"] = "2500GiB" model = AutoModelForCausalLM.from_pretrained(args.model, **model_kwargs)