From d58547572e5235771bed7225f1bc8e8f41b07eb0 Mon Sep 17 00:00:00 2001 From: Nick Fraser Date: Tue, 5 Nov 2024 14:01:30 +0000 Subject: [PATCH] Fix (example/brevitas): GPTQ should be applied before calibration. --- optimum/amd/brevitas/quantizer.py | 12 +++++++----- 1 file changed, 7 insertions(+), 5 deletions(-) diff --git a/optimum/amd/brevitas/quantizer.py b/optimum/amd/brevitas/quantizer.py index d06e143b..8741a1ca 100644 --- a/optimum/amd/brevitas/quantizer.py +++ b/optimum/amd/brevitas/quantizer.py @@ -221,9 +221,16 @@ def quantize( quantize_input_zero_point=quantization_config.quantize_zero_point, ) + model(**calibration_dataset[0]) + if use_accelerate: model = offload_model(model, quantization_config.gpu_device_map, quantization_config.cpu_device_map) + if not quantization_config.weights_only and quantization_config.is_static: + logger.info("Applying activation calibration...") + apply_calibration(model, calibration_dataset) + logger.info("Activation calibration applied.") + if quantization_config.apply_gptq: logger.info("Applying gptq...") apply_gptq( @@ -234,11 +241,6 @@ def quantize( ) logger.info("GPTQ applied.") - if not quantization_config.weights_only and quantization_config.is_static: - logger.info("Applying activation calibration...") - apply_calibration(model, calibration_dataset) - logger.info("Activation calibration applied.") - if quantization_config.apply_bias_correction: logger.info("Applying Bias Correction...") apply_bias_correction(