Changed from config to model_args

2025-12-16 08:59:26 +00:00 · 2024-10-25 12:24:50 -07:00 · 2024-10-25 12:24:50 -07:00 · db4f18099f
commit db4f18099f
parent 93472042f8
2 changed files with 9 additions and 18 deletions
--- a/llama_stack/providers/impls/meta_reference/inference/generation.py
+++ b/llama_stack/providers/impls/meta_reference/inference/generation.py
@ -151,15 +151,11 @@ class Llama:
            elif isinstance(config.quantization, Int4QuantizationConfig):
                from .quantization.loader import convert_to_int4_quantized_model

-                assert (
-                    config.quantization.scheme is not None
-                ), "Please specify a quantization scheme."
-
                model = Transformer(model_args)
                model = convert_to_int4_quantized_model(model, model_args, config)
                model.load_state_dict(state_dict, strict=True)

-                if config.quantization.spinquant:
+                if model_args.quantization_args.spinquant:
                    # Add a wrapper for adding hadamard transform for spinquant.
                    # This needs to be done after loading the state dict otherwise an error will be raised while
                    # loading the state dict.