precommit

2025-12-03 09:53:45 +00:00 · 2024-11-08 17:58:58 -08:00 · 2024-11-08 17:58:58 -08:00 · ba82021d4b
commit ba82021d4b
parent 1ebf6447c5
11 changed files with 19 additions and 14 deletions
--- a/llama_stack/providers/inline/inference/meta_reference/config.py
+++ b/llama_stack/providers/inline/inference/meta_reference/config.py
@ -10,9 +10,10 @@ from llama_models.datatypes import *  # noqa: F403
 from llama_models.sku_list import resolve_model

 from llama_stack.apis.inference import *  # noqa: F401, F403
-from llama_stack.providers.utils.inference import supported_inference_models
 from pydantic import BaseModel, Field, field_validator

+from llama_stack.providers.utils.inference import supported_inference_models
+

 class MetaReferenceInferenceConfig(BaseModel):
    model: str = Field(
--- a/llama_stack/providers/inline/inference/meta_reference/generation.py
+++ b/llama_stack/providers/inline/inference/meta_reference/generation.py
@ -35,12 +35,13 @@ from termcolor import cprint

 from llama_stack.apis.inference import *  # noqa: F403

+from lmformatenforcer import JsonSchemaParser, TokenEnforcer, TokenEnforcerTokenizerData
+
 from llama_stack.distribution.utils.model_utils import model_local_dir
 from llama_stack.providers.utils.inference.prompt_adapter import (
    augment_content_with_response_format_prompt,
    chat_completion_request_to_messages,
 )
-from lmformatenforcer import JsonSchemaParser, TokenEnforcer, TokenEnforcerTokenizerData

 from .config import (
    Fp8QuantizationConfig,
--- a/llama_stack/providers/inline/inference/meta_reference/parallel_utils.py
+++ b/llama_stack/providers/inline/inference/meta_reference/parallel_utils.py
@ -28,13 +28,13 @@ from fairscale.nn.model_parallel.initialize import (
    get_model_parallel_src_rank,
 )

-from llama_stack.apis.inference import ChatCompletionRequest, CompletionRequest
-
 from pydantic import BaseModel, Field

 from torch.distributed.launcher.api import elastic_launch, LaunchConfig
 from typing_extensions import Annotated

+from llama_stack.apis.inference import ChatCompletionRequest, CompletionRequest
+
 from .generation import TokenResult


--- a/llama_stack/providers/inline/inference/meta_reference/quantization/loader.py
+++ b/llama_stack/providers/inline/inference/meta_reference/quantization/loader.py
@ -21,13 +21,13 @@ from llama_models.llama3.api.args import ModelArgs
 from llama_models.llama3.reference_impl.model import Transformer, TransformerBlock
 from llama_models.sku_list import resolve_model

-from llama_stack.apis.inference import QuantizationType
-
 from termcolor import cprint
 from torch import nn, Tensor

 from torchao.quantization.GPTQ import Int8DynActInt4WeightLinear

+from llama_stack.apis.inference import QuantizationType
+
 from ..config import MetaReferenceQuantizedInferenceConfig