vllm.model_executor.models.llama_eagle ¶
Classes:
LlamaDecoderLayer ¶
Bases: LlamaDecoderLayer
Methods:
-
get_quant_config–Use drafter's quantization config instead of verifier's.
Source code in vllm/model_executor/models/llama_eagle.py
get_quant_config(vllm_config) ¶
Use drafter's quantization config instead of verifier's.