Skip to content

vllm.models.qwen4_exp.amd

Modules:

  • hyperconnection

    HyperConnection (Gated Residual) utilities for the AMD model variant.

  • indexer_qsa

    Qwen4Exp weight-free QSA indexer.

  • low_latency_gemm

    Qwen4Exp low-latency GEMM hook for AMD ROCm.

  • model

    Inference-only Qwen4Exp model.

  • model_state

    Model-runner state for Qwen4Exp PLE inputs.

  • mtp

    Inference-only Qwen4Exp MTP (Multi-Token Predictor) model.

  • ops

    AMD ROCm Qwen4Exp kernels; import leaf modules directly.

  • ple_layer

    GPU-resident Qwen4Exp position-learning enhancement layers.

  • qsa

    AMD ROCm QSA owner with Triton kernels.