Das Inferenz-Framework vLLM hat Helion, eine PyTorch-native DSL für Kernels, in sein lineares Backend integriert. Mit Helion kann ein einzelner GEMM-Kernel mehrere Algorithmusvarianten abdecken und automatisch für jede Form die schnellste Konfiguration auswählen. Auf NVIDIA Hopper-GPUs übertrifft das neue Backend die standardmäßig verwendeten CUTLASS- und DeepGEMM-Kernels von vLLM. Es sorgt durchgängig für höhere Geschwindigkeit und steigert den Durchsatz bei einigen Modellen um mehr als 10 Prozent.
Warum es wichtig ist
Wer große Sprachmodelle auf Hopper-GPUs betreibt, kann die Inferenz beschleunigen, ohne eigene Kernels schreiben zu müssen.