# Helion erweitert vLLM-Backend und beschleunigt die Inferenz

> vLLM bietet jetzt ein lineares Backend auf Helion-Basis, das Matrixmultiplikations-Kernels automatisch abstimmt. Auf Hopper-GPUs steigt der Durchsatz dadurch um bis zu 10 Prozent.

Oossa · 2026-10-02 · https://oossa.com/de/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

Das Inferenz-Framework vLLM hat Helion, eine PyTorch-native DSL für Kernels, in sein lineares Backend integriert. Mit Helion kann ein einzelner GEMM-Kernel mehrere Algorithmusvarianten abdecken und automatisch für jede Form die schnellste Konfiguration auswählen. Auf NVIDIA Hopper-GPUs übertrifft das neue Backend die standardmäßig verwendeten CUTLASS- und DeepGEMM-Kernels von vLLM. Es sorgt durchgängig für höhere Geschwindigkeit und steigert den Durchsatz bei einigen Modellen um mehr als 10 Prozent.

## Die Fakten

- Das Helion-Backend übertrifft auf Hopper-GPUs CUTLASS und DeepGEMM; bei bestimmten Workloads steigt der Durchsatz um mehr als 10 Prozent.
- Bei der hybriden Auswahl kommt Helion bei Tokenzahlen bis zu 32 zum Einsatz; bei größeren Formen greift das System auf die Standard-Kernels zurück.

## Warum es wichtig ist

Wer große Sprachmodelle auf Hopper-GPUs betreibt, kann die Inferenz beschleunigen, ohne eigene Kernels schreiben zu müssen.

## Quellen und Referenzen

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Zuletzt aktualisiert: 2026-10-02
