Oossa

Helion erweitert vLLM-Backend und beschleunigt die Inferenz

vLLM bietet jetzt ein lineares Backend auf Helion-Basis, das Matrixmultiplikations-Kernels automatisch abstimmt. Auf Hopper-GPUs steigt der Durchsatz dadurch um bis zu 10 Prozent.

KurzmeldungOossaVon Oossa veröffentlicht: 1 Min. Lesezeit

Das Inferenz-Framework vLLM hat Helion, eine PyTorch-native DSL für Kernels, in sein lineares Backend integriert. Mit Helion kann ein einzelner GEMM-Kernel mehrere Algorithmusvarianten abdecken und automatisch für jede Form die schnellste Konfiguration auswählen. Auf NVIDIA Hopper-GPUs übertrifft das neue Backend die standardmäßig verwendeten CUTLASS- und DeepGEMM-Kernels von vLLM. Es sorgt durchgängig für höhere Geschwindigkeit und steigert den Durchsatz bei einigen Modellen um mehr als 10 Prozent.

Warum es wichtig ist

Wer große Sprachmodelle auf Hopper-GPUs betreibt, kann die Inferenz beschleunigen, ohne eigene Kernels schreiben zu müssen.

Quellen und Referenzen

1 Quellen
  1. PyTorchOriginalquelle lesen

Zuletzt aktualisiert: ·Markdown

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.