Oossa

Helion accélère l’inférence dans vLLM grâce à un nouveau backend linéaire

vLLM intègre désormais un backend linéaire basé sur Helion, qui optimise automatiquement les noyaux de multiplication matricielle et augmente le débit jusqu’à 10 % sur les GPU Hopper.

BrèveOossaPublié par Oossa: 1 min de lecture

Le framework d’inférence vLLM a intégré Helion, un DSL de noyaux natif de PyTorch, à son backend linéaire. Helion permet à un même noyau GEMM de couvrir plusieurs variantes d’algorithmes et sélectionne automatiquement la configuration la plus rapide pour chaque forme de tenseur. Sur les GPU NVIDIA Hopper, le nouveau backend surpasse les noyaux CUTLASS et DeepGEMM par défaut de vLLM : il offre des gains de vitesse constants de bout en bout et améliore le débit de plus de 10 % pour certains modèles.

Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage sur des GPU Hopper peuvent accélérer l’inférence sans écrire de noyaux personnalisés.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.