Le framework d’inférence vLLM a intégré Helion, un DSL de noyaux natif de PyTorch, à son backend linéaire. Helion permet à un même noyau GEMM de couvrir plusieurs variantes d’algorithmes et sélectionne automatiquement la configuration la plus rapide pour chaque forme de tenseur. Sur les GPU NVIDIA Hopper, le nouveau backend surpasse les noyaux CUTLASS et DeepGEMM par défaut de vLLM : il offre des gains de vitesse constants de bout en bout et améliore le débit de plus de 10 % pour certains modèles.
Pourquoi c'est important
Les développeurs qui exécutent de grands modèles de langage sur des GPU Hopper peuvent accélérer l’inférence sans écrire de noyaux personnalisés.