# Helion accélère l’inférence dans vLLM grâce à un nouveau backend linéaire

> vLLM intègre désormais un backend linéaire basé sur Helion, qui optimise automatiquement les noyaux de multiplication matricielle et augmente le débit jusqu’à 10 % sur les GPU Hopper.

Oossa · 2026-10-02 · https://oossa.com/fr/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

Le framework d’inférence vLLM a intégré Helion, un DSL de noyaux natif de PyTorch, à son backend linéaire. Helion permet à un même noyau GEMM de couvrir plusieurs variantes d’algorithmes et sélectionne automatiquement la configuration la plus rapide pour chaque forme de tenseur. Sur les GPU NVIDIA Hopper, le nouveau backend surpasse les noyaux CUTLASS et DeepGEMM par défaut de vLLM : il offre des gains de vitesse constants de bout en bout et améliore le débit de plus de 10 % pour certains modèles.

## Les faits

- Le backend Helion surpasse CUTLASS et DeepGEMM sur les GPU Hopper, avec un gain de débit supérieur à 10 % pour certaines charges de travail.
- Le mécanisme de répartition hybride utilise Helion jusqu’à 32 jetons et revient aux noyaux par défaut pour les formes plus grandes.

## Pourquoi c'est important

Les développeurs qui exécutent de grands modèles de langage sur des GPU Hopper peuvent accélérer l’inférence sans écrire de noyaux personnalisés.

## Sources et références

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Dernière mise à jour: 2026-10-02
