# Helion accelera il backend lineare di vLLM

> vLLM integra un backend lineare basato su Helion che ottimizza automaticamente i kernel di moltiplicazione matriciale, aumentando il throughput fino al 10% sulle GPU Hopper.

Oossa · 2026-10-02 · https://oossa.com/it/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

Il framework di inferenza vLLM ha integrato Helion, un DSL per kernel nativo di PyTorch, nel proprio backend lineare. Helion consente a un singolo kernel GEMM di gestire diverse varianti algoritmiche e seleziona automaticamente la configurazione più veloce per ogni forma. Sulle GPU NVIDIA Hopper, il nuovo backend supera i kernel predefiniti CUTLASS e DeepGEMM di vLLM, offrendo miglioramenti costanti nelle prestazioni end-to-end e un aumento del throughput superiore al 10% per alcuni modelli.

## I fatti

- Sulle GPU Hopper, il backend Helion supera CUTLASS e DeepGEMM, con un miglioramento del throughput superiore al 10% per alcuni carichi di lavoro.
- Il dispatch ibrido usa Helion per conteggi di token fino a 32 e passa ai kernel predefiniti per forme più grandi.

## Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Hopper possono ottenere inferenze più rapide senza dover scrivere kernel personalizzati.

## Fonti e riferimenti

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Ultimo aggiornamento: 2026-10-02
