Oossa

Helion accelera il backend lineare di vLLM

vLLM integra un backend lineare basato su Helion che ottimizza automaticamente i kernel di moltiplicazione matriciale, aumentando il throughput fino al 10% sulle GPU Hopper.

BreveOossaPubblicato da Oossa: 1 min di lettura

Il framework di inferenza vLLM ha integrato Helion, un DSL per kernel nativo di PyTorch, nel proprio backend lineare. Helion consente a un singolo kernel GEMM di gestire diverse varianti algoritmiche e seleziona automaticamente la configurazione più veloce per ogni forma. Sulle GPU NVIDIA Hopper, il nuovo backend supera i kernel predefiniti CUTLASS e DeepGEMM di vLLM, offrendo miglioramenti costanti nelle prestazioni end-to-end e un aumento del throughput superiore al 10% per alcuni modelli.

Perché conta

Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Hopper possono ottenere inferenze più rapide senza dover scrivere kernel personalizzati.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.