Il framework di inferenza vLLM ha integrato Helion, un DSL per kernel nativo di PyTorch, nel proprio backend lineare. Helion consente a un singolo kernel GEMM di gestire diverse varianti algoritmiche e seleziona automaticamente la configurazione più veloce per ogni forma. Sulle GPU NVIDIA Hopper, il nuovo backend supera i kernel predefiniti CUTLASS e DeepGEMM di vLLM, offrendo miglioramenti costanti nelle prestazioni end-to-end e un aumento del throughput superiore al 10% per alcuni modelli.
Perché conta
Gli sviluppatori che eseguono modelli linguistici di grandi dimensioni su GPU Hopper possono ottenere inferenze più rapide senza dover scrivere kernel personalizzati.