Oossa

Helion-kernel versnelt lineaire backend van vLLM

vLLM bevat nu een op Helion gebaseerde lineaire backend die matrixvermenigvuldigingskernels automatisch afstelt. Dat levert op Hopper-GPU’s tot 10% meer doorvoer op.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Het vLLM-inferentieraamwerk heeft Helion, een PyTorch-native DSL voor kernels, geïntegreerd in zijn lineaire backend. Met Helion kan één GEMM-kernel verschillende algoritmevarianten afhandelen en automatisch voor elke vorm de snelste configuratie kiezen. Op NVIDIA Hopper-GPU’s presteert de nieuwe backend beter dan de standaardkernels CUTLASS en DeepGEMM van vLLM. Dat zorgt voor consistente snelheidswinst van begin tot eind en voor sommige modellen voor meer dan 10% extra doorvoer.

Waarom het ertoe doet

Ontwikkelaars die grote taalmodellen draaien op Hopper-GPU’s kunnen profiteren van snellere inferentie zonder zelf kernels te hoeven schrijven.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.