Oossa

Helion ger vLLM snabbare inferens på Hopper-GPU:er

vLLM har nu en Helion-baserad linjär backend som autotunar matrismultiplikationskärnor och ger upp till 10 % högre genomströmning på Hopper-GPU:er.

NotisOossaPublicerad av Oossa: 1 min läsning

Inferensramverket vLLM har integrerat Helion, ett PyTorch-anpassat DSL för kärnor, i sin linjära backend. Helion låter en och samma GEMM-kärna täcka flera algoritmvarianter och väljer automatiskt den snabbaste konfigurationen för varje form. På NVIDIA Hopper-GPU:er presterar den nya backendlösningen bättre än vLLM:s standardkärnor CUTLASS och DeepGEMM, med jämnt högre hastighet från början till slut och mer än 10 % högre genomströmning för vissa modeller.

Varför det spelar roll

Utvecklare som kör stora språkmodeller på Hopper-GPU:er kan få snabbare inferens utan att behöva skriva egna kärnor.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.