Inferensramverket vLLM har integrerat Helion, ett PyTorch-anpassat DSL för kärnor, i sin linjära backend. Helion låter en och samma GEMM-kärna täcka flera algoritmvarianter och väljer automatiskt den snabbaste konfigurationen för varje form. På NVIDIA Hopper-GPU:er presterar den nya backendlösningen bättre än vLLM:s standardkärnor CUTLASS och DeepGEMM, med jämnt högre hastighet från början till slut och mer än 10 % högre genomströmning för vissa modeller.
Varför det spelar roll
Utvecklare som kör stora språkmodeller på Hopper-GPU:er kan få snabbare inferens utan att behöva skriva egna kärnor.