vLLM çıkarım çerçevesi, PyTorch’a özgü bir çekirdek DSL’i olan Helion’u doğrusal arka ucuna entegre etti. Helion, tek bir GEMM çekirdeğinin birden fazla algoritma varyantını desteklemesini sağlıyor ve her girdi boyutu için en hızlı yapılandırmayı otomatik olarak seçiyor. NVIDIA Hopper GPU’larda yeni arka uç, vLLM’nin varsayılan CUTLASS ve DeepGEMM çekirdeklerinden daha iyi performans gösteriyor; uçtan uca hızda tutarlı kazanımlar ve bazı modellerde verimde %10’un üzerinde artış sunuyor.
Neden önemli
Hopper GPU’larda büyük dil modelleri çalıştıran geliştiriciler, özel çekirdekler yazmadan daha hızlı çıkarım elde edebilir.