Oossa

Helion çekirdeği, vLLM’de çıkarımı hızlandırıyor

vLLM’ye eklenen Helion tabanlı doğrusal arka uç, matris çarpımı çekirdeklerini otomatik olarak ayarlıyor. Hopper GPU’larda verimi %10’a kadar artırıyor.

Kısa haberOossaOossa yayın tarihi: 1 dk okuma

vLLM çıkarım çerçevesi, PyTorch’a özgü bir çekirdek DSL’i olan Helion’u doğrusal arka ucuna entegre etti. Helion, tek bir GEMM çekirdeğinin birden fazla algoritma varyantını desteklemesini sağlıyor ve her girdi boyutu için en hızlı yapılandırmayı otomatik olarak seçiyor. NVIDIA Hopper GPU’larda yeni arka uç, vLLM’nin varsayılan CUTLASS ve DeepGEMM çekirdeklerinden daha iyi performans gösteriyor; uçtan uca hızda tutarlı kazanımlar ve bazı modellerde verimde %10’un üzerinde artış sunuyor.

Neden önemli

Hopper GPU’larda büyük dil modelleri çalıştıran geliştiriciler, özel çekirdekler yazmadan daha hızlı çıkarım elde edebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.