# Helion çekirdeği, vLLM’de çıkarımı hızlandırıyor

> vLLM’ye eklenen Helion tabanlı doğrusal arka uç, matris çarpımı çekirdeklerini otomatik olarak ayarlıyor. Hopper GPU’larda verimi %10’a kadar artırıyor.

Oossa · 2026-10-02 · https://oossa.com/tr/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

vLLM çıkarım çerçevesi, PyTorch’a özgü bir çekirdek DSL’i olan Helion’u doğrusal arka ucuna entegre etti. Helion, tek bir GEMM çekirdeğinin birden fazla algoritma varyantını desteklemesini sağlıyor ve her girdi boyutu için en hızlı yapılandırmayı otomatik olarak seçiyor. NVIDIA Hopper GPU’larda yeni arka uç, vLLM’nin varsayılan CUTLASS ve DeepGEMM çekirdeklerinden daha iyi performans gösteriyor; uçtan uca hızda tutarlı kazanımlar ve bazı modellerde verimde %10’un üzerinde artış sunuyor.

## Gerçekler

- Helion arka ucu Hopper GPU’larda CUTLASS ve DeepGEMM’den daha iyi performans gösteriyor; belirli iş yüklerinde verimi %10’dan fazla artırıyor.
- Hibrit yönlendirme, token sayısı 32’ye kadar olduğunda Helion’u kullanıyor; daha büyük boyutlarda varsayılan çekirdeklere dönüyor.

## Neden önemli

Hopper GPU’larda büyük dil modelleri çalıştıran geliştiriciler, özel çekirdekler yazmadan daha hızlı çıkarım elde edebilir.

## Kaynaklar ve referanslar

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

Son güncelleme: 2026-10-02
