Oossa

APEX, Qwen3-8B’nin çözümlemesini 5,2 kata kadar hızlandırıyor

Yeni APEX denetleyicisi, Qwen3-8B modelinin çıkarım süresini 5,24 kata kadar kısaltırken boşa harcanan taslak belirteçleri %41 azaltıyor.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Araştırmacılar, kaç taslak belirteç üretileceğini ve hangi spekülasyon yönteminin kullanılacağını seçen, öğrenilmiş bir denetleyici olan APEX’i tanıttı. vLLM çıkarım motoruna entegre edilen sistem, Qwen3-8B dil modeliyle test edildi. Altı kıyaslama iş yükünde APEX, standart otoregresif çözümlemeye kıyasla 5,24 kata kadar hız artışı sağladı. APEX-Depth sürümü, 16’lık sabit n‑gram taslağına kıyasla boşa harcanan belirteçleri %41 azaltırken hız artışını 3,27 kat düzeyinde korudu.

Neden önemli

Geliştiriciler büyük dil modellerini daha hızlı ve düşük maliyetle çalıştırabilir; böylece gerçek zamanlı yapay zekâ özellikleri daha erişilebilir hale gelir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.