Araştırmacılar, kaç taslak belirteç üretileceğini ve hangi spekülasyon yönteminin kullanılacağını seçen, öğrenilmiş bir denetleyici olan APEX’i tanıttı. vLLM çıkarım motoruna entegre edilen sistem, Qwen3-8B dil modeliyle test edildi. Altı kıyaslama iş yükünde APEX, standart otoregresif çözümlemeye kıyasla 5,24 kata kadar hız artışı sağladı. APEX-Depth sürümü, 16’lık sabit n‑gram taslağına kıyasla boşa harcanan belirteçleri %41 azaltırken hız artışını 3,27 kat düzeyinde korudu.
Neden önemli
Geliştiriciler büyük dil modellerini daha hızlı ve düşük maliyetle çalıştırabilir; böylece gerçek zamanlı yapay zekâ özellikleri daha erişilebilir hale gelir.