Oossa

llama.cpp’ye GLM5‑Next için çoklu token tahmini ve hız iyileştirmeleri geldi

Açık kaynaklı LLM çalıştırıcısı, yeni GLM5‑Next MTP başlığını desteklemeye başladı; 4 tokenlık telafi süresi 0.33 ms’ye indi.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

llama.cpp projesi, b11474 sürümünü 2026‑10‑07 tarihinde yayımladı. Güncellemeyle, model çalıştırıcısına NextN adlı GLM5‑Next çoklu token tahmini (MTP) grafiği eklendi. Bu değişiklik, çıktı satırlarına ihtiyaç olmadığında gereksiz hesaplamaları atlayarak 4 tokenlık telafi gecikmesini 6.9 ms’den 0.33 ms’ye düşürüyor. Güncelleme ayrıca çıkarım sözleşmelerindeki sorunları gideriyor ve kısmi yinelemeli geri almaların işlenişini iyileştiriyor.

Neden önemli

Geliştiriciler artık llama.cpp modellerini daha hızlı çalıştırabiliyor. Çoklu token tahminine dayanan taslak tabanlı üretimde bu hız artışı özellikle belirgin.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.