llama.cpp projesi, b11474 sürümünü 2026‑10‑07 tarihinde yayımladı. Güncellemeyle, model çalıştırıcısına NextN adlı GLM5‑Next çoklu token tahmini (MTP) grafiği eklendi. Bu değişiklik, çıktı satırlarına ihtiyaç olmadığında gereksiz hesaplamaları atlayarak 4 tokenlık telafi gecikmesini 6.9 ms’den 0.33 ms’ye düşürüyor. Güncelleme ayrıca çıkarım sözleşmelerindeki sorunları gideriyor ve kısmi yinelemeli geri almaların işlenişini iyileştiriyor.
Neden önemli
Geliştiriciler artık llama.cpp modellerini daha hızlı çalıştırabiliyor. Çoklu token tahminine dayanan taslak tabanlı üretimde bu hız artışı özellikle belirgin.