# llama.cpp’ye GLM5‑Next için çoklu token tahmini ve hız iyileştirmeleri geldi

> Açık kaynaklı LLM çalıştırıcısı, yeni GLM5‑Next MTP başlığını desteklemeye başladı; 4 tokenlık telafi süresi 0.33 ms’ye indi.

Oossa · 2026-10-07 · https://oossa.com/tr/llama-cpp-adds-glm5-next-multi-token-prediction-and-speed-tweaks

llama.cpp projesi, b11474 sürümünü 2026‑10‑07 tarihinde yayımladı. Güncellemeyle, model çalıştırıcısına NextN adlı GLM5‑Next çoklu token tahmini (MTP) grafiği eklendi. Bu değişiklik, çıktı satırlarına ihtiyaç olmadığında gereksiz hesaplamaları atlayarak 4 tokenlık telafi gecikmesini 6.9 ms’den 0.33 ms’ye düşürüyor. Güncelleme ayrıca çıkarım sözleşmelerindeki sorunları gideriyor ve kısmi yinelemeli geri almaların işlenişini iyileştiriyor.

## Gerçekler

- b11474 sürümü 2026‑10‑07 tarihinde yayımlandı ("Wed Oct 07 2026 15:42:20 GMT+0200")
- 4 tokenlık telafi gecikmesi 6.9 ms’den 0.33 ms’ye düştü

## Neden önemli

Geliştiriciler artık llama.cpp modellerini daha hızlı çalıştırabiliyor. Çoklu token tahminine dayanan taslak tabanlı üretimde bu hız artışı özellikle belirgin.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11474](https://github.com/ggml-org/llama.cpp/releases/tag/b11474) – llama.cpp, 2026-10-07

Son güncelleme: 2026-10-07
