ggml-org ekibi, llama.cpp’nin b11534 sürümünü 2026-10-09 tarihinde yayımladı. Güncelleme, durum anlık görüntülerinin kopyalarını tekrarlamalı önbelleğe birleştiriyor ve K = 1 olduğunda (spekülatif olmayan kod çözme durumu) fazladan CUDA kopyalarını kaldırıyor. Değişiklik yalnızca CUDA arka ucuyla sınırlı; CPU ve Vulkan derlemeleri etkilenmiyor. macOS, iOS ve çeşitli Ubuntu sürümleri için önceden derlenmiş ikili dosyalar indirilebilir durumda.
CUDA sürümünü kullananlar, GPU bellek trafiğinde hafif bir azalma görebilir. Bu da desteklenen donanımlarda hızı artırabilir.
Neden önemli
Kütüphane GPU’da artık daha az veri taşıdığından, CUDA kullanıcıları daha hızlı çıkarım elde edebilir.