# llama.cpp güncellemesi indeksleyici belleğini yarıya indiriyor

> b11372 sürümü, Qwen4exp indeksleyicisinin uzun bağlamlı çalıştırmalarda hız kaybı olmadan çok daha az RAM kullanmasını sağlıyor.

Oossa · 2026-10-03 · https://oossa.com/tr/llama-cpp-update-cuts-indexer-memory-use-in-half

ggml-org/llama.cpp projesi, b11372 sürümünü 3 Ekim 2026'da yayımladı. Güncelleme, Qwen4exp indeksleyicisini yeniden düzenleyerek her başlığın puanını ayrı ayrı hesaplamasını ve sonuçları doğrudan belleğe yazmasını sağlıyor. Böylece uzun bağlamlı grafiklerde belleğin en büyük bölümünü kullanan indeksleyici puan tamponları için gereken bellek yarıya iniyor. Değişiklik hesaplama hızını etkilemiyor; ayrıca CUDA, Metal ve Vulkan arka uçlarında yeni lightning indeksleyici desteği ekliyor.

## Gerçekler

- b11372 sürüm etiketi 3 Ekim 2026 Cumartesi günü yayımlandı
- İndeksleyici puanları için gereken bellek yaklaşık %50 azaltıldı

## Neden önemli

Uzun bağlamlı büyük dil modelleri çalıştıran geliştiriciler, aynı donanımda daha uzun istemler kullanabilecek.

## Kaynaklar ve referanslar

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Son güncelleme: 2026-10-03
