ggml-org/llama.cpp projesi, b11372 sürümünü 3 Ekim 2026'da yayımladı. Güncelleme, Qwen4exp indeksleyicisini yeniden düzenleyerek her başlığın puanını ayrı ayrı hesaplamasını ve sonuçları doğrudan belleğe yazmasını sağlıyor. Böylece uzun bağlamlı grafiklerde belleğin en büyük bölümünü kullanan indeksleyici puan tamponları için gereken bellek yarıya iniyor. Değişiklik hesaplama hızını etkilemiyor; ayrıca CUDA, Metal ve Vulkan arka uçlarında yeni lightning indeksleyici desteği ekliyor.
Neden önemli
Uzun bağlamlı büyük dil modelleri çalıştıran geliştiriciler, aynı donanımda daha uzun istemler kullanabilecek.