Oossa

llama.cpp güncellemesi indeksleyici belleğini yarıya indiriyor

b11372 sürümü, Qwen4exp indeksleyicisinin uzun bağlamlı çalıştırmalarda hız kaybı olmadan çok daha az RAM kullanmasını sağlıyor.

Kısa haberOossaOossa yayın tarihi: 1 dk okuma

ggml-org/llama.cpp projesi, b11372 sürümünü 3 Ekim 2026'da yayımladı. Güncelleme, Qwen4exp indeksleyicisini yeniden düzenleyerek her başlığın puanını ayrı ayrı hesaplamasını ve sonuçları doğrudan belleğe yazmasını sağlıyor. Böylece uzun bağlamlı grafiklerde belleğin en büyük bölümünü kullanan indeksleyici puan tamponları için gereken bellek yarıya iniyor. Değişiklik hesaplama hızını etkilemiyor; ayrıca CUDA, Metal ve Vulkan arka uçlarında yeni lightning indeksleyici desteği ekliyor.

Neden önemli

Uzun bağlamlı büyük dil modelleri çalıştıran geliştiriciler, aynı donanımda daha uzun istemler kullanabilecek.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.