ggml‑org ekibi, llama.cpp’nin b11480 sürümünü 2026‑10‑08 tarihinde yayımladı. Güncelleme, ana bellekte çalışan ve büyük modellerin GPU’larda daha hızlı çalışmasına yardımcı olan bir MoE uzmanları GPU önbelleği ekliyor. Değişiklikte Claude’un katkısı olduğu belirtiliyor ve yeni llama_moe_cache_ptr API’si kullanılıyor. macOS, iOS ve çeşitli Ubuntu yapılandırmaları için önceden derlenmiş ikili dosyalar indirilebiliyor.
Neden önemli
Geliştiriciler artık MoE modellerini tüketici GPU’larında daha verimli çalıştırabilir; böylece yapay zekâ projeleri için gereken donanım maliyeti düşer.