ggml‑org ekibi, llama.cpp’nin b11507 sürümünü 8 Ekim 2026’da yayımladı. Güncelleme, birden fazla GPU’ya dağıtılabilen uzman karışımı (MoE) önbelleği desteği ekliyor. Böylece geliştiriciler, tüm bileşenleri tek bir ekran kartına sığdırmak zorunda kalmadan daha büyük MoE modellerini çalıştırabiliyor. Sürümde ayrıca macOS, iOS ve CUDA 12.8 desteği içeren çeşitli Linux yapılandırmaları için yeni ikili paketler bulunuyor.
Neden önemli
Geliştiriciler artık çoklu GPU sistemlerinde daha büyük ve yetenekli yapay zekâ modellerini çalıştırabilir; böylece kişisel donanımlarla yapılabileceklerin kapsamı genişler.