Il team ggml-org ha pubblicato la versione b11507 di llama.cpp l'8 ottobre 2026. L'aggiornamento aggiunge il supporto per una cache mixture-of-experts (MoE) distribuita su più GPU. Gli sviluppatori possono così eseguire modelli MoE più grandi senza doverli caricare interamente su una sola scheda. La versione include anche nuovi pacchetti binari per macOS, iOS e diverse configurazioni Linux, tra cui il supporto per CUDA 12.8.
Perché conta
Gli sviluppatori possono ora eseguire modelli di IA più grandi e capaci su sistemi con più GPU, ampliando ciò che è possibile fare con l'hardware personale.