La libreria ggml‑org/llama.cpp ha rilasciato la versione b11475 il 7 ottobre 2026. L’aggiornamento corregge un bug nel backend Metal (GPU Apple): un’operazione combinata MUL_MAT+ADD selezionava la matrice residua sbagliata, producendo risultati errati nei modelli che eseguono più moltiplicazioni di matrici in un singolo passaggio. La correzione fa sì che l’encoder selezioni l’operando giusto e ripristina risultati accurati sulle GPU Metal.
Perché conta
Gli sviluppatori che usano llama.cpp sulle GPU Apple potranno ottenere risultati affidabili dai modelli, invece delle probabilità uniformi che si verificavano in precedenza.